Kleine gemiddelde effecten
Een analyse van 39 gerandomiseerde studies vond kleine gemiddelde effecten voor depressieve en angstklachten ten opzichte van controlegroepen.
Sohn et al. →Mastery Psychology Research
Een levende kennislaag over AI in coaching en psychologie. We maken onderscheid tussen effectonderzoek, technische prestaties, veiligheid en aannames die nog getoetst moeten worden.
Laatst inhoudelijk bijgewerkt · 5 september 2026Stand van de wetenschap
Onderzoek naar mentale-gezondheidschatbots vindt gemiddeld kleine verbeteringen voor sommige veelvoorkomende klachten. Het bewijs is heterogeen en zegt nog weinig over gelijkwaardigheid aan professionele behandeling.
Een analyse van 39 gerandomiseerde studies vond kleine gemiddelde effecten voor depressieve en angstklachten ten opzichte van controlegroepen.
Sohn et al. →Veertien gerandomiseerde studies lieten gemiddeld een positief effect zien, met brede marges en grote verschillen tussen toepassingen.
Zhang et al. →De generatieve chatbot liet meer symptoomverbetering zien dan een wachtlijst. De studie vergeleek niet met behandeling door een psycholoog.
Heinz et al. →Onderzoek naar digitale CGT suggereert dat menselijke begeleiding bij depressieve klachten toegevoegde waarde kan hebben voor uitkomsten en therapietrouw.
Kambeitz-Ilankovic et al. →In gesimuleerde situaties van oplopende suïcidaliteit voldeed geen van 29 onderzochte chatbots aan alle strikte criteria voor een adequate reactie.
Pichowicz et al. →De WHO benadrukt transparantie, gegevensbescherming, menselijke verantwoordelijkheid en voortdurende monitoring na ingebruikname.
WHO guidance →Belangrijk: deze selectie is geen systematische review door Mastery Psychology. De gekoppelde overzichtspagina bespreekt opzet, beperkingen en interpretatie uitgebreider. Een lagere vragenlijstscore is niet automatisch bewijs dat een vastgestelde stoornis veilig en duurzaam is behandeld.
Researchagenda
Welke doelen en klachten verbeteren, voor wie, ten opzichte van welke controlegroep en hoe duurzaam is het effect?
Hoe beoordelen gebruikers luisteren, timing, interrupties, stiltes, misverstanden, warmte en gepaste tegenspraak?
Hoe vaak mist of overschat het systeem risico, en werkt menselijke opschaling in gesimuleerde én echte situaties?
Welke informatie heeft een psycholoog nodig om gericht bij te sturen zonder onnodige toegang tot privégesprekken?
Begrijpen gebruikers welke gegevens worden gebruikt, kunnen zij het geheugen corrigeren en ervaren zij werkelijk zeggenschap?
Verlaagt hybride begeleiding drempels en wachttijd zonder zwaardere zorg uit te stellen of ongelijkheid te vergroten?
Publicatiestandaard
Bij iedere toekomstige pilot willen we vooraf het doel, de doelgroep, uitsluitingscriteria, uitkomstmaten en veiligheidsprocedure beschrijven. Positieve uitkomsten mogen niet los worden gepubliceerd van uitval, ongewenste effecten en beperkingen.
Technische kwaliteit en psychologische effectiviteit zijn afzonderlijke vragen. Een vloeiende stem kan de ervaring verbeteren, maar bewijst op zichzelf geen therapeutisch effect. Omgekeerd maakt goede psychologische inhoud een onveilig systeem niet verantwoord.
Lees onze publieke positie ↗Productonderzoek