AI na saúde mental: o que as evidências mostram e onde estão os limites

Sobre inteligência artificial e saúde mental há dois relatos igualmente simplificados circulando. Um diz que a terapia de IA está ao virar da esquina e vai substituir psicólogos. O outro diz que é tudo fumaça perigosa e que não há nada para discutir.
A pesquisa dos últimos anos também não corrobora, pois há evidências de eficácia em contextos confinados e, ao mesmo tempo, evidências sólidas de falhas graves em situações clínicas críticas, vale a pena olhar para os estudos em particular, pois a conclusão prática para aqueles que se exercitam é bastante clara e não é "tudo ou nada".
TL;DR
- O primeiro ensaio randomizado de um chatbot de IA geracional para tratamento de saúde mental (Therabot, 210 participantes) mostrou reduções sintomáticas da lista de espera: 51% na depressão, 31% na ansiedade generalizada, 19% na preocupação com a imagem corporal.
- Os próprios autores concluem que nenhum agente generativo de IA está pronto para operar de forma autônoma em saúde mental, e o ensaio teve supervisão clínica humana.
- Uma meta-análise de agentes conversacionais (estudos 35, 15 ensaios randomizados) encontrou efeitos moderados sobre os sintomas depressivos (g = 0,64) e desconforto (g = 0,70).
- Em contraste, um estudo 2025 mostrou que os modelos de linguagem expressam estigma em relação a quadros como esquizofrenia e dependência de álcool, e falhou em reconhecer crises, até mesmo encorajando a ideação delirante.
- O lugar onde a evidência e o senso comum coincidem hoje: ferramenta de suporte profissional, não como substituto do tratamento.
Por Que Importa
Seus pacientes já estão usando IA. Eles dizem coisas para um chatbot às 3:00 da manhã, pedir interpretações de sonhos, consultar se o que eles sentem é "normal" antes ou depois de falar com você. Não é uma possibilidade futura, é comportamento atual.
Saber o que a pesquisa mostra permite-lhe duas coisas: responder com julgamento quando um paciente lhe pede, e decidir com seu próprio julgamento quais ferramentas você vai incorporar em sua prática e quais você não vai.
O que as provas dizem
O primeiro julgamento aleatório
Em março de 2025, Heinz et al. publicaram em NEJM AI o primeiro ensaio controlado randomizado de um chatbot geracional de IA projetado para tratamento de saúde mental (Therabot, desenvolvido em Dartmouth).
O desenho: 210 adultos com sintomas clinicamente significativos de depressão maior, ansiedade generalizada ou alto risco de transtorno alimentar. 106 receberam acesso ao aplicativo por quatro semanas, com quatro semanas adicionais de uso opcional; 104 permaneceram na lista de espera.
Resultados vs. controle:
- Depressão: redução média dos sintomas de 51%.
- Ansiedade generalizada: 31%.
- Peso e imagem corporal: 19%.
Os participantes utilizaram o aplicativo por um total de cerca de seis horas ao longo do ensaio, aproximadamente o equivalente a oito sessões.
Importante
O comparador era lista de espera, não terapia com um profissional. Isso significa que o estudo mostra que o chatbot é melhor do que receber nada, não comparável ao tratamento psicológico. É uma distinção central e geralmente é perdido em manchetes.
Além disso, o ensaio foi conduzido com supervisão clínica: havia pessoas revisando as interações e a capacidade de intervir, e os próprios pesquisadores destacaram que nenhum agente generativo de IA está atualmente em condições de operar de forma totalmente autônoma na saúde mental.
A evidência acumulada de chatbots
Antes de Therabot já havia um corpo de pesquisa sobre agentes conversacionais, principalmente baseado em regras ou roteiros (não generativos de IA). A meta-análise de Li et al. (2023), em npj Digital Medicine, revisou estudos 35 e incluiu 15 ensaios randomizados.
Verificou reduções significativas em:
- Sintomas depressivos: g = 0,64 (IC 95% [0,17; 1,12]).
- Dificuldade psicológica: g = 0,70 (IC 95% [0,18; 1,22]).
São efeitos moderados, com amplos intervalos de confiança, em intervenções tipicamente curtas e limiar de baixo acesso.
O outro lado: falhas em situações críticas
Moore et al. (2025) apresentaram um estudo na conferência ACM FAccT que avaliou cinco modelos de linguagem e cinco bots comerciais de "terapia" contra cenários clínicos.
As conclusões são preocupantes:
- Modelos expressos mais estigmas para a dependência de álcool e esquizofrenia do que para a depressão, e que estigma não melhorou em modelos mais novos ou maiores.
- Diante de cenários de crise, os modelos falharam em reconhecer o risco.
- Em vários casos eles acompanharam o pensamento delirante em vez de contrastá-lo com a realidade, o que contradiz a prática clínica estabelecida.
A conclusão dos autores é explícita: essas falhas impedem que os modelos de linguagem substituam de forma segura os profissionais de saúde mental.
O que significa na sua prática clínica
- Eu distingui dois usos completamente diferentes. Uma coisa é a IA orientada para o paciente como um substituto para o tratamento (onde as evidências são incipientes e os riscos são documentados) e outra é a IA como uma ferramenta de suporte profissional: transcrição, esboço de notas, organização de informações clínicas. São debates separados e não devem ser misturados.
- Pergunte ativamente para o uso da IA. Se um paciente consulta um chatbot entre sessões, isso é material clínico: o que ele procura lá, o que ele encontra, o que ele não pode dizer.
- Seja claro sobre limites de crise. Se você trabalha com pacientes em risco, vale a pena explicar que um chatbot não é um recurso de emergência e anotar quais deles são.
- Aplicar os mesmos critérios de confidencialidade que qualquer outra ferramenta. Jogar material clínico identificável em um chatbot de propósito geral envolve compartilhar dados de saúde com terceiros, com consequências legais específicas. Nós desenvolvemos isso em ChatGPT e dados clínicos.
- Nenhum IA substitui o seu julgamento. Um rascunho de nota é um rascunho: você revê-lo, corrigi-lo e assiná-lo você, que estava na sessão.
Conselho
Quando um paciente diz "Eu pedi a IA", geralmente há algo mais interessante por trás disso: por que era mais fácil perguntar a uma máquina. Essa é a conversa que vale, muito mais do que avaliar se a resposta que recebeu estava correta.
Mortes e limitações
- Um julgamento não faz um corpo de evidências. O estudo de Therabot é um marco metodológico, mas é apenas um, breve, com o controle da lista de espera e na população que, na maioria das vezes, não recebeu outro tratamento.
- O seguimento é curto. Quatro a oito semanas não dizem nada sobre sustentar resultados de médio prazo.
- Os sistemas avaliados não são os sistemas comerciais. Therabot foi desenvolvido e supervisionado por uma equipe acadêmica; a maioria dos aplicativos disponíveis não têm esse design nem essa supervisão.
- A tecnologia muda mais rápido do que a pesquisa. Qualquer achado sobre modelos específicos envelhece em meses, embora o estudo de Moore et al. sugira que certas falhas não são resolvidas sozinhas com modelos mais recentes.
- Não há quase nenhuma evidência na população espanhola ou latino-americana.
Em resumo
As evidências disponíveis traçam uma linha razoavelmente afiada. Há sinais de que as ferramentas de conversação bem projetadas e supervisionadas podem ajudar pessoas que hoje não têm acesso a nada. E há fortes evidências de que os modelos atuais falham exatamente onde os mais caros falham: crise, risco, imagens graves.
Portanto, nossa posição sobre IA clínica é a mesma desde o primeiro dia: o trabalho terapêutico é seu e não é delegado. O que pode ser delegado é o fardo administrativo que rouba tempo e atenção. Brauni prepara o rascunho da nota da sessão, com seus dados acomodados com segurança e não utilizados para treinar modelos, para que você decida o que está registrado.
Referências
- Heinz, M. V., Mackin, D. M., Trudeau, B. M., Bhattacharya, S., Wang, Y., Banta, H. A., ... Jacobson, N. C. (2025). Randomized trial of a generative AI chatbot for mental health treatment. NEJM AI, 2(4). doi.org/10.1056/AIoa2400802
- Li, H., Zhang, R., Lee, Y. C., Kraut, R. E., & Mohr, D. C. (2023). Systematic review and meta-analysis of AI-based conversational agents for promoting mental health and well-being. npj Digital Medicine, 6, 236. doi.org/10.1038/s41746-023-00979-5
- Moore, J., Grabb, D., Agnew, W., Klyman, K., Chancellor, S., Ong, D. C., & Haber, N. (2025). Expressing stigma and inappropriate responses prevents LLMs from safely replacing mental health providers. Proceedings of the 2025 ACM Conference on Fairness, Accountability, and Transparency (FAccT '25). doi.org/10.1145/3715275.3732039
Teste Brauni gratuito durante 30 dias, sem cartão
Notas automáticas de sessão, prontuários digitais e muito mais.
Iniciar de graçaArtigos relacionados

Baseado em Evidências
Quantas sessões você precisa? Evidência de dose e frequência na terapia
Pesquisa dose-resposta mostra curvas de melhoria, intervalos de sessão ótimos e um achado desconfortável de frequência semanal. O que isso significa ao planejar tratamentos.

Baseado em Evidências
Tratamento do trauma: O que as evidências dizem sobre EMDR e TCC com foco em trauma
Uma rede de 90 ensaios e 6.560 pacientes comparou 22 tratamentos para estresse pós-traumático. O que o EMDR e o CCT centrado em trauma mostram, e o que significa ao escolher a abordagem.

Baseado em Evidências
A terapia online funciona como terapia cara a cara?
Meta-análise com milhares de pacientes comparar vídeo e psicoterapia face a face: resultados equivalentes e aliança terapêutica sem diferenças. O que isso implica para a sua prática clínica.