Pesquisadores desenvolvem método TOHA para detectar alucinações em modelos de IA

A IA inventa com a mesma confiança com que relata fatos
O desafio central das alucinações em modelos de linguagem é que elas são apresentadas com convicção absoluta, tornando difícil distinguir realidade de ficção.
Mark

Então esse TOHA consegue realmente dizer quando uma IA está inventando?

Mimi

Consegue identificar quando a resposta não tem respaldo nos dados fornecidos. Funciona analisando as estruturas internas do modelo, não comparando com fontes externas.

Luke

Mas espera — o artigo diz que o desempenho foi "semelhante ou superior" aos métodos existentes. Semelhante a quê, exatamente? Qual era a taxa de acerto?

Mimi

O artigo menciona benchmarks diferentes, mas não especifica números de precisão ou recall. Apenas que o TOHA se saiu bem.

Mark

E isso funciona mesmo com aquele sistema RAG, a recuperação aumentada?

Mimi

Sim, porque o problema não é só ter informações disponíveis — é o modelo decidir ignorá-las e inventar algo. O TOHA detecta quando isso acontece.

Luke

Mas quem testou isso na prática? Foram os próprios pesquisadores em um ambiente controlado, ou empresas reais já estão usando?

Mimi

Os testes foram feitos pelos pesquisadores em tarefas de perguntas e respostas e resumo de textos. A tecnologia está disponível publicamente agora, mas não há relato de adoção em larga escala.

Mark

Por que isso importa para bancos e seguradoras?

Mimi

Porque uma alucinação em um contrato ou em uma análise de risco pode custar muito dinheiro. Eles precisam saber quando confiar na IA e quando não confiar.

Luke

Entendo. Mas o artigo não diz se o TOHA foi testado em documentos jurídicos reais ou em dados financeiros reais. Pode funcionar perfeitamente em resumos de notícias e falhar completamente em contratos.

Mimi

É um ponto válido. O estudo prova que a técnica funciona, mas a aplicação em casos de uso críticos ainda é uma questão em aberto.

  • Modelos de IA continuam produzindo respostas inventadas com tom de certeza absoluta, mesmo quando recebem documentos e bases de dados como referência.
  • O problema persiste até em sistemas com recuperação aumentada por geração, considerados mais robustos — nenhuma arquitetura atual está imune às alucinações.
  • O TOHA analisa matrizes de atenção internas e calcula divergências entre o material original e a resposta gerada, sinalizando quando a IA se afastou dos fatos fornecidos.
  • O método exige menos exemplos de treinamento e menos poder computacional do que concorrentes como o SelfCheckGPT, sem sacrificar precisão.
  • Já disponível na biblioteca de código aberto SIRIN, o TOHA aponta para aplicação imediata em setores onde um erro de IA pode custar dinheiro ou reputação.

Há uma tensão fundamental nos sistemas de inteligência artificial contemporâneos: eles falam com a mesma convicção quando inventam e quando informam. Pesquisadores da Skoltech e do Sberbank desenvolveram o TOHA, uma técnica que examina as estruturas internas dos modelos de linguagem para distinguir o que foi gerado com respaldo do que foi simplesmente fabricado. A solução chega num momento em que setores como o bancário, o jurídico e o de seguros buscam formas de confiar em sistemas que, por ora, ainda mentem com elegância.

Um problema persistente assombra a inteligência artificial moderna: modelos de linguagem inventam respostas com a mesma confiança com que relatam fatos verificáveis. Pesquisadores da Skoltech e do Centro de Inteligência Artificial Prática do Sberbank desenvolveram o TOHA, uma técnica projetada para identificar exatamente quando isso acontece — quando um modelo gera informações sem qualquer respaldo nos dados que recebeu.

O fenômeno é particularmente insidioso porque a IA não hesita ao fabricar. Mesmo sistemas equipados com recuperação aumentada por geração, que recebem informações adicionais antes de responder, continuam vulneráveis. O usuário raramente consegue distinguir o que é real do que foi inventado, e é justamente nessa lacuna que o TOHA intervém.

O método funciona examinando as matrizes de atenção — estruturas internas que o modelo usa para relacionar partes de um texto. Essas informações são convertidas em gráficos, e uma medida chamada MTop-Div quantifica a divergência entre o material original e a resposta produzida. Quanto maior a diferença, maior a probabilidade de alucinação. A abordagem dispensa um segundo modelo de IA para fazer a verificação e consome menos recursos computacionais do que concorrentes como o SelfCheckGPT, que exige a geração de múltiplas versões de uma mesma resposta para comparação.

Testado em tarefas de perguntas e respostas e em resumo de textos, o TOHA apresentou resultados comparáveis ou superiores aos métodos já estabelecidos, com a vantagem adicional de precisar de menos exemplos de treinamento. A técnica foi publicada nos Anais da 64ª Reunião Anual da Associação de Linguística Computacional e está disponível na biblioteca de código aberto SIRIN. Os autores veem aplicação imediata em bancos, escritórios jurídicos e seguradoras — ambientes onde uma resposta inventada pode ter consequências financeiras e reputacionais concretas.

Um problema persistente assombra os sistemas de inteligência artificial modernos: eles inventam respostas com a mesma confiança com que relatam fatos. Pesquisadores da Skoltech e do Centro de Inteligência Artificial Prática do Sberbank, braço de IA do banco russo Sber, desenvolveram uma técnica chamada TOHA para identificar quando um modelo de linguagem está alucinando — gerando informações que não existem nos dados que lhe foram fornecidos.

Essas alucinações são o calcanhar de Aquiles da confiabilidade em IA. Um modelo pode receber documentos, bases de dados corporativas ou qualquer material de referência e, ainda assim, produzir respostas que não têm qualquer respaldo naquele material. O problema é particularmente insidioso porque a IA apresenta essas invenções com tom de certeza absoluta, tornando difícil para o usuário distinguir o que é real do que foi fabricado. Mesmo sistemas que usam recuperação aumentada por geração — uma técnica em que a IA recebe informações adicionais antes de responder — continuam vulneráveis a esse tipo de erro.

O método TOHA funciona analisando o próprio mecanismo interno do modelo. Os pesquisadores examinaram as matrizes de atenção, estruturas que a IA usa para estabelecer relações entre diferentes partes de um texto, e converteram essas informações em gráficos. A partir daí, calcularam uma medida chamada MTop-Div, que quantifica as diferenças entre a estrutura do material original e a resposta que o modelo produziu. Quanto maior essa divergência, mais provável que a resposta tenha sido inventada. A elegância da abordagem está em sua economia: não requer um segundo modelo de IA para detectar alucinações, nem depende de recursos computacionais excessivos.

Os pesquisadores testaram o TOHA em tarefas de perguntas e respostas, bem como em resumo de textos. Os resultados foram comparáveis ou superiores aos de métodos já estabelecidos. Uma vantagem crucial é o treinamento: enquanto algumas técnicas concorrentes exigem grandes volumes de exemplos ou pedem que o modelo gere múltiplas versões da mesma resposta para comparação posterior, o TOHA funciona com um conjunto menor de exemplos. Depois disso, essas informações podem ser aplicadas na avaliação de novas respostas. O SelfCheckGPT, um método existente que depende da geração de múltiplas respostas, demanda significativamente mais poder computacional. O TOHA alcançou resultados semelhantes sem esse processo repetitivo e custoso.

A técnica foi apresentada em um artigo publicado nos Anais da 64ª Reunião Anual da Associação de Linguística Computacional e já está disponível publicamente na biblioteca SIRIN, um projeto de código aberto desenvolvido pelos pesquisadores do Sberbank. Os autores acreditam que a tecnologia tem aplicação imediata em setores onde erros de IA representam riscos reais: bancos, firmas jurídicas e seguradoras. Nesses ambientes, uma resposta inventada pode custar dinheiro ou reputação. A questão agora é se essa solução conseguirá ganhar tração suficiente para se tornar padrão na indústria, ou se permanecerá como mais uma ferramenta especializada em um ecossistema cada vez mais fragmentado de técnicas de detecção.

Alucinações são respostas erradas ou totalmente inventadas pela inteligência artificial, sem respaldo em dados ou fontes concretas, mas apresentadas em tom de convicção e certeza
— Descrição do problema pelos pesquisadores
O TOHA alcançou resultados comparáveis ao SelfCheckGPT sem a necessidade de gerar múltiplas respostas para comparação
— Conclusão dos autores sobre eficiência computacional
Contact Us FAQ