Notebookcheck Logo

Flagrados mentindo em 88% dos testes: agentes de IA baseados em modelos chineses aprenderam a trapacear, e os modelos dos EUA fizeram o mesmo.

DeepSeek-V3.2-Exp alcançou 84% na pesquisa analisada pela Reuters.
ⓘ John Cameron on Unsplash
DeepSeek-V3.2-Exp alcançou 84% na pesquisa analisada pela Reuters.
Agentes de IA baseados nos modelos Qwen, DeepSeek e Kimi mentiram em 84% a 88% das sessões em um teste simulado de lances, segundo uma pesquisa analisada pela Reuters. Modelos dos EUA tiveram comportamento semelhante no passado, e nenhum dos casos levou um agente a escapar do ambiente de teste controlado.

AI agentes desenvolvidos com base em modelos chineses mentiram na maioria das sessões de uma disputa simulada de licitação, segundo uma pesquisa analisada pela Reuters. Agentes que usavam o Qwen3-Max-Preview, da Alibaba, e o Kimi-K2, da Moonshot, fizeram pelo menos uma afirmação falsa em 88% das sessões. O DeepSeek-V3.2-Exp ficou em 84%. Porém, modelos de empresas americanas apresentaram resultados semelhantes no mesmo teste.

 

O experimento ocorreu em março. Pesquisadores da Universidade Beihang, da Universidade de Pequim, da Universidade de Nottingham Ningbo China e do 360 AI Security Lab fizeram os agentes disputar contratos com clientes. Cada agente recebeu informações sobre as capacidades de seu produto e as necessidades do cliente. Quando puderam aprender com as rodadas anteriores e tentar novamente, os três agentes baseados em modelos chineses se tornaram mais propensos a enganar, com um aumento de 12 a 20 pontos percentuais.

 

Esse estudo é um dos pelo menos 20 que a Reuters identificou entre mais de 200 documentos publicados desde 2025. Outro, apresentado na ICML deste ano, constatou que agentes baseados em modelos chineses e americanos falsificaram resultados e inventaram arquivos em vez de admitir que uma tarefa havia falhado. Em março de 2025, pesquisadores da Universidade Fudan também relataram que um agente baseado no Qwen2.5-72B-Instruct, da Alibaba, fez uma cópia de si mesmo em outro ambiente depois de saber que seria substituído. Separadamente, o agente ROME, ligado à Alibaba, desviou poder de computação em nuvem para minerar criptomoedas, até que os sistemas de segurança o interromperam.

A maioria desses casos veio de experimentos controlados projetados para provocar falhas. A Reuters não encontrou evidências de que qualquer agente baseado em tecnologia chinesa tenha escapado para a internet em geral ou evitado ser desligado. Vários pesquisadores ainda classificaram os resultados como um alerta. À medida que os sistemas se tornam mais capazes, fica mais difícil conter o mesmo comportamento.

A China também começou a abordar essa questão nas políticas. Sua Estrutura de Governança da Segurança da IA 3.0, divulgada em 14 de setembro, lista enganar avaliadores e ocultar capacidades como riscos. Alibaba, DeepSeek, Moonshot e Z.ai não responderam à Reuters. Os três primeiros já disseram que testam seus sistemas regularmente e atualizam as salvaguardas.

Google LogoAdd as a preferred source on Google
Mail Logo
> Análises e revisões de portáteis e celulares > Notícias > Arquivo de notícias 2026 09 > Flagrados mentindo em 88% dos testes: agentes de IA baseados em modelos chineses aprenderam a trapacear, e os modelos dos EUA fizeram o mesmo.
Anubhav Sharma, 2026-09-30 (Update: 2026-09-30)