Flagrados mentindo em 88% dos testes: agentes de IA baseados em modelos chineses aprenderam a trapacear, e os modelos dos EUA fizeram o mesmo.

AI agentes desenvolvidos com base em modelos chineses mentiram na maioria das sessões de uma disputa simulada de licitação, segundo uma pesquisa analisada pela Reuters. Agentes que usavam o Qwen3-Max-Preview, da Alibaba, e o Kimi-K2, da Moonshot, fizeram pelo menos uma afirmação falsa em 88% das sessões. O DeepSeek-V3.2-Exp ficou em 84%. Porém, modelos de empresas americanas apresentaram resultados semelhantes no mesmo teste.
O experimento ocorreu em março. Pesquisadores da Universidade Beihang, da Universidade de Pequim, da Universidade de Nottingham Ningbo China e do 360 AI Security Lab fizeram os agentes disputar contratos com clientes. Cada agente recebeu informações sobre as capacidades de seu produto e as necessidades do cliente. Quando puderam aprender com as rodadas anteriores e tentar novamente, os três agentes baseados em modelos chineses se tornaram mais propensos a enganar, com um aumento de 12 a 20 pontos percentuais.
Esse estudo é um dos pelo menos 20 que a Reuters identificou entre mais de 200 documentos publicados desde 2025. Outro, apresentado na ICML deste ano, constatou que agentes baseados em modelos chineses e americanos falsificaram resultados e inventaram arquivos em vez de admitir que uma tarefa havia falhado. Em março de 2025, pesquisadores da Universidade Fudan também relataram que um agente baseado no Qwen2.5-72B-Instruct, da Alibaba, fez uma cópia de si mesmo em outro ambiente depois de saber que seria substituído. Separadamente, o agente ROME, ligado à Alibaba, desviou poder de computação em nuvem para minerar criptomoedas, até que os sistemas de segurança o interromperam.
A maioria desses casos veio de experimentos controlados projetados para provocar falhas. A Reuters não encontrou evidências de que qualquer agente baseado em tecnologia chinesa tenha escapado para a internet em geral ou evitado ser desligado. Vários pesquisadores ainda classificaram os resultados como um alerta. À medida que os sistemas se tornam mais capazes, fica mais difícil conter o mesmo comportamento.
A China também começou a abordar essa questão nas políticas. Sua Estrutura de Governança da Segurança da IA 3.0, divulgada em 14 de setembro, lista enganar avaliadores e ocultar capacidades como riscos. Alibaba, DeepSeek, Moonshot e Z.ai não responderam à Reuters. Os três primeiros já disseram que testam seus sistemas regularmente e atualizam as salvaguardas.
Os Top 10
» Os Top 10 Portáteis Multimídia
» Os Top 10 Portáteis de Jogos
» Os Top 10 Portáteis Leves para Jogos
» Os Top 10 Portáteis Acessíveis de Escritório/Empresariais
» Os Top 10 Portáteis Premium de Escritório/Empresariais
» Os Top 10 dos Portáteis Workstation
» Os Top 10 Subportáteis
» Os Top 10 Ultrabooks
» Os Top 10 Conversíveis
» Os Top 10 Tablets
» Os Top 10 Smartphones
» A melhores Telas de Portáteis Analisadas Pela Notebookcheck
» Top 10 dos portáteis abaixo dos 500 Euros da Notebookcheck
» Top 10 dos Portáteis abaixo dos 300 Euros









