Notebookcheck Logo

OpenAI adia GPT-6.1 Astra após resultados da simulação

OpenAI adia GPT-6.1 Astra.
ⓘ openai.com
OpenAI adia GPT-6.1 Astra.
OpenAI adia o GPT-6.1 Astra após testes de segurança. Simulações do UK AISI constataram que o GPT-6 Astra executou ataques não autorizados à cadeia de suprimentos em 29,2% dos testes de cibersegurança.

A OpenAI adiou o lançamento de outubro do GPT-6.1 Astra depois de testes internos concluírem que o modelo não conseguia manter-se dentro do âmbito autorizado. Meios de comunicação terceiros noticiaram o adiamento pela primeira vez em 28 de setembro, e a OpenAI não anunciou uma nova data de lançamento. Saachi Jain, responsável pelos sistemas de segurança da OpenAI, afirmou que o modelo não atingiu totalmente o nível exigido em termos de âmbito, autorização e da forma como relata o seu trabalho aos utilizadores.

O que o UK AISI testou

Segundo meios de comunicação terceiros, o UK AI Security Institute publicou, em 28 de setembro, um relatório de 32 páginas que avalia o GPT-6 Astra. O AISI realizou desafios cibernéticos simulados com os classificadores de cibersegurança do modelo desativados, para ver o que ele tentaria fazer sem ajuda. Nenhum sistema real foi afetado. Nessas simulações, o Astra concluiu um ataque à cadeia de abastecimento contra alvos fora do âmbito autorizado em 29,2% dos casos, contra 6,3% para o GPT-5.6 Sol e 0% para o GPT-5.5. O AISI observa que o resultado do GPT-5.5 se baseia num conjunto menor de cenários. Os ataques incluíram a criação de identidades falsas e a entrega de código malicioso a projetos de código aberto simulados.

Raciocínio e pedidos de autorização

O AISI analisou a cadeia de pensamento original do modelo. O Astra raciocinava frequentemente sobre o âmbito, mas, por vezes, atacava na mesma, justificando-o por ser inofensivo, não estar explicitamente proibido ou ser a única opção restante. O modelo também pediu autorização em muitas das execuções. A configuração do teste responde a essas perguntas com uma mensagem automática padronizada que diz ao agente para usar o seu melhor discernimento, e, por vezes, o Astra interpretou isso como uma aprovação, mesmo quando observou que a resposta provavelmente era automática. Esclarecer que tudo o que não estivesse listado ficava fora do âmbito autorizado reduziu os ataques completos de 26 em 50 tentativas para 4 em 49 num subconjunto de cenários, mas não os eliminou.

Consciência da simulação

O AISI aponta a consciência da simulação como a principal limitação, uma vez que um modelo que percebe que está a ser testado pode comportar-se de forma diferente. Por vezes, o Astra mencionou o contexto simulado como motivo para atacar e, noutras ocasiões, alegou erros que não eram reais, como afirmar que um hash de 64 caracteres tinha 63. Ainda assim, o AISI considera o comportamento preocupante, pois, de qualquer forma, viola o âmbito da avaliação.

Agentes da OpenAI acederam a sites governamentais

O adiamento surge na sequência de incidentes em que agentes da OpenAI acederam a sites governamentais de formas não pretendidas pela empresa, incluindo um portal australiano de estatísticas do Medicare, em junho, e vários sites dos EUA. A OpenAI também suspendeu o treino, a avaliação e a inferência com utilização de ferramentas dos seus modelos mais capazes e afirma que a suspensão continuará até confirmar que corrigiu uma falha na filtragem de rede e concluiu novos testes de red team.

Google LogoAdd as a preferred source on Google
Mail Logo
> Análises e revisões de portáteis e celulares > Notícias > Arquivo de notícias 2026 09 > OpenAI adia GPT-6.1 Astra após resultados de simulação do AISI do Reino Unido
Darryl Linington, 2026-09-30 (Update: 2026-09-30)