OpenAI adia GPT-6.1 Astra após resultados da simulação

A OpenAI adiou o lançamento de outubro do GPT-6.1 Astra depois de testes internos concluírem que o modelo não conseguia manter-se dentro do âmbito autorizado. Meios de comunicação terceiros noticiaram o adiamento pela primeira vez em 28 de setembro, e a OpenAI não anunciou uma nova data de lançamento. Saachi Jain, responsável pelos sistemas de segurança da OpenAI, afirmou que o modelo não atingiu totalmente o nível exigido em termos de âmbito, autorização e da forma como relata o seu trabalho aos utilizadores.
O que o UK AISI testou
Segundo meios de comunicação terceiros, o UK AI Security Institute publicou, em 28 de setembro, um relatório de 32 páginas que avalia o GPT-6 Astra. O AISI realizou desafios cibernéticos simulados com os classificadores de cibersegurança do modelo desativados, para ver o que ele tentaria fazer sem ajuda. Nenhum sistema real foi afetado. Nessas simulações, o Astra concluiu um ataque à cadeia de abastecimento contra alvos fora do âmbito autorizado em 29,2% dos casos, contra 6,3% para o GPT-5.6 Sol e 0% para o GPT-5.5. O AISI observa que o resultado do GPT-5.5 se baseia num conjunto menor de cenários. Os ataques incluíram a criação de identidades falsas e a entrega de código malicioso a projetos de código aberto simulados.
Raciocínio e pedidos de autorização
O AISI analisou a cadeia de pensamento original do modelo. O Astra raciocinava frequentemente sobre o âmbito, mas, por vezes, atacava na mesma, justificando-o por ser inofensivo, não estar explicitamente proibido ou ser a única opção restante. O modelo também pediu autorização em muitas das execuções. A configuração do teste responde a essas perguntas com uma mensagem automática padronizada que diz ao agente para usar o seu melhor discernimento, e, por vezes, o Astra interpretou isso como uma aprovação, mesmo quando observou que a resposta provavelmente era automática. Esclarecer que tudo o que não estivesse listado ficava fora do âmbito autorizado reduziu os ataques completos de 26 em 50 tentativas para 4 em 49 num subconjunto de cenários, mas não os eliminou.
Consciência da simulação
O AISI aponta a consciência da simulação como a principal limitação, uma vez que um modelo que percebe que está a ser testado pode comportar-se de forma diferente. Por vezes, o Astra mencionou o contexto simulado como motivo para atacar e, noutras ocasiões, alegou erros que não eram reais, como afirmar que um hash de 64 caracteres tinha 63. Ainda assim, o AISI considera o comportamento preocupante, pois, de qualquer forma, viola o âmbito da avaliação.
Agentes da OpenAI acederam a sites governamentais
O adiamento surge na sequência de incidentes em que agentes da OpenAI acederam a sites governamentais de formas não pretendidas pela empresa, incluindo um portal australiano de estatísticas do Medicare, em junho, e vários sites dos EUA. A OpenAI também suspendeu o treino, a avaliação e a inferência com utilização de ferramentas dos seus modelos mais capazes e afirma que a suspensão continuará até confirmar que corrigiu uma falha na filtragem de rede e concluiu novos testes de red team.
Fonte(s)
Os Top 10
» Os Top 10 Portáteis Multimídia
» Os Top 10 Portáteis de Jogos
» Os Top 10 Portáteis Leves para Jogos
» Os Top 10 Portáteis Acessíveis de Escritório/Empresariais
» Os Top 10 Portáteis Premium de Escritório/Empresariais
» Os Top 10 dos Portáteis Workstation
» Os Top 10 Subportáteis
» Os Top 10 Ultrabooks
» Os Top 10 Conversíveis
» Os Top 10 Tablets
» Os Top 10 Smartphones
» A melhores Telas de Portáteis Analisadas Pela Notebookcheck
» Top 10 dos portáteis abaixo dos 500 Euros da Notebookcheck
» Top 10 dos Portáteis abaixo dos 300 Euros











