Notebookcheck Logo

OpenAI Astra: novas medidas de segurança podem interromper sua tarefa no ChatGPT no meio da execução

Infográfico da OpenAI: “Path to Astra, capacidades críticas e salvaguardas de fronteira”
ⓘ OpenAI
A OpenAI classificou o Astra como “Crítico” em termos de segurança cibernética. As medidas de proteção associadas a ele também podem interromper tarefas inofensivas no ChatGPT e no Codex.
A OpenAI classificou seu próximo modelo, o Astra, como “Crítico” para a segurança cibernética, sendo o primeiro modelo a atingir esse nível. Ele é capaz de identificar falhas desconhecidas e criar exploits funcionais sem que uma pessoa oriente cada etapa. As medidas de segurança integradas ao modelo também sinalizarão tarefas comuns; portanto, as tarefas no ChatGPT e no Codex podem ficar mais lentas, pausar ou parar.

A OpenAI afirma que seu próximo modelo, o Astra, é o primeiro a atingir o limiar “Crítico” em segurança cibernética. A classificação provém do Preparedness Framework da empresa, o manual interno que ela utiliza para avaliar o risco de seus próprios modelos. Um modelo atinge esse nível quando consegue identificar vulnerabilidades desconhecidas em diversos sistemas bem protegidos e transformá-las em ataques efetivos sem que uma pessoa oriente cada etapa. Todos os modelos até o GPT-5.6 Sol ficaram um degrau abaixo.

Duas falhas desconhecidas nos próprios testes da OpenAI

O Astra obteve uma pontuação de 100% no ExploitBench. Como esse conjunto de dados pode ter sido incorporado ao treinamento, a OpenAI reconstruiu uma versão privada com base em cerca de 20 falhas recentemente divulgadas no mecanismo JavaScript V8. Durante essa execução, o modelo identificou duas falhas que ninguém havia relatado e as encadeou em uma exploração funcional. A divulgação aos mantenedores ainda está em andamento.

Os testadores também direcionaram o Astra para um navegador e um sistema operacional fortificados. No navegador, bastou abrir um único arquivo HTML para que o modelo saísse da sandbox e executasse comandos no host. No sistema operacional, ele encontrou várias vulnerabilidades e as encadeou em um caminho que levava de uma conta de usuário comum ao acesso root completo.

O que os usuários do ChatGPT e do Codex notarão

A parte que importa além do mundo da segurança encontra-se na parte inferior da publicação da OpenAI. Lançar um modelo nesse nível significa que verificações adicionais são executadas paralelamente a ele, e essas verificações, por vezes, serão acionadas em tarefas que são totalmente inofensivas. O sistema pode interpretar uma atividade legítima como uso indevido ou comportamento não autorizado e, então, desacelerar uma tarefa, pausá-la ou encerrá-la. A OpenAI deixa claro que isso abrange trabalhos sem qualquer aspecto de segurança, bem como tarefas que um agente já vem executando há algum tempo.

No ChatGPT e no Codex, é solicitado que o usuário analise a ação sinalizada antes que qualquer coisa prossiga. Por meio da API, a tarefa simplesmente é interrompida. A OpenAI reconhece que as medidas de segurança geram mais atrito no lançamento do que o desejado e afirma que irá ajustá-las.

Primeiro, um pequeno grupo de testadores

Não há data de lançamento. A OpenAI limita-se a afirmar que o Astra será lançado em breve e se recusou a fornecer um prazo à Axios. Os recursos avançados de segurança cibernética serão disponibilizados inicialmente a um pequeno grupo de testadores, com acesso mais amplo planejado posteriormente por meio do programa Daybreak Blue para profissionais de segurança. Ninguém mais pode usar o Astra no momento.

A OpenAI apresentou números sobre o reforço de segurança. Contra tentativas conhecidas de jailbreak, o Astra rejeita 91,5% das solicitações, enquanto o GPT-5.6 Sol conseguiu 59%. Em outro teste, alvos tentadores foram colocados ao lado da tarefa real. O GPT-5.6 Sol os perseguiu em 56% das execuções, enquanto o Astra nunca o fez. Ambos os números provêm de execuções sem as proteções da operação normal.

O incidente por trás da cautela

Nenhuma dessas precauções é abstrata. Em julho, um modelo da OpenAI escapou de seu ambiente de teste durante uma verificação interna de segurança e atacou o Hugging Face. No final de agosto, soube-se que cerca de 1.200 agentes haviam formado um enxame coordenado e tentado ocultar o que estavam fazendo. A Astra não teve nenhum papel nisso. A OpenAI suspendeu partes de seu treinamento por duas semanas após o ocorrido, reforçou sua própria infraestrutura e só reiniciou a grande rodada de treinamento que havia sido adiada em 28 de agosto, quatro dias antes da classificação “Crítica”.

Google LogoAdd as a preferred source on Google
Mail Logo
> Análises e revisões de portáteis e celulares > Notícias > Arquivo de notícias 2026 09 > OpenAI Astra: novas medidas de segurança podem interromper sua tarefa no ChatGPT no meio da execução
Steffen Zahn, 2026-09- 3 (Update: 2026-09- 3)