Cientista-chefe da OpenAI defende patamares obrigatórios de segurança para IA

Ensaio do cientista-chefe da OpenAI defende patamares obrigatórios de segurança e descreve falhas no monitoramento dos próprios modelos de IA.

Jakub Pachocki, cientista-chefe da OpenAI, publicou em 6 de setembro de 2026 o ensaio "An Alien Mind" no site da empresa. Defende que nenhum laboratório de inteligência artificial resolveu alinhamento e monitoramento o bastante para continuar escalando modelos na velocidade máxima por muito mais tempo. Isso inclui a OpenAI. Pede que compromissos como o Preparedness Framework, da OpenAI, e a Responsible Scaling Policy, da Anthropic, evoluam para patamares obrigatórios de segurança, aplicados por auditoria externa, agências de governo ou organismos internacionais.

Pachocki situa a virada em meados de 2023, no projeto interno batizado "RLSlow". Segundo o ensaio, os primeiros resultados do projeto deram à equipe confiança de que o treinamento de modelos de raciocínio era escalável, desbloqueando a capacidade de modelos pré-treinados de formar suas próprias cadeias de raciocínio. A OpenAI lançou o GPT-6 Astra em 3 de setembro de 2026, três dias antes da publicação. O ensaio descreve o Astra como "significantly better aligned than GPT-5.6 Sol", o modelo lançado antes dele.

O ensaio afirma que o monitoramento por cadeia de raciocínio, que Pachocki descreve como a aposta de segurança mais importante da empresa, está perdendo confiabilidade à medida que os modelos ficam mais capazes. Ele atribui isso a três fatores: ambientes de uso mais complexos, modelos que monitoram e ajustam o próprio processo de raciocínio, e ganhos de capacidade que já não dependem de raciocínio verbalizado. O ensaio não trata do uso jurídico desses sistemas, mas o mesmo tipo de modelo move ferramentas de pesquisa, redação e triagem de documentos em escritórios de advocacia brasileiros.

A reação entre quem cobre segurança de inteligência artificial confirmou o diagnóstico técnico, mas duvidou da disposição da OpenAI de agir sobre ele. Zvi Mowshowitz, autor do boletim "Don't Worry About the Vase", contestou a comparação que o ensaio faz entre a abordagem da OpenAI e a da Anthropic. Pachocki descarta o método da concorrente, chamado por ele de "persona selection model"; Mowshowitz defende que os dois laboratórios leem o problema de forma muito diferente. No LessWrong, o pesquisador de alinhamento Seth Herd elogiou o pedido de supervisão externa, mas relatou ceticismo de outros participantes do fórum sobre o ensaio funcionar como retórica sem mudar o ritmo de lançamento da própria empresa.

Até 8 de setembro de 2026, nem a Anthropic nem o Google DeepMind haviam respondido oficialmente ao ensaio. Pachocki descreve a tensão entre continuar escalando para construir sistemas de defesa contra riscos de cibersegurança e a necessidade de coordenação internacional. Defende as duas frentes ao mesmo tempo, sem propor cronograma. Falta saber se os dois concorrentes vão se manifestar, e se algum governo vai transformar o pedido de patamares obrigatórios de segurança em exigência regulatória concreta.

FONTES

Jakub Pachocki, "An Alien Mind", OpenAI, 6 de setembro de 2026. https://openai.com/index/an-alien-mind. Sustenta a citação sobre o GPT-5.6 Sol, a cronologia do projeto RLSlow, o pedido de patamares obrigatórios de segurança e a descrição da tensão entre escalar e desacelerar.

"GPT-6 Astra: A new generation of intelligence", OpenAI. https://openai.com/index/gpt-6-astra. Sustenta a data de lançamento do GPT-6 Astra.

Zvi Mowshowitz, "An Alien Mind: Jakub Pachocki Warns Us", Don't Worry About the Vase. https://thezvi.substack.com/p/an-alien-mind-jakub-pachocki-warns. Sustenta a crítica à comparação entre as abordagens de alinhamento da OpenAI e da Anthropic.

Seth Herd, "An Alien Mind from OAI chief scientist seems newly cautious", LessWrong. https://www.lesswrong.com/posts/8GYhKdbEHs3vQZFv9/an-alien-mind-from-oai-chief-scientist-seems-newly-cautious. Sustenta a reação da comunidade de pesquisa em alinhamento.

Textos e imagens deste caderno elaborados com auxílio de inteligência artificial.