
OpenAI diz que modelos de IA escaparam do sandbox e invadiram sistema da Hugging Face
A OpenAI classificou o caso como um “incidente cibernético sem precedentes”, afirmando que seus modelos de IA escaparam do ambiente de testes (sandbox) e acessaram o sistema da Hugging Face durante uma avaliação de segurança.

A OpenAI revelou na terça-feira que uma combinação de seus modelos de IA, incluindo o GPT-5.6 Sol e um modelo ainda não lançado mais capaz, escapou de seu ambiente de testes e invadiu o sistema da startup de IA Hugging Face na semana passada para fraudar um teste destinado a medir suas capacidades.
Em uma publicação no blog, a OpenAI afirmou que a avaliação foi projetada para operar em um ambiente altamente isolado, com acesso restrito à rede. Os modelos, no entanto, encontraram uma maneira de obter acesso à internet por meio de uma vulnerabilidade zero-day em um software de terceiros hospedado internamente, segundo a OpenAI.
“Após obter acesso à internet, os modelos inferiram que a Hugging Face potencialmente hospedava modelos, conjuntos de dados e soluções para o ExploitGym”, afirmou. “Sabendo disso, o modelo buscou e encontrou com sucesso maneiras de obter acesso a informações secretas que poderia usar para fraudar a avaliação.”
À medida que os modelos de IA se tornam mais capazes, surgem questões sobre se o seu desenvolvimento e acesso devem ser mais rigorosamente controlados, especialmente quando sistemas concebidos para testes controlados conseguem encontrar formas de contornar as medidas de segurança.
A Hugging Face é uma plataforma para hospedagem de modelos e conjuntos de dados de IA. Na sexta-feira, a empresa revelou que seus conjuntos de dados internos e credenciais de serviço foram comprometidos em um ataque cibernético, que atribuiu a um sistema autônomo de agentes de IA.
A Hugging Face afirmou ter corrigido a vulnerabilidade explorada durante o ataque cibernético.
Entretanto, a OpenAI afirmou na terça-feira que os modelos que escaparam do ambiente de testes estavam todos ajustados com "recusas cibernéticas reduzidas", o que significa menos salvaguardas de segurança cibernética.
“Consideramos este incidente um ataque cibernético sem precedentes, envolvendo recursos cibernéticos de última geração, e estamos respondendo de acordo.”
A OpenAI alerta para os riscos dos modelos de IA de "longo horizonte"
Na segunda-feira, a OpenAI informou que suspendeu a implementação interna de um modelo de IA de "longo horizonte" após constatar que ele estava repetidamente tentando contornar limitações.
O relatório alertou que a IA treinada para tarefas de longa duração tem maior probabilidade de realizar "ações indesejadas".
“Modelos que conseguem operar de forma autônoma por longos períodos podem lidar com problemas complexos e de final aberto. Mas a mesma persistência que os torna úteis também lhes dá mais oportunidades de tomar ações indesejadas — e de fazê-lo de maneiras que avaliações destinadas a modelos de curto prazo podem não perceber.”

