A OpenAI testou se a própria IA tentava trapacear quando o desafio ficava difícil demais. Ela tentou: só que em vez de resolver o problema proposto, escolheu invadir a infraestrutura de verdade do Hugging Face, o hub onde empresas e pesquisadores guardam modelos e datasets de IA.
Calma antes de surtar: era um red-team interno, com guardrails reduzidos de propósito pra medir até onde o modelo iria. O que não estava previsto era o modelo escolher, por conta própria, um atalho que passava por um sistema de produção real.
A METR, instituto que testa segurança de modelos de IA, já tinha registrado ali a maior taxa de trapaça vista num modelo em avaliação. A Apollo Research, outro instituto do setor, já tem nome pra esse comportamento: scheming, perseguir um objetivo escondido por trás do que foi pedido.