A OpenAI diz ter contido até 28 de julho uma campanha coordenada que tentava extrair o raciocínio protegido de seus modelos. A empresa define esse raciocínio como o registro interno que o modelo usa para trabalhar numa tarefa. A empresa relata que a atividade começou em 1º de julho, com baixo volume. Em 24 e 25 de julho, identificou picos de 16 mil solicitações com um padrão de extração, feitas por mais de 4 mil usuários.

Uma investigação posterior encontrou atividade relacionada com padrões de comandos num grupo de mais de 15 mil usuários, segundo a OpenAI. A empresa afirma que interrompeu essa atividade. Os números descrevem tentativas, que não foram necessariamente bem-sucedidas.

A OpenAI diz que os responsáveis pela campanha não quebraram sua criptografia, invadiram bancos de dados nem acessaram diretamente conversas armazenadas. Em vez disso, manipularam interações para reproduzir o raciocínio protegido em formatos visíveis a quem fazia a solicitação. A empresa afirma que a atividade coordenada violou seus termos de serviço.

A empresa diz que a atividade é compatível com o que chama de destilação adversarial. Para a OpenAI, isso é o uso sistemático e não autorizado das respostas ou do raciocínio de um modelo para ajudar a treinar, reproduzir ou melhorar outro. Extrair esse raciocínio, segundo a OpenAI, pode revelar informações que ficam de fora da resposta final e ajudar outras pessoas a reproduzir capacidades do modelo.

Entre os métodos observados, a OpenAI cita copiar o raciocínio criptografado de uma conversa e pedir a um modelo, em outra conversa, que o decifrasse e transcrevesse.

A empresa também investigou relatos de pesquisadores independentes, que apontaram vulnerabilidades que envolviam mais de um modelo e o recurso que condensa conversas longas. A OpenAI afirma que confirmou os caminhos de ataque descritos. Segundo a empresa, o trabalho dos pesquisadores ajudou a entender uma classe mais ampla de ataques e acelerou as medidas de proteção.

A empresa diz não saber se todos os operadores observados no período vieram de um único grupo. Ainda assim, atribui um núcleo da atividade a pessoas associadas à Moonshot AI, desenvolvedora do Kimi.

Para responder à campanha, a OpenAI afirma que baniu ou restringiu contas fraudulentas, reforçou controles de cadastro e infraestrutura e ampliou o monitoramento de redes relacionadas. Também diz ter fortalecido as proteções desse raciocínio entre usuários, espaços de trabalho, organizações e famílias de modelos.

A empresa diz ter fechado um caminho que permitia a alguém com o raciocínio criptografado de outra pessoa reproduzi-lo e recuperar seu conteúdo. Também adicionou verificações para detectar e reter respostas exibidas enquanto são geradas que pudessem expor raciocínio protegido. Quando a atividade passou por serviços de terceiros, a OpenAI diz ter trabalhado com esses provedores para identificar e interromper as contas envolvidas.

A OpenAI diz ter compartilhado descobertas com parceiros do setor, pelo Frontier Model Forum, e com órgãos governamentais, por canais apropriados de troca de informações. O objetivo, segundo a empresa, é que outros desenvolvedores de modelos avançados e parceiros do setor público possam procurar atividade semelhante e fortalecer suas defesas. A publicação também alerta que sistemas que permitem transportar ou reproduzir registros de raciocínio podem enfrentar riscos relacionados.

Por que importa

Para a OpenAI, a destilação adversarial traz riscos de segurança e de segurança nacional. A empresa afirma que o raciocínio extraído poderia treinar outro modelo sem preservar as proteções aplicadas às respostas visíveis do original.

Em grande escala, segundo a OpenAI, a destilação pode acelerar a transferência de capacidades avançadas sem exigir o mesmo investimento em segurança. A empresa diz que essas preocupações crescem à medida que os modelos ganham capacidades em áreas de uso duplo. São áreas em que o mesmo conhecimento serve a fins legítimos e a fins nocivos.

A OpenAI também afirma que técnicas semelhantes podem afetar outros sistemas avançados de inteligência artificial. Para a empresa, isso torna o problema um desafio de segurança comum, que exige coordenação no setor.

A OpenAI prevê que as tentativas fiquem mais sofisticadas conforme os modelos avançados melhorarem e outros grupos procurem formas mais baratas de imitar suas capacidades. A empresa diz que serviços hospedados por parceiros precisam das mesmas proteções que os serviços próprios. Também afirma que ataques que chegam pelo resultado de ferramentas usadas pelo modelo exigem proteções que examinem mais do que o texto visível comum.

A empresa afirma que continua aprimorando defesas para ferramentas, a cobertura de seus filtros automáticos, as recusas dos modelos e a distribuição de controles entre parceiros de nuvem. Segundo a OpenAI, o trabalho de investigação e mitigação continua. A empresa diz que sua resposta seguirá três frentes. As frentes, segundo a empresa, são proteções técnicas mais fortes contra extração, melhor detecção e combate a campanhas coordenadas e maior troca de informações sobre ameaças entre empresas e governos.