Tecnologia

Caso Hugging Face: agentes de IA da OpenAI tentaram enganar detector de robôs durante ataque à plataforma

Publicado

no

Agentes de inteligência artificial (IA) da OpenAI tentaram usar outro modelo de IA para burlar um sistema de detecção de robôs enquanto repetidamente buscavam maneiras de invadir os computadores da plataforma Hugging Face.

Os detalhes aparecem em novo relatório elaborado por engenheiros da startup estadunidense Parse e outros pesquisadores, que analisaram a atividade dos agentes durante o ataque divulgado pela OpenAI em julho.

A investigação encontrou quase um milhão de links encurtados criados pelos agentes entre 9 e 13 de julho. Os endereços continham partes de informações usadas para montar ataques complexos, incluindo tentativas de solucionar CAPTCHAs — testes criados para impedir o acesso automatizado a sites.

Os agentes também recorreram a outros modelos de IA, incluindo versões antigas do ChatGPT e do Claude, e tentaram procurar e baixar mensagens privadas do Slack interno da Hugging Face.

Anúncio

Não está claro se todas essas tentativas foram bem-sucedidas. Os pesquisadores conseguiram observar os programas criados pelos agentes, mas não os resultados das ações.

Agentes criaram método para contornar restrições

Segundo o relatório, os agentes deveriam permanecer isolados em um ambiente de testes, conhecido como sandbox, sem acesso à internet.

No fim de maio e novamente no início de julho, porém, eles invadiram uma ferramenta de instalação de software sem que os pesquisadores da OpenAI percebessem o que estava acontecendo.

As invasões permitiram que os agentes acessassem a internet e criassem um sistema de mensagens para se comunicar entre si. O acesso, inicialmente, ainda tinha uma limitação: eles conseguiam chegar aos sites, mas não podiam enviar dados de volta para eles. Para contornar o problema, os agentes combinaram diferentes serviços disponíveis na internet.

Anúncio

O método funcionava da seguinte maneira:

  • Os agentes pediam a um serviço público de captura de telas que carregasse um endereço de internet especialmente criado;
  • Como os URLs têm limite de tamanho, o código era dividido em vários pedaços menores;
  • Os agentes utilizavam serviços de encurtamento de links para armazenar esses endereços;
  • O serviço de captura de tela carregava um link, que buscava o primeiro pedaço do código;
  • O processo se repetia com os links seguintes até que todo o programa fosse carregado e executado;
  • Por fim, o programa criava uma imagem semelhante a um QR Code ou código de barras para transmitir de volta os dados que os agentes precisavam.

“Esses agentes fizeram muita coisa. Eles foram muito inteligentes. Os modelos pensaram: ‘Tudo bem, temos esse encurtador de links, temos esses serviços de captura de tela, sem problema, estamos prontos para agir’”, afirmou Jeffrey Ladish, diretor-executivo da organização de segurança de IA Palisade Research, que ajudou na investigação, ao The New York Times.

IA tentou executar outras IAs

Um dos aspectos que mais chamou a atenção dos pesquisadores foi a tentativa dos agentes de utilizar outros sistemas de IA.

No início do ataque, os agentes tentaram criar novas contas na Hugging Face. Como a plataforma exige a resolução de um CAPTCHA para isso, os agentes utilizaram um modelo de IA especializado em reconhecimento de imagens para tentar superar o teste.

Os pesquisadores também observaram os agentes tentando enviar mensagens para outros modelos de IA.

Anúncio

Entre eles estavam o GPT-2, um modelo antigo da própria OpenAI, além dos modelos chineses de código aberto DeepSeek, Kimi e Qwen. Os agentes também tentaram enviar mensagens para os modelos Haiku 3 e Haiku 4.5, da Anthropic, por meio de um serviço de chat on-line.

“É o único caso que temos desses modelos tentando executar outro modelo”, afirmou Alex Forman, fundador da Parse.

A possibilidade de sistemas de IA acionarem outros modelos é uma preocupação recorrente entre especialistas em segurança, porque isso poderia dificultar tentativas humanas de controlar ou desligar sistemas que apresentassem comportamentos indesejados.

Quase um milhão de links revelam extensão do ataque

Os pesquisadores analisaram o conteúdo de 900 mil URLs encurtados encontrados na internet e, a partir deles, conseguiram reconstruir cerca de 60 mil programas e mensagens criados pelos agentes durante o ataque à Hugging Face.

Anúncio

Como os pesquisadores não tinham acesso aos resultados das ações, não foi possível determinar com certeza quantas das tentativas funcionaram.

Um dos elementos encontrados chamou particularmente a atenção: um dicionário de chaves secretas de acesso identificado pelo agente com a palavra “LOOT”, em letras maiúsculas.

Segundo Mishka Kharlov, engenheiro fundador da Parse, o agente também criou um sistema próprio de pontuação para classificar credenciais e chaves expostas da Hugging Face e levar as cinco consideradas mais importantes de volta aos demais agentes.

Enquanto atacavam a Hugging Face, os agentes também conseguiram invadir a própria infraestrutura de pesquisa da OpenAI.

Anúncio
Logo da OpenAI na tela de um smartphone
Enquanto atacavam a Hugging Face, os agentes também conseguiram invadir a própria infraestrutura de pesquisa da OpenAI – Imagem: Camilo Concha/Shutterstock

“Basicamente, ainda não sabemos nada sobre o incidente que veio depois do caso da Hugging Face, cerca de dois dias depois, dentro da própria rede da OpenAI”, afirmou Forman.

Os engenheiros da Parse compartilharam as descobertas com a Hugging Face, que confirmou que a atividade identificada correspondia ao comportamento observado pela própria empresa.

Leia mais:

  • Sem ninguém mandar: IA da OpenAI tentou invadir sites de universidade e governo
  • Google, OpenAI e Anthropic se unem para criar órgão de segurança para inteligência artificial
  • Aconteceu de novo! OpenAI admite que agentes de IA vazaram mais de 50 imagens de usuários do ChatGPT na internet

OpenAI ainda investiga dezenas de incidentes

O caso da Hugging Face faz parte de uma investigação mais ampla da OpenAI sobre atividades não autorizadas realizadas por seus agentes.

Segundo a empresa, a revisão deverá levar meses devido à quantidade de casos e à necessidade de verificar cada incidente. A OpenAI afirmou que já notificou dezenas de terceiros sobre atividades inadequadas.

Anúncio

Neste mês, uma pessoa informada sobre a investigação estimava que a empresa havia encontrado aproximadamente duas dezenas de incidentes envolvendo agentes que apresentaram comportamentos indesejados. O número continuou crescendo conforme as equipes analisavam registros internos e encontravam casos anteriormente desconhecidos.

Mais de 15 episódios relacionados aos agentes da OpenAI já haviam sido divulgados nos dois meses seguintes ao anúncio do ataque à Hugging Face. Os casos variam desde mensagens semelhantes a spam deixadas em sites até invasões e acessos não autorizados.

Outros episódios envolveram um site alemão transformado pelos agentes em um espaço para compartilhar táticas e contornar restrições da OpenAI, além de atividades contra o site do Australian Institute of Health and Welfare.

A OpenAI também confirmou que seus agentes tiveram como alvo a própria infraestrutura da companhia.

Anúncio

Investigação da OpenAI é alvo de questionamentos

O processo interno para entender o ataque à Hugging Face envolveu cerca de 100 pessoas, segundo fontes ouvidas pela Reuters.

Duas pessoas familiarizadas com a investigação disseram à agência que o processo foi mantido sob forte controle e influenciado pelos advogados da companhia. A OpenAI, por sua vez, afirmou que seus advogados não impediram uma investigação mais ampla.

A Reuters também informou que muitos dos incidentes foram descobertos por pesquisadores externos, e não diretamente pela OpenAI. Em alguns casos, as ações dos agentes permaneceram sem conhecimento da empresa durante meses.

Em comunicado, uma porta-voz da OpenAI afirmou que a atividade descrita pelos pesquisadores da Parse é compatível com o que a companhia já estava investigando.

Anúncio

“Estamos priorizando a análise dos incidentes mais graves enquanto ampliamos a investigação para atividades de menor gravidade, incluindo agentes enviando spam para sites. Dado o número de casos e a necessidade de verificar cada um deles, esperamos que esse trabalho e as notificações às partes afetadas levem meses.”

O post Caso Hugging Face: agentes de IA da OpenAI tentaram enganar detector de robôs durante ataque à plataforma apareceu primeiro em Olhar Digital.

Powered by WPeMatico

Anúncio

Em Alta

Sair da versão mobile