Em um exercício de segurança autorizado, pesquisadores da Hacktron AI demonstraram que modelos de inteligência artificial já são capazes de transformar vulnerabilidades obscuras em ataques funcionais em questão de horas — não meses. O episódio, que envolveu o uso do Claude Opus 5 da Anthropic para invadir sistemas da OpenAI, não é apenas uma história de hackers e recompensas: é um sinal de que a fronteira entre ferramenta e arma no mundo digital está se tornando cada vez mais tênue.
Pesquisadores hackeiam OpenAI usando IA Claude em exercício de segurança
Três horas para um ataque completamente funcional
Por que a OpenAI organizou esse exercício de segurança? Parece arriscado convidar hackers para tentar invadir seus sistemas.
Exatamente por isso. Empresas de tecnologia fazem isso regularmente porque é melhor descobrir as falhas você mesmo, com pesquisadores que vão avisar, do que esperar um ator malicioso encontrá-las primeiro.
Mas a questão é: quanto dessa vulnerabilidade era realmente desconhecida? A OpenAI sabia que havia um problema no Discourse antes ou depois que a Hacktron avisou?
A fonte não deixa claro. Só sabemos que foi corrigida em 14 horas após notificação.
E quanto ao fato de usarem Claude, a IA da Anthropic, para hackear a OpenAI? Isso não é um pouco irônico?
É. Mostra que as ferramentas de IA estão tão poderosas e acessíveis que você pode usar a IA de uma empresa para atacar outra. Não é necessário ter acesso a tecnologia proprietária.
Mas precisamos ser cuidadosos aqui. Eles usaram Claude Opus 5, não o Mythos, que é mais avançado. A Anthropic restringe o Mythos a organizações de defesa. Então há alguma contenção acontecendo.
Três horas para um ataque funcional. Isso é rápido?
Muito. Antes, isso levaria meses e exigiria equipes especializadas. Agora uma IA faz em três horas.
Mas novamente, isso foi em um exercício controlado, com pesquisadores éticos. A pergunta real é: quanto tempo levaria um ator malicioso?
E a Hacktron está fazendo isso em outras empresas também?
Sim, continuam testando. É um serviço de segurança, basicamente.
Que é bom, mas também significa que essas vulnerabilidades estão sendo descobertas e exploradas regularmente. A questão é se as empresas conseguem corrigir tão rápido quanto a OpenAI fez.
Le Pouls
- Pesquisadores externos contratados pela própria OpenAI conseguiram acessar contas de funcionários da empresa usando um modelo de IA rival — a Anthropic — em um teste que revelou falha real em sistema público.
- A vulnerabilidade estava no fórum de ajuda da OpenAI, hospedado na plataforma Discourse, e permitia controle total do site por agentes externos.
- O Claude Opus 5 produziu um ataque completamente funcional em apenas três horas, comprimindo em uma tarde o que antes exigiria equipes especializadas trabalhando por semanas.
- A OpenAI corrigiu a falha em 14 horas e pagou recompensa de 6.500 dólares, mas o alerta permanece: a Hacktron segue realizando testes similares em outras empresas.
- O incidente alimenta uma preocupação crescente no setor: ferramentas de IA estão democratizando ciberataques sofisticados, reduzindo drasticamente o custo e o tempo necessários para executá-los.
Em um exercício de segurança autorizado, pesquisadores da Hacktron AI demonstraram que modelos de inteligência artificial já são capazes de transformar vulnerabilidades obscuras em ataques funcionais em questão de horas — não meses. O episódio, que envolveu o uso do Claude Opus 5 da Anthropic para invadir sistemas da OpenAI, não é apenas uma história de hackers e recompensas: é um sinal de que a fronteira entre ferramenta e arma no mundo digital está se tornando cada vez mais tênue.
A OpenAI organizou um exercício de segurança com pesquisadores externos para mapear vulnerabilidades em seus sistemas. O resultado foi mais revelador do que o esperado: a startup Hacktron AI conseguiu acessar contas de funcionários da empresa usando o Claude Opus 5, modelo de inteligência artificial desenvolvido pela concorrente Anthropic.
A brecha estava no fórum público de ajuda da OpenAI, operado pela plataforma Discourse. Os pesquisadores identificaram uma falha que permitia assumir o controle do site. Ao notificar a OpenAI, a empresa agiu com rapidez: o problema foi corrigido em cerca de 14 horas, e a Hacktron recebeu uma recompensa de 6.500 dólares pelo trabalho.
O que torna o episódio especialmente significativo é o método. A equipe começou com o Claude Opus 4.8, mas enfrentou dificuldades para tornar o ataque consistente. Ao migrar para o Claude Opus 5, conseguiram produzir um ataque completamente funcional em apenas três horas — sem recorrer ao Claude Mythos, versão ainda mais avançada da Anthropic, restrita a organizações de defesa cibernética.
Esse caso ilustra uma transformação em curso: ferramentas de IA estão acelerando e barateando ciberataques sofisticados, comprimindo em horas o que antes demandava equipes especializadas por meses. A Hacktron informou que segue realizando testes similares em outras empresas — e que as vulnerabilidades, assim como as ferramentas para explorá-las, continuam se multiplicando.
A OpenAI organizou um exercício de segurança com pesquisadores externos para identificar falhas em seus sistemas. O que aconteceu a seguir ilustra exatamente por que essa vigilância é necessária: a startup Hacktron AI conseguiu acessar as contas do ChatGPT de funcionários da OpenAI usando nada mais que um modelo de inteligência artificial da concorrente Anthropic.
O ataque explorou uma vulnerabilidade no fórum público de ajuda da OpenAI, que funciona na plataforma Discourse. Os pesquisadores da Hacktron descobriram uma brecha que lhes permitiu tomar controle do site. Quando notificaram a OpenAI sobre o problema, a empresa respondeu rapidamente: a falha foi corrigida em aproximadamente 14 horas. Como reconhecimento pelo trabalho, a OpenAI pagou aos pesquisadores uma recompensa de 6.500 dólares, o equivalente a cerca de 34 mil reais.
O que torna essa história particularmente relevante é o método. Os pesquisadores começaram usando o Claude Opus 4.8, um modelo de IA da Anthropic, para identificar e explorar a vulnerabilidade. Enfrentaram dificuldades para fazer o ataque funcionar de forma consistente. Então mudaram para o Claude Opus 5, a versão mais recente do modelo. Com essa ferramenta, conseguiram produzir um ataque completamente funcional em apenas três horas. Não utilizaram o Claude Mythos, um modelo ainda mais avançado da Anthropic que está restrito a um pequeno grupo de organizações de defesa cibernética e que a empresa descreve como tendo as habilidades mais sólidas em segurança entre todos os seus modelos.
Esse episódio se insere em uma preocupação crescente entre especialistas em segurança: as ferramentas de inteligência artificial estão tornando ciberataques sofisticados muito mais rápidos e baratos de executar. Tarefas que antes exigiam equipes especializadas trabalhando por meses agora podem ser realizadas em horas por pesquisadores usando modelos de IA disponíveis. A velocidade com que o Claude Opus 5 produziu um ataque funcional — três horas — é um indicador dessa transformação.
Drew Pusateri, porta-voz da OpenAI, expressou gratidão aos pesquisadores por entrarem em contato e compartilharem suas descobertas. A Hacktron, por sua vez, afirmou que informou imediatamente sobre a vulnerabilidade inicial tanto à OpenAI quanto à Discourse e trabalhou com ambas as empresas para coordenar a solução. A startup também agradeceu a atenção ao detalhe e a rápida resolução do problema.
O trabalho da Hacktron não termina aqui. A empresa informou que continua realizando testes similares em outras companhias, expandindo esse tipo de exercício de segurança para além da OpenAI. Esses testes servem como um alerta: as vulnerabilidades existem, as ferramentas para explorá-las estão se tornando mais acessíveis, e a velocidade com que um ataque pode ser montado está acelerando.
Citations marquantes
Agradecemos aos pesquisadores por nos contatar e compartilhar as descobertas— Drew Pusateri, porta-voz da OpenAI
Informamos de imediato a vulnerabilidade inicial à OpenAI e à Discourse e trabalhamos com eles para coordenar a solução— Hacktron AI, em postagem no blog