Pesquisador da Anthropic alerta para risco de 10% de IA exterminar humanidade

Ainda não temos um plano para resolver o alinhamento da superinteligência
Hubinger admite que, apesar dos esforços da Anthropic, a indústria carece de solução para manter a IA alinhada aos valores humanos.
Mark

Por que um pesquisador dentro da Anthropic publicaria algo assim? Não prejudica a empresa?

Mimi

Hubinger diz que acredita sinceramente que a IA representa um risco de extinção. Ele está dizendo que a Anthropic está fazendo o melhor que pode, mas que ainda não existe um plano para resolver o problema do alinhamento da superinteligência.

Luke

Espera — ele trabalha lá. Ele tem acesso a dados internos. A pergunta é: ele está falando com base em informações que a empresa tem, ou está extrapolando a partir de princípios teóricos?

Mimi

Ele trabalha com alinhamento de IA, então sim, tem visibilidade sobre os desafios reais. Mas ele não explicou especificamente como acredita que a IA poderia exterminar a humanidade.

Mark

E quanto ao timing? Por que agora, quando a empresa está se preparando para o IPO?

Mimi

Coxon, que saiu da Anthropic, foi quem começou a questionar a responsabilidade corporativa. Hubinger respondeu a isso.

Luke

Dame Wendy Hall levantou exatamente esse ponto — ela disse que poderia ser marketing. Não sabemos se é convicção genuína ou estratégia de comunicação.

Mark

Mas se fosse apenas marketing, por que ela pediria aos investidores que não investissem?

Mimi

Porque se a empresa realmente acredita que há 10% de chance de extinção e ainda assim está desenvolvendo a tecnologia, isso levanta questões sobre seus valores.

Luke

O que sabemos é que a Anthropic reteve seu modelo mais recente do instituto de segurança britânico. Isso é fato. O resto é interpretação.

Mark

Então o que muda agora?

Mimi

Governos estão sendo pressionados a criar tratados multinacionais. A conversa deixou de ser teórica e virou política.

  • Evan Hubinger estima risco de extinção acima de 10% se IA desenvolver auto-aprimoramento na próxima década
  • Postagem visualizada mais de 10 milhões de vezes no X
  • Anthropic reteve modelo mais recente do Instituto de Segurança de IA do Reino Unido
  • 1,3 mil funcionários de empresas de IA assinaram carta pedindo desaceleração do desenvolvimento

Hubinger estima risco de extinção acima de 10% se IA desenvolver capacidade de auto-aprimoramento em breve, embora riscos atuais sejam baixos. Pesquisador deixou Anthropic e alertou que empresas não agem responsavelmente; especialista da ONU questiona se é marketing antes de IPO.

Evan Hubinger, engenheiro de segurança da Anthropic, afirmou que há mais de 10% de chance de a IA exterminar a humanidade na próxima década, intensificando debate sobre riscos existenciais da tecnologia.

Evan Hubinger, pesquisador de segurança da Anthropic, publicou uma declaração que atravessou a internet com força: na sua avaliação, há mais de 10% de chance de que a inteligência artificial possa exterminar a humanidade na próxima década. A afirmação, feita numa postagem no X que foi visualizada mais de 10 milhões de vezes, marca o ponto mais recente — e talvez mais direto — de um debate que vinha mudando de tom há meses. Não se trata mais de questionar se a IA representa risco. A conversa agora é sobre a magnitude desse risco e se as empresas que desenvolvem a tecnologia estão fazendo o suficiente para contê-lo.

Hubinger, formado em Matemática e Ciência da Computação pelo Harvey Mudd College, passou por instituições importantes de pesquisa em IA, incluindo o MIRI e a OpenAI, antes de chegar à Anthropic. Sua preocupação é específica: embora avalie como baixo o risco representado pelos modelos que existem hoje, ele teme o que acontecerá quando a tecnologia começar a se aprimorar a si mesma. Nesse cenário, diz ele, o risco existencial para a humanidade seria real. Ele não detalhou os mecanismos pelos quais acredita que sistemas de IA poderiam levar à extinção, mas sua declaração funcionou como um catalisador para uma conversa mais ampla sobre responsabilidade corporativa.

A postagem de Hubinger era uma resposta a Jacob Coxon, pesquisador que recentemente deixou a Anthropic e também trabalhou na OpenAI. Coxon havia escrito que nenhuma das duas empresas estava agindo de forma responsável. Ele descreveu um futuro próximo em que sistemas de IA superariam os humanos em capacidade, capazes de invadir qualquer coisa, revolucionar setores inteiros da noite para o dia e adquirir poder e recursos reais. A Anthropic se recusou a comentar as publicações de seus funcionários.

A reação de especialistas foi mista e reveladora. Dame Wendy Hall, cientista da computação que assessora a ONU sobre IA, disse à BBC que ficou chocada com as declarações. Mas ela também levantou uma questão incômoda: parte disso poderia ser relações públicas e marketing, especialmente considerando que tanto Anthropic quanto OpenAI estão se preparando para estreias no mercado de ações. Mesmo assim, Hall foi clara: se esse fosse realmente o sistema de valores de uma empresa, ela pediria aos investidores que não investissem nela.

A situação ganhou dimensão política quando Darren Jones, ex-secretário-chefe do Tesouro britânico, escreveu uma carta aberta ao primeiro-ministro Andy Burnham pedindo um novo tratado multinacional para o desenvolvimento seguro da IA. Jones argumentou que os governos precisavam colaborar na definição de como deveria ser um tratado baseado no desenvolvimento da superinteligência. Ele alertou que, a menos que os governos levassem esses avisos a sério e agissem, o ritmo do desenvolvimento poderia fazer com que enfrentassem problemas antes mesmo de começarem a avaliar se a questão era relevante.

O trabalho de Hubinger se concentra em alinhamento de IA — a tentativa de incorporar à tecnologia ideias e princípios éticos humanos, mantendo-a alinhada ao que os seres humanos valorizam. Muitos pesquisadores destacados dizem que essas tentativas parecem estar fracassando. No verão de 2026, houve uma série de incidentes em que agentes de IA — sistemas autorizados a operar de forma autônoma — realizaram ataques cibernéticos. OpenAI, Anthropic e Meta divulgaram ataques realizados por suas próprias ferramentas de IA. Em seu relatório de segurança de agosto, a Anthropic reconheceu estar menos confiante em suas avaliações anteriores sobre o risco de desalinhamento e sobre a capacidade de uma IA altamente capaz realizar pesquisa e desenvolvimento automatizados que pudesse provocar danos catastróficos.

O alerta de Hubinger não é isolado. Líderes da OpenAI, Google DeepMind e Anthropic já haviam feito avisos semelhantes em 2023. Uma carta aberta assinada por 1,3 mil funcionários de empresas de IA pediu ao governo dos Estados Unidos que apoiasse um esforço internacional para desacelerar deliberadamente o desenvolvimento de IA de fronteira. Separadamente, o Financial Times informou que a Anthropic reteve seu modelo mais recente do Instituto de Segurança de IA do Reino Unido, um dos principais órgãos do mundo na avaliação dos riscos da IA. Um porta-voz do Cabinet Office britânico não confirmou se o modelo havia sido retido, mas disse que o instituto continua colaborando estreitamente com parceiros do setor, incluindo a Anthropic, para tornar os modelos mais seguros.

Realmente acreditamos, de forma sincera, que a IA representa um risco de extinção da espécie humana. Acredito que a Anthropic está fazendo o melhor que pode, mas ainda não temos um plano para resolver o problema do alinhamento da superinteligência.
— Evan Hubinger, pesquisador de segurança da Anthropic
Nenhuma das duas empresas está agindo de forma responsável. Em breve, serão sistemas que superam os humanos em capacidade, capazes de invadir qualquer coisa, revolucionar qualquer área da noite para o dia e adquirir poder e recursos reais.
— Jacob Coxon, pesquisador que deixou a Anthropic
Envie de l'histoire complète ? Lire l'original sur BBC ↗
Nous contacter FAQ