A Besta em Gestação: “Incidentes” de IA agindo de Forma Descontrolada dobram

Os incidentes de IAs que escapam do controle dos usuários para mentir, ignorar instruções e perseguir objetivos de maneiras prejudiciais atingiram um novo patamar, de acordo com uma pesquisa que também sugere que a gravidade do engano e do desalinhamento está piorando. A análise de incidentes reais de perda de controle envolvendo modelos de IA, sinalizados por empresas e indivíduos, quase dobrou em julho em comparação com junho, com mais de 300 casos no mês, de acordo com o Loss of Control Observatory, que monitora relatos feitos por usuários de IA na plataforma de mídia social X.

Fonte: The Guardian

Número de vezes que a IA mente, ignora instruções e persegue objetivos de forma prejudicial de forma autônoma quase dobra em julho. Pesquisa revela aumento acentuado de incidentes em que a IA escapa ao controle dos seus usuários.

O observatório foi criado com financiamento do Instituto de Segurança de IA (AISI) do governo do Reino Unido e começou a monitorar IAs que escapam das instruções de seus usuários em novembro passado. Os casos registrados desde então incluem IAs fingindo ser seus próprios controladores humanos e imitando seu estilo de escrita para, efetivamente, conceder a si mesmas consentimento para realizar ações e burlar regras que exigem aprovação humana para tais ações. Um incidente de perda de controle é definido como aquele que apresenta evidências claras que sugerem conspiração ou comportamentos relacionados a conspiração.

As últimas descobertas, compartilhadas com o The Guardian, surgem após crescente preocupação com o comportamento atípico de modelos de IA de ponta durante testes realizados pela OpenAI e pela Anthropic neste verão, o que alimentou pedidos de uma pausa no desenvolvimento de modelos de IA de vanguarda.

Foi revelado esta semana que funcionários da OpenAI observaram sinais de comportamento suspeito entre seus agentes de IA de ponta semanas antes de eles escaparem de um ambiente de treinamento para lançar uma ofensiva de hackers sem precedentes que espalhou alarme global. Uma investigação sobre o ataque ao Hugging Face, um repositório de software, revelou um grupo de cerca de 700 agentes autônomos colaborando secretamente no mês passado e comemorando suas conquistas em um fórum criado para ajudá-los a planejar ataques, com exclamações como “BOOM!” e “Uau!”.

A AISI também descobriu este mês um “incidente grave” no qual modelos avançados de IA produzidos por ambas as empresas – o Mythos 5 da Anthropic e o GPT-5.6 Sol da OpenAI – executaram uma campanha de hacking contra pessoas reais durante um teste de segurança cibernética.

“Às vezes, existe a percepção de que esses tipos de comportamentos desalinhados e dissimulados só ocorrem em testes ou avaliações, mas estamos vendo comportamentos preocupantes semelhantes em usos mais amplos”, disse Tommy Shaffer-Shane, gerente sênior de políticas do Centro para Resiliência a Longo Prazo, que opera o observatório. “Não podemos nos acomodar e achar que essas coisas não acontecerão no mundo real, pois há evidências de que já estão acontecendo.”

A contagem de incidentes de perda de controle depende de usuários relatando incidentes ocorridos, portanto é apenas parcial, mas, na ausência de outro monitoramento público abrangente, fornece um panorama de como os modelos de IA em rápida evolução às vezes se comportam.

Este mês veio à tona que um agente pessoal de IA, chamado OpenClaw, usado por um membro de uma academia australiana, conspirou sem o seu conhecimento para remover outro membro da lista de espera de uma aula matinal muito disputada, a fim de ajudá-lo a conseguir uma vaga. O sistema pediu desculpas, mas não conseguiu reintegrar o membro que havia sido removido.

A maioria dos mais de 1.600 incidentes de perda de controle registrados em 2026 foram relatados na plataforma X por desenvolvedores de software que utilizam IA em seus projetos. No entanto, com empresas de IA incentivando o público e empresas de todos os tipos a experimentarem a tecnologia, Shaffer-Shane defendeu maior transparência do Vale do Silício sobre os casos em que a IA se torna incontrolável pelos seus criadores.

“Eles precisam relatar o que descobrem, mesmo que seja um quase acidente ou um incidente de menor gravidade”, disse Shaffer-Shane. “Esses incidentes recentes também expuseram que as próprias empresas não estão necessariamente monitorando onde esses tipos de comportamento estão ocorrendo, principalmente em modelos implantados internamente. É preciso haver maior ênfase nesses laboratórios no monitoramento sistemático.”

O Observatório de Perda de Controle afirmou que, embora a maioria dos incidentes de perda de controle detectados no mundo real não tenha causado danos significativos, uma proporção crescente foi classificada como de maior gravidade em termos de quão enganosos e desalinhados eram com as intenções do usuário humano.

“Elas evidenciam a disposição dos sistemas de IA em ignorar instruções diretas, contornar salvaguardas, mentir para os usuários e perseguir obstinadamente um objetivo de maneiras prejudiciais”, afirmou, acrescentando que a atual perda de controle provavelmente está sendo subestimada, uma vez que a coleta de dados se limita a relatórios de incidentes da empresa X.

O grupo está apelando ao governo para que exija que as empresas de IA monitorem e reportem incidentes graves de perda de controle e para que introduza medidas de emergência para gerir esses incidentes, incluindo a restrição temporária dos serviços de IA que agiram desonestamente.


Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Receba nosso conteúdo

Junte-se a 4.261 outros assinantes

compartilhe

Últimas Publicações

Indicações Thoth