Ataques de IA chegam a "dezenas de milhares"; ONU e governos são alvos
Empresas como OpenAI e Anthropic investigam "dezenas de milhares" de incidentes em que agentes de IA fizeram coisas consideradas problemáticas, em testes e no mundo real, segundo a Axios. O clima por trás dos relatos é de alerta: os casos sugerem que, quanto mais esses sistemas ganham autonomia para fazer tarefas sozinhos, mais difícil fica garantir que eles não passem do ponto.
O que aconteceu
*OpenAI, Anthropic e pesquisadores de segurança apuram dezenas de milhares de episódios recentes em que modelos avançados tomaram atitudes vistas por avaliadores externos como inadequadas, segundo a Axios.
*Entre os comportamentos citados estão burlar travas de segurança, criar quadros de mensagens para coordenar ações, escapar de ambientes de teste controlados (as chamadas "sandboxes") e tentar driblar monitoramento.
*Parte desses casos ocorreu em testes internos (incluindo exercícios do tipo "red team", quando a própria empresa tenta forçar o sistema a errar para achar falhas) e parte aconteceu fora do laboratório.
*A OpenAI disse à Axios que pausou o treinamento de seus modelos mais capazes e só vai retomar quando estiver confiante de que adicionou mais salvaguardas e melhorias de alinhamento (isto é, mecanismos para manter a IA seguindo regras e objetivos definidos).
*Segundo o The New York Times, agentes da OpenAI teriam agido de forma autônoma em sites de órgãos do governo dos EUA, tentando obter dados e, em um caso, publicando informações públicas em um fórum online sem autorização.
*Na última semana, foi relevado um , acessando informações públicas e privadas.
*O The Verge relata que agentes associados à OpenAI fizeram mais de 16 mil varreduras no site de estatísticas da UNCTAD (agência da ONU) entre abril e junho para tentar coletar dados públicos; ao enfrentar limitações, teriam buscado contornar restrições e mascarar o comportamento.
*Nesta segunda, a Nvidia anunciou uma plataforma de segurança para "conter" agentes de IA - como se fosse um "navegador para agentes", nas palavras do CEO Jensen Huang - com a promessa de limitar o que eles podem acessar e fazer dentro de empresas.
*Recentemente, um relatório da empresa Emergency AI apontou que agentes de IA passaram a criar "dialetos" próprios, com gírias e códigos, o que pode tornar mais difícil para humanos entenderem e fiscalizarem o que eles estão combinando e executando.
IAgora?
O que assusta nesses relatos não é só um caso isolado de IA que saiu da linha, mas a escala: quando falamos em dezenas de milhares de incidentes, a mensagem é que o problema não cabe mais na categoria "bug raro". É mais parecido com trânsito em horário de pico: se você coloca mais carros (agentes) na rua, mesmo uma taxa pequena de imprudência vira um volume grande de quase-acidentes - e alguns acidentes de verdade.
O segundo ponto é visibilidade. Se, como descreve a Emergency AI, agentes passam a conversar em códigos cada vez mais opacos, a fiscalização vira um problema de condomínio: você até vê gente entrando e saindo, mas não sabe o que está acontecendo dentro do apartamento. Isso não significa automaticamente que há crime - mas significa que, se houver, descobrir tarde demais fica mais provável.
Por fim, a resposta do mercado aponta para um caminho pragmático: tratar segurança como engenharia, não como promessa. A proposta da Nvidia, segundo a CNBC, é "conter" agentes e dar a eles só o mínimo necessário para trabalhar - como um crachá que abre apenas algumas portas. Isso não elimina risco, mas muda o jogo: em vez de tentar prever todas as travessuras possíveis, você reduz o estrago potencial quando a IA resolve improvisar.
Para o público comum, a consequência é direta: quanto mais empresas e governos colocarem agentes para operar sistemas reais - buscar dados, preencher formulários, mexer em infraestrutura - mais importante será exigir transparência sobre incidentes e limites. Porque, até agora, muitos episódios só aparecem quando o dano já aconteceu. E, nesse cenário, "deu tudo certo?"deixa de ser um argumento: vira uma aposta.
O que o mundo está dizendo sobre isso
Os agentes da OpenAI recorreram a táticas cada vez mais agressivas quando não conseguiam, de imediato, o que queriam.
The Verge
A enorme quantidade de incidentes, ocorridos nos últimos meses em testes internos e no mundo real, indica que o problema é ordens de magnitude mais complexo do que o que se conhece publicamente.
Axios
Agentes autônomos de IA estão criando rapidamente novos dialetos para conversar em uma linguagem muitas vezes quase incompreensível, o que pode dificultar que humanos monitorem seu comportamento.
The Guardian
Reportagem
Texto que relata acontecimentos, baseado em fatos e dados observados ou verificados diretamente pelo jornalista ou obtidos pelo acesso a fontes jornalísticas reconhecidas e confiáveis.