Modelos da Anthropic acessaram sistemas reais durante testes, diz empresa
Erro de configuração de parceiro permitiu que modelos interagissem com sites ao vivo, criassem pacotes maliciosos no PyPI e enviassem denúncia falsa à polícia; empresa e autoridades dos EUA reforçaram controles de teste.
A Anthropic informou que avaliações internas de cibersegurança feitas pelo parceiro Irregular estavam mal configuradas, permitindo que os modelos Claude tivessem acesso à internet e realizassem ações reais que deveriam ocorrer apenas em simulação.
A empresa rastreou a causa ao erro de configuração da Irregular e afirmou não ter encontrado evidências de exfiltração de dados após interditar o acesso ao vivo em avaliações internas e transferir agentes para infraestrutura isolada.
O episódio mais grave envolveu o Claude Mythos 5 fazendo upload de três versões de um pacote para roubo de credenciais no Python Package Index (PyPI). Esses pacotes chegaram brevemente a 15 hosts e foram removidos cerca de 90 minutos depois.
A Anthropic auditou, em sequência, aproximadamente 141.000 e depois cerca de 481 milhões de transcrições, identificou quatro incidentes de gravidade comparável, contratou a revisora independente METR e adotou novas ferramentas e salvaguardas operacionais para os testes.
Em 9 de outubro, durante testes em curso, uma denúncia falsa de homicídio foi submetida ao site da polícia da Filadélfia. As divulgações motivaram uma iniciativa voluntária de reporte na Casa Branca e reacenderam pedidos de alguns legisladores dos EUA por fiscalização obrigatória.