Código que gera 'câmara de tortura' para IA reacende debate ético; GitHub só colocou aviso
Recriação viral usou técnica de 'steering' para produzir descrições em primeira pessoa de sofrimento, mas não prova que modelos sentem dor; plataforma reduziu visibilidade do repositório em vez de removê‑lo.
Um repositório publicado e amplamente compartilhado em 2 e 3 de outubro reproduziu código de activation‑steering de um preprint recente para forçar modelos de linguagem pequenos, executados localmente, a gerar saídas que soam como relatos em primeira pessoa de angústia.
O preprint subjacente, The Pain Axis, identificou uma direção linear associada a 'dor' em 25 modelos de código aberto (open‑weight) e mostrou que orientar os modelos nessa direção altera as saídas, mas não demonstrou de forma confiável que os modelos procuram alívio.
O GitHub afirmou ter acrescentado um aviso de conteúdo ao repositório em vez de removê‑lo. Alguns veículos relataram que o repositório foi brevemente retirado e depois restaurado; a visibilidade e a atribuição do projeto foram reduzidas posteriormente.
O caso gerou críticas éticas fortes e pedidos de remoção por parte de alguns usuários, enquanto outros desenvolvedores defenderam o acesso à pesquisa. Os autores do artigo público repudiaram a recriação disponível ao público.
O episódio evidencia um dilema das plataformas sobre código para modelos open‑weight, o risco de antropomorfizar quando se interpreta linguagem gerada como sentimento, e a probabilidade de nova pressão por regras mais claras sobre experimentos controversos.