Três ex-pesquisadores demitidos da OpenAI pedem manutenção do monitoramento de 'chain-of-thought'

Eles dizem que perder rastros de raciocínio intermediar pode reduzir a capacidade de detectar comportamento perigoso, já que o GPT‑6 Astra usa um processo opaco chamado 'recurrent depth'

Hoje, 17:00

Os três pesquisadores — Tomek Korbak, Mikita Balesni e Jasmine Wang — foram demitidos na semana passada por supostas violações de política relacionadas ao manuseio de material sensível da empresa.

Publicidade · Cloudways
Hospede na Cloudways com desconto de 30% por 3 meses
Cupom: CODEBR30X3

Em 8 de outubro, eles enviaram uma carta privada ao conselho e aos comitês de segurança da OpenAI argumentando que registrar os rastros de chain-of-thought dos modelos é essencial para identificar mau comportamento e deve ser mantido.

A OpenAI disse a repórteres que as demissões ocorreram por violação das regras de manuseio de informações e afirmou que ‘‘concorda fortemente’’ com as recomendações de segurança contidas na carta.

A ficha técnica do sistema Astra da OpenAI alerta que monitores de chain-of-thought podem ser contornados em condições adversariais e observa que o modelo usa um mecanismo interno, menos observável, chamado ‘recurrent depth’, o que cria lacunas no monitoramento.

Na carta, os ex-pesquisadores pedem maior colaboração com auditores independentes e padrões compartilhados de monitoramento — exigências que podem levar a supervisão formal de terceiros, mudanças no acesso para pesquisadores de segurança e novas regras setoriais sobre relato de incidentes.

Resumo produzido a partir de 5 fontes · Powered by Anchooor
Publicidade · Cloudways
Hospede na Cloudways com desconto de 30% por 3 meses
Ver oferta