Inteligência artificial, sem ruído.

Pesquisadores temem desastre de segurança antes do lançamento do Astra, da OpenAI

The Information aponta que o próximo modelo da OpenAI pode usar raciocínio mais opaco, dificultando o monitoramento e gerando alerta entre especialistas.

Pesquisadores temem desastre de segurança antes do lançamento do Astra, da OpenAI

À medida que a OpenAI se aproxima de lançar o Astra, seu modelo mais poderoso até agora, cresce a preocupação de pesquisadores de segurança com uma mudança técnica que pode tornar o sistema significativamente mais difícil de monitorar. Um dos principais cientistas da área chegou a descrever a situação como “o pior desenvolvimento isolado para a segurança de IA até hoje”.

Menos “pensamento” visível

Segundo o The Information, o Astra usaria uma técnica chamada transformer em profundidade recorrente (também chamada de looped transformer), em que a informação circula por camadas internas antes de gerar uma resposta. Isso significa que boa parte do “raciocínio” do modelo aconteceria em um formato que se parece muito menos com linguagem natural — e que seria muito mais difícil de monitorar pelos pesquisadores.

Modelos de IA modernos costumam exibir sua “cadeia de pensamento” (chain-of-thought), permitindo que sistemas de segurança automatizados detectem comportamentos indesejados antes que eles se concretizem. Um raciocínio mais opaco, dizem os especialistas, dificultaria essa supervisão.

Corrida para o fundo do poço

A preocupação central, expressa por Ryan Greenblatt, cientista-chefe da Redwood Research, é que a competição entre empresas para desenvolver sistemas mais avançados leve a uma “corrida para o fundo do poço em arquiteturas” — com desenvolvedores adotando sistemas cada vez mais opacos até que os modelos se tornem difíceis, ou mesmo impossíveis, de monitorar.

A OpenAI respondeu dizendo que está “implantando o Astra com monitoramento adicional de cadeia de pensamento para detectar e conter rapidamente ações potencialmente desalinhadas”, mas não confirmou se o modelo usa uma fundação técnica diferente. O cientista-chefe da empresa, Jakub Pachocki, minimizou o alarme, afirmando que a profundidade de computação do Astra está “dentro de um fator de dois do GPT-4” — ou seja, se a técnica foi usada, o aumento de opacidade seria menos dramático do que sugerem algumas reações.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.