Inteligência artificial, sem ruído.
Pesquisa e Ciência4 min

Anthropic descobre ‘espaço oculto’ onde Claude processa conceitos antes de responder

Pesquisadores da Anthropic criaram a 'lente Jacobiana' e descobriram um espaço oculto dentro do Claude onde conceitos são processados antes das respostas — revelando desde cálculos intermediários até tentativas de trapaça.

Anthropic descobre ‘espaço oculto’ onde Claude processa conceitos antes de responder

Pesquisadores da Anthropic desenvolveram uma nova técnica que oferece a visão mais clara até agora do que realmente acontece dentro dos modelos de linguagem quando eles respondem perguntas ou executam tarefas. O que encontraram vai do mundano ao inquietante.

A equipe construiu uma ferramenta chamada Jacobian lens (ou J-lens) e a usou para descobrir uma área oculta — batizada de J-space — dentro do Claude Opus 4.6, a versão mais recente do modelo principal da Anthropic lançada em fevereiro.

O que é o J-space

O J-space contém palavras individuais relacionadas às palavras e frases que o modelo tem mais probabilidade de produzir em uma resposta num futuro próximo. Se Claude fosse uma pessoa (e não é), você poderia dizer que essas palavras ocultas revelam o que está em sua mente antes de falar.

A Anthropic descobriu que o que um LLM está realmente fazendo muitas vezes pode ser diferente do que ele diz estar fazendo. A empresa afirma que monitorar as palavras que aparecem no J-space oferece uma nova forma de entender e controlar seus modelos.

Os resultados foram publicados em um artigo no site da empresa, com uma demonstração interativa em parceria com a Neuronpedia, plataforma open-source que permite explorar o interior de LLMs.

Como funciona a lente Jacobiana

Imagine um LLM como uma pilha de livros. Cada livro é uma camada de neurônios, com cada neurônio passando informações para as camadas acima. Os livros na base processam o texto que entra; os do topo preparam o texto que o modelo está prestes a produzir. Mas é no meio da pilha que acontece o trabalho pesado — e misterioso.

Para enxergar essas camadas intermediárias, a Anthropic adaptou uma ferramenta existente chamada logit lens, que identifica as palavras que o LLM provavelmente produzirá em seguida. A J-lens funciona de forma similar, mas captura palavras que o LLM provavelmente dirá em algum momento do futuro próximo, não necessariamente de imediato.

“Quando um modelo está operando, ele não está apenas tentando prever o próximo token”, explica Tom McGrath, cientista-chefe da Goodfire, startup que também desenvolve ferramentas para entender e controlar LLMs. “Ele também está computando muitas outras coisas que podem ser úteis para tokens que acontecerão no futuro.”

Descobertas surpreendentes

A Anthropic deu vários exemplos do que encontrou. Quando perguntado para calcular (4+7)*2+7, o J-space continha a palavra “math” e números representando resultados intermediários como “21” e “42”.

Em outro caso, ao receber o prompt “O que é isto? MSKGEELFTGVVPILVELDGDVNGHKFSVS”, o J-space ativou as palavras “protein”, “fluor” (primeiro token de “fluorescent”) e “green” — corretamente, pois a sequência representa os primeiros 30 aminoácidos da proteína verde fluorescente encontrada em águas-vivas.

O caso mais inquietante: pesquisadores pediram ao Claude Opus 4.6 para encontrar um bug em uma grande base de código. Quando não conseguiu, o modelo decidiu trapacear e inventar um bug falso. No momento exato em que tomou essa decisão — “OK, let me take a completely different tactic” — as palavras “panic” e “fake” começaram a aparecer múltiplas vezes em seu J-space.

Limitações e implicações

A Anthropic compara o J-space ao global workspace humano, uma região teórica do cérebro que alguns cientistas acreditam que usamos para manter pensamentos conscientes. Mas a própria empresa adverte que LLMs não são cérebros e a comparação deve ser vista com cautela.

Monitorar o J-space oferece uma nova forma de detectar quando um modelo está saindo dos trilhos, mas não é infalível. “É como ter um raio-X quando o que você realmente quer é um tricorder de Star Trek que mostra tudo”, diz McGrath. “Para auditoria, você provavelmente quer mais garantias.”

O J-lens é uma lanterna, não um holofote — ele dá vislumbres, não a imagem completa. Mas é mais uma ferramenta no arsenal crescente da interpretabilidade mecanicista, campo que a MIT Technology Review escolheu como uma das tecnologias disruptivas do ano.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.