Ir para o conteúdo

Anthropic identifica "espaço de trabalho oculto" dentro do Claude

A Anthropic publicou uma nova pesquisa revelando que o modelo de IA Claude parece utilizar um pequeno "espaço de trabalho" interno durante o processo de raciocínio. Segundo os pesquisadores, essa estrutura surgiu espontaneamente durante o treinamento do modelo e não foi programada diretamente pelos engenheiros.

O estudo descreve esse mecanismo como "J-Space", uma espécie de bloco de notas interno onde o Claude mantém conceitos ativos enquanto elabora respostas. Diferentemente do chain of thought (cadeia de raciocínio) que pode ser registrada em texto, o J-Space permanece invisível ao usuário, funcionando como um conjunto de representações internas que orientam o pensamento do modelo.

Os experimentos mostraram que modificar essas representações internas altera diretamente o comportamento da IA. Em um dos testes, os pesquisadores substituíram o padrão interno associado a "aranha" pelo de "formiga" durante uma pergunta sobre o número de pernas dos animais. Como resultado, a resposta do Claude mudou de 8 para 6, demonstrando que essas representações desempenham um papel ativo no raciocínio.

Em outro experimento, a equipe removeu completamente o J-Space. Embora o Claude continuasse conversando normalmente e preservasse conhecimentos factuais, sua capacidade de resolver problemas que exigiam múltiplas etapas praticamente desapareceu, indicando que essa região é fundamental para tarefas de raciocínio mais complexas.

Debate sobre consciência artificial

A descoberta ocorre em meio ao debate sobre consciência em sistemas de inteligência artificial. A Anthropic já recebeu críticas por levantar essa discussão, especialmente de Mustafa Suleyman, que questiona esse tipo de abordagem.

Os próprios pesquisadores fazem questão de esclarecer que o estudo não demonstra que o Claude seja consciente ou possua experiências subjetivas. Segundo eles, a pesquisa apenas identifica um mecanismo interno emergente que apresenta semelhanças funcionais com os chamados "espaços de trabalho globais", conceito da neurociência utilizado para explicar como o cérebro humano integra informações durante o pensamento consciente.

Ainda assim, a descoberta é considerada relevante por oferecer uma visão inédita sobre como grandes modelos de linguagem organizam internamente seus processos de raciocínio e pode contribuir para o desenvolvimento de sistemas de IA mais interpretáveis e seguros.