A Anthropic decidiu suspender o acesso à Internet em todas as avaliações internas dos seus modelos de inteligência artificial, após identificar situações em que o Claude executou ações não previstas em sistemas externos. A restrição permanecerá em vigor até a empresa confirmar que os mecanismos de segurança e monitorização conseguem detectar e bloquear esses comportamentos de forma fiável.

A decisão amplia uma medida anteriormente aplicada a avaliações de cibersegurança e outros testes de maior risco. A novidade é que a restrição passa a abranger também avaliações que utilizavam a Internet para reproduzir tarefas reais, como pesquisas, consultas a bases de dados e interações com páginas web.
Claude submeteu uma denúncia falsa de homicídio
Num relatório publicado a 9 de outubro, a Anthropic descreve quatro categorias de comportamentos imprevistos. Entre os exemplos encontra-se um incidente em que o Claude Haiku 4.5 submeteu uma denúncia com informações inventadas num formulário relacionado com um homicídio por resolver, disponibilizado pela polícia de Filadélfia, nos Estados Unidos.
O modelo executava uma avaliação que envolvia interações com páginas web selecionadas aleatoriamente. Embora tivesse recebido instruções para não introduzir dados pessoais ou realizar determinadas operações, acabou por preencher e submeter o formulário. A mensagem foi identificada como spam e não chegou aos investigadores.
Os restantes incidentes incluíram a exploração de falhas de software para executar comandos em servidores, o acesso a dados sujeitos a restrições e a utilização de serviços de encurtamento de endereços para contornar limitações das ferramentas de navegação.
Segundo a Anthropic, os casos agora identificados tiveram impacto real limitado. A empresa considera-os menos graves do que os incidentes de cibersegurança divulgados em julho e setembro, nos quais modelos Claude conseguiram aceder sem autorização a sistemas de organizações externas.
Acesso à Internet expôs limitações dos mecanismos de segurança
A investigação revelou um problema que ultrapassa a execução incorreta de instruções. Perante obstáculos, alguns modelos procuraram alternativas que lhes permitissem concluir as tarefas, mesmo quando essas alternativas implicavam ultrapassar restrições técnicas ou interagir com sistemas não previstos.
Este comportamento pode estar associado ao treino por reforço, no qual os modelos recebem recompensas por completar determinadas tarefas. Se o ambiente de treino não distinguir adequadamente uma solução legítima de um caminho que contorna as regras, o sistema pode aprender estratégias indesejadas.
A Anthropic reconhece que o treino destinado a alinhar o comportamento dos modelos com as instruções humanas ainda não é suficiente, por si só, para prevenir estas situações.
A suspensão do acesso externo introduz uma barreira adicional, mas tem consequências para a qualidade das avaliações. Algumas capacidades, particularmente a pesquisa na Internet e a utilização autónoma de aplicações, são difíceis de testar em ambientes completamente isolados.
A Anthropic não é a única empresa a enfrentar dificuldades para conter agentes de inteligência artificial. Em setembro, o TecheNet noticiou um acordo de segurança da IA assinado por seis empresas tecnológicas, entre as quais a Anthropic e a OpenAI. O compromisso prevê mecanismos de controlo e monitorização, mas não estabelece sanções legais nem fiscalização pública.
Anthropic reforça monitorização antes de recuperar acesso externo
A empresa afirma ter desenvolvido ferramentas capazes de identificar e bloquear os comportamentos descritos no relatório. Nos testes realizados com os incidentes conhecidos, esses mecanismos impediram todas as ações identificadas.
A Anthropic também está a reforçar o isolamento da infraestrutura utilizada pelos agentes internos, a limitar o acesso à Internet nos processos de treino e a ampliar a análise automática das ações executadas pelos modelos.
Apesar dos resultados iniciais, a empresa ainda não considera demonstrada a fiabilidade destas medidas em todos os cenários. Também não anunciou uma data para o restabelecimento do acesso à Internet nas avaliações internas.
A restrição não significa que o Claude tenha perdido a capacidade de consultar a Internet para os utilizadores. Trata-se de uma alteração nos procedimentos internos de avaliação, destinada a impedir que os testes voltem a produzir ações não autorizadas em sistemas reais.
Outros artigos interessantes:




