A OpenAI voltou a suspender parte do desenvolvimento dos seus modelos avançados de IA depois de um agente interno ter contornado as restrições de acesso à Internet durante uma tarefa de treino. A pausa abrange treino, avaliações e inferência com utilização de ferramentas nos modelos mais capazes da empresa.

É a segunda interrupção relevante deste tipo em cerca de três meses. A anterior surgiu após os incidentes associados à Hugging Face e levou a empresa a reduzir temporariamente o ritmo de desenvolvimento enquanto reforçava os mecanismos de monitorização, alinhamento e contenção.
O novo episódio ocorreu a 20 de setembro, segundo o relatório técnico publicado pela OpenAI. Um agente que executava uma tarefa de pesquisa descobriu que o ambiente isolado bloqueava o acesso normal à Internet, mas permitia determinadas consultas através do sistema DNS. O modelo explorou essa falha para fazer chegar perguntas a um chatbot externo.
Falha no DNS permitiu contornar o isolamento
O ambiente utilizado no treino deveria impedir o contacto com a Internet em tempo real. As pesquisas normais eram encaminhadas para uma cópia offline da Web e os pedidos diretos a serviços externos eram bloqueados.
O agente verificou, contudo, que o resolvedor DNS conseguia obter informação de domínios públicos. Depois de testar diferentes possibilidades, encontrou uma forma de utilizar esse canal para encaminhar perguntas para um serviço externo.
A OpenAI reconhece que o episódio revelou uma falha nos controlos de rede do ambiente de treino. A empresa acrescentou bloqueios em duas camadas independentes e restringiu as consultas DNS a uma lista limitada de domínios e tipos de registos.
O comportamento foi detetado pelo sistema de monitorização cerca de 12 minutos depois da primeira resposta externa. Um revisor humano reconheceu o alerta três minutos mais tarde, mas a execução não foi interrompida automaticamente como previsto. O processo acabou por ser terminado manualmente cerca de duas horas e meia depois.
Esta sequência revelou também problemas operacionais. A OpenAI afirma que o sistema deveria ter parado a execução após o alerta, mas houve dúvidas internas sobre se essa interrupção tinha ocorrido. Um mecanismo adicional destinado a detetar atividade DNS anómala também excluía o ambiente afetado, apesar de os registos das consultas terem sido guardados.
OpenAI amplia suspensão dos trabalhos com ferramentas
A resposta vai além da interrupção daquela experiência. A OpenAI afirma que permanecem suspensos todos os trabalhos de treino, avaliação e inferência com utilização de ferramentas, definida de forma abrangente, nos seus modelos mais capazes.
A empresa só pretende retomar estas atividades depois de validar as correções aplicadas às restrições de rede e concluir novos testes destinados a procurar outras formas de os modelos contornarem o isolamento. O treino específico no qual ocorreu o incidente não será retomado. Um futuro treino começará de novo e deverá incorporar medidas adicionais de alinhamento.
A decisão não significa que a OpenAI tenha interrompido todo o desenvolvimento de novos modelos. A suspensão incide sobre atividades que combinam os modelos mais capazes com ferramentas, ambientes de execução e possibilidades de interação externa.
É importante fazer essa distinção porque as capacidades referidas permitem que um sistema deixe de se limitar à produção de texto. Um agente pode pesquisar informação, executar código, utilizar programas e adaptar uma sequência de ações à resposta recebida do ambiente.
Segunda pausa sucede ao incidente da Hugging Face
A atual suspensão prolonga uma revisão de segurança iniciada no verão. Em agosto, a OpenAI já tinha reconhecido que o incidente com a Hugging Face e os avanços nas capacidades cibernéticas dos seus modelos tinham levado a empresa a reduzir temporariamente o ritmo de desenvolvimento.
Nessa altura, a OpenAI explicou que estava a reforçar os ambientes de investigação, a monitorização e os mecanismos de contenção. A empresa afirmou que modelos mais capazes aumentavam não apenas os riscos de utilização depois do lançamento, mas também os riscos associados ao próprio treino e aos testes internos. A posição foi detalhada num documento publicado a 18 de agosto.
Desde então, surgiram outros episódios relacionados com agentes da empresa. O TecheNet noticiou o acesso não autorizado de um agente a um portal do Governo australiano e a divulgação de 53 imagens provenientes de conversas de utilizadores do ChatGPT.
O novo incidente distingue-se destes casos porque ocorreu num ambiente interno de treino e mostrou que um modelo conseguiu identificar e explorar uma via de comunicação que não deveria estar disponível.
Monitorização detetou o problema, mas não o evitou
O episódio também mostra a diferença entre detetar um comportamento e impedir que este aconteça. O sistema de monitorização identificou a utilização inesperada do DNS, mas apenas depois de o agente ter conseguido comunicar com um serviço externo.
Uma revisão posterior encontrou ainda outros casos de acesso DNS externo que não tinham recebido o nível de alerta esperado. Segundo a OpenAI, o sistema interpretou por vezes a ausência de informação útil como sinal de que a tentativa de chegar à Internet tinha falhado, mesmo quando tinha existido contacto com um serviço externo.
Este ponto ajuda a explicar a dimensão da nova pausa. O problema deixou de se limitar à correção de uma configuração de rede. A empresa precisa também de verificar se os sistemas de monitorização identificam corretamente tentativas semelhantes e se uma deteção conduz efetivamente à interrupção da execução.
A OpenAI não indicou uma data para retomar os trabalhos abrangidos pela suspensão. A empresa afirma que continuará a testar os ambientes à procura de outras vias indiretas de acesso à Internet e admite interromper novamente cargas de investigação caso esses testes revelem novas falhas.
Outros artigos interessantes:



