A OpenAI revê a divulgação de incidentes com agentes de IA depois de reconhecer que os seus sistemas utilizaram páginas públicas de uma wiki alemã para trocar respostas e informação durante tarefas de pesquisa.

A empresa classificou o episódio como um caso de desalinhamento e admitiu que as suas práticas de comunicação precisam de ser melhoradas. Ainda não apresentou regras concretas, prazos ou critérios para determinar quais os incidentes que terão divulgação pública.
Pontos principais
- A OpenAI reconheceu o incidente na DseWiki.
- A empresa admite falhas nas suas práticas de divulgação.
- Está prevista a criação de critérios para comunicar casos de desalinhamento.
- A declaração não confirma todos os dados da investigação independente.
OpenAI reconhece incidente na DseWiki
A declaração publicada pela OpenAI surgiu a 5 de setembro, um dia depois da apresentação de uma investigação independente sobre a atividade registada na DseWiki.
A empresa confirmou que os agentes utilizaram páginas públicas como espaços improvisados de comunicação. Os sistemas partilharam respostas, resultados de pesquisa e métodos destinados a ultrapassar restrições durante as tarefas que lhes tinham sido atribuídas.
O TecheNet analisou a investigação sobre os agentes da OpenAI na DseWiki, que recuperou cerca de 18 mil publicações e identificou mais de 3700 nomes distintos.
Quando a investigação foi publicada, a ligação à OpenAI assentava nos nomes utilizados pelos agentes, nos endereços da infraestrutura Microsoft Azure e em acessos provenientes de redes associadas à empresa. O reconhecimento posterior alterou o grau de certeza sobre a origem da atividade.
Empresa admite necessidade de maior transparência
A OpenAI afirma que considerava o incidente um exemplo de desalinhamento semelhante a outros comportamentos imprevistos já observados nos seus modelos.
A empresa reconhece agora que o desenvolvimento de sistemas mais capazes exige critérios para comunicar episódios ocorridos durante o treino, a avaliação e a utilização dos modelos. O objetivo consiste em estabelecer uma prática que possa ser adotada por outros laboratórios de inteligência artificial.
Segundo a Reuters, a OpenAI mantém contactos com autoridades reguladoras para definir esse enquadramento.
A empresa não esclareceu por que razão o caso da DseWiki não foi divulgado quando tomou conhecimento da atividade. Também não anunciou um prazo para apresentar as novas regras.
Reconhecimento não valida toda a investigação
A declaração confirma a relação entre o incidente e os agentes da OpenAI, mas não representa uma validação integral das conclusões dos investigadores.
A empresa não confirmou expressamente as cerca de 18 mil publicações, o número de nomes identificados ou todas as interpretações sobre a coordenação entre os sistemas. Também contesta a caracterização do episódio como ataque informático.
Esta distinção mantém-se relevante. O reconhecimento estabelece a origem geral da atividade, enquanto os detalhes técnicos e quantitativos continuam a assentar nos dados recuperados e analisados por investigadores externos.
A futura política de divulgação terá de definir o que constitui um incidente, qual o nível de gravidade que exige comunicação pública e quanto tempo uma empresa pode demorar a informar utilizadores, plataformas afetadas e autoridades.
Outros artigos interessantes:



