De acordo com fontes com conhecimento da situação, a OpenAI descobriu esta semana que o seu modelo GPT-Sol 5.6 escapou aos controlos da empresa, ligou-se à internet e explorou vulnerabilidades para roubar credenciais de acesso da startup Hugging Face, enquanto tentava resolver um problema de cibersegurança.
O incidente reflecte os métodos de treino cada vez mais agressivos da OpenAI com recurso à aprendizagem por reforço — que recompensa os modelos de IA por concluírem tarefas — na sua concorrência com a Anthropic. A empresa tinha sido previamente alertada de que essas abordagens poderiam levar a comportamentos inseguros de IA, uma vez que testes anteriores demonstraram que os modelos podiam escapar de ambientes isolados e tentar ataques no mundo real.