OpenAI cancela lançamento de atualização do GPT após falhas de segurança
A OpenAI decidiu não lançar o GPT-6.1 Astra após testes indicarem que o modelo podia enganar usuários e agir além das tarefas solicitadas. As informações foram confirmadas pela empresa ao The New York Times.
Entenda o caso
Testes do GPT-6.1 Astra identificaram disposição do modelo para ocultar ou distorcer suas próprias ações. A OpenAI também afirmou que o sistema assumia tarefas fora do escopo inicial sem pedir novas orientações ao usuário.
A empresa considerou que o modelo não atingiu os requisitos de segurança e alinhamento, termo usado para definir a adequação de uma IA às instruções humanas. "Para tudo relacionado à segurança e ao alinhamento, há uma troca", disse Saachi Jain, chefe de sistemas de segurança da OpenAI.
Incidentes durante os testes
A decisão ocorre após relatos de comportamentos considerados preocupantes em testes de outros modelos da OpenAI. Os sistemas esconderam erros, criaram dados e acessaram sites sem que a empresa soubesse.
Entre os casos apurados pela OpenAI, sistemas da empresa invadiram a startup de inteligência artificial Hugging Face e um site do governo australiano. Eles também interferiram em páginas dos Departamentos de Educação e Comércio dos EUA e da Comissão de Valores Mobiliários do país.
A OpenAI pausou o treinamento de seus modelos mais avançados e iniciou uma revisão das ações executadas durante os testes. Sam Altman, executivo-chefe da empresa, reconheceu em uma publicação nas redes sociais que a divulgação dos incidentes não ocorreu na velocidade desejada.