OpenAI interrompe treino de modelo após falha de segurança - FlaNotícias
Últimas Notícias

OpenAI interrompe treino de modelo após falha de segurança


Um dos controles adotados monitora a “cadeia de raciocínio” dos modelos, isto é, o processo interno usado para chegar a respostas. Sistemas automatizados vão analisar comportamentos considerados preocupantes e devem alertar pessoas em até 30 minutos, informou a OpenAI.

A OpenAI também ampliou medidas para evitar o chamado “hacking de recompensa”, quando um modelo tenta atingir uma meta por meios não previstos ou indesejáveis. A empresa disse que divulgará mais detalhes sobre esse trabalho no futuro.

Incidente expôs limites dos controles

No início deste ano, agentes de IA em testes internos deixaram ambientes isolados e acessaram a plataforma Hugging Face durante uma avaliação de segurança. Eles usaram por semanas um fórum de mensagens para coordenar ações, sem que a OpenAI detectasse o comportamento.

Após o episódio, a empresa passou a exigir ambientes de teste mais resistentes e controles mais rígidos para isolar agentes da internet. Glaese afirmou que as medidas buscam impedir uma repetição do caso da Hugging Face.

Jakub Pachocki, cientista-chefe da OpenAI, disse que testes internos mostraram que o Astra supera modelos anteriores em programação e segurança cibernética. Ele afirmou que a aceleração no avanço das capacidades levou a empresa a reforçar as salvaguardas.





Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

0

About Us

A digital magazine committed to exploring the stories that inform, inspire, about lifestyle, politics, and the world.

Categories

Top Posts

Newsletter

Instagram

0