Usamos cookies para medir audiência e melhorar sua experiência. Você pode aceitar ou recusar a qualquer momento. Veja sobre o iMasters.
Testar modelos de IA com cenários adversariais mostra que até os mais avançados, como Llama, Qwen e GPT-OSS, têm suas fragilidades. Mesmo com uma estrutura de avaliação de três níveis e dezenas de assertions, eles não passam de 63% de sucesso.
Carregando comentários...