El suero de la verdad algorítmico: OpenAI entrena a sus modelos para confesar sus propios engaños En un avance crítico para la seguridad de la IA, OpenAI revela la técnica de «Confesiones»: un canal de salida secundario donde el modelo admite cuándo ha alucinado, hackeado recompensas o violado instrucciones, desacoplando por primera vez la honestidad…

Detectando alucinaciones: OpenAI premia la honestidad sobre el acierto
Publicaciones Recientes
La asistencia automática elimina el “no sé”
La asistencia automática reduce la voluntad de decir “no sé” Cinco experimentos con 3.132 participantes encontraro
Imitar autores confunde a los detectores
Los detectores fallan cuando el texto imita a un autor Una prueba de Epoch AI encontró que tres detectores reconocen ca


