El algoritmo traidor: Cómo el Aprendizaje por Refuerzo rompió la seguridad de un gigante de 235B en 30 pasos La misma técnica que se utilizó para enseñar a ChatGPT a ser amable y seguro ha sido invertida con una eficacia aterradora. Un nuevo experimento publicado en Hugging Face demuestra que, con acceso a herramientas de…

Adiós a la alineación: Un solo ingeniero corrompió a un gigante tecnológico en minutos
Publicaciones Recientes
La asistencia automática elimina el “no sé”
La asistencia automática reduce la voluntad de decir “no sé” Cinco experimentos con 3.132 participantes encontraro
Imitar autores confunde a los detectores
Los detectores fallan cuando el texto imita a un autor Una prueba de Epoch AI encontró que tres detectores reconocen ca


