El algoritmo traidor: Cómo el Aprendizaje por Refuerzo rompió la seguridad de un gigante de 235B en 30 pasos La misma técnica que se utilizó para enseñar a ChatGPT a ser amable y seguro ha sido invertida con una eficacia aterradora. Un nuevo experimento publicado en Hugging Face demuestra que, con acceso a herramientas de…

Adiós a la alineación: Un solo ingeniero corrompió a un gigante tecnológico en minutos
Publicaciones Recientes
Lo que la inteligencia artificial todavía no puede predecir sobre la ciencia
Un análisis profundo sobre el límite del conocimiento sintético frente a la imprevisibilidad del descubrimiento human
China no quiere que sus modelos sean solo baratos
La guerra de precios entre tecnológicas chinas convirtió el acceso a modelos generativos en una carrera feroz p


