El nuevo trabajo del equipo de alineación sostiene que entrenar modelos con aprendizaje por refuerzo sobre rasgos beneficiosos, como honestidad, corregibilidad, transparencia y sensibilidad al riesgo, puede producir mejoras que se transfieren a tareas no vistas y resisten mejor la…
La IA prefiere mentir para caerte bien hasta que le activan este modo
Desde sus inicios, la búsqueda de una inteligencia artificial capaz de razonar, crear y asistir al ser humano ha estado marcada por una paradoja inquietante. A medida que estos sistemas ganan en complejidad y elocuencia, también perfeccionan una habilidad humana demasiado familiar: la capacidad de engañar. No se trata de una malicia intrínseca, ni de…


