La industria de la inteligencia artificial, durante largo tiempo, midio su progreso con un termometro roto. Los grandes modelos de lenguaje alcanzaron el 90% de precision en MMLU, el benchmark academico mas popular, con tanta rapidez que el instrumento dejo de medir lo que importaba. Era como calificar a un estudiante de doctorado con un examen de secundaria: los numeros lucian impresionantes pero no decian nada sobre las capacidades reales en la frontera del conocimiento humano. En respuesta a este problema estructural, el Center for AI Safety y Scale AI diseñaron HLE (Humanity's Last Exam) y acaban de publicar sus resultados en Nature, la revista cientifica mas prestigiosa del mundo. Lo que encontraron es tan revelador como perturbador: ningun modelo de IA, ni siquiera los mas avanzados disponibles en 2026, logra responder correctamente mas de una cuarta parte de las preguntas.
HLE fue publicado el 28 de enero de 2026 en Nature (Vol. 649) y es el resultado de un esfuerzo global sin precedentes en la historia de la evaluacion de IA. Casi 1.000 expertos de nivel doctoral, entre profesores, investigadores y titulares de PhDs, provenientes de mas de 500 instituciones en 50 paises diseñaron 2.500 preguntas originales que los modelos de frontera no pueden responder mediante busqueda en internet ni memorizacion de datos de entrenamiento. Las preguntas abarcan mas de 100 materias, desde matematicas de nivel mundial hasta linguistica del hebreo biblico, pasando por quimica organica, ecologia e informatica teorica. El resultado es un espejo brutal que muestra cuanto camino le queda a la IA para alcanzar verdadero desempeno experto en dominios academicos cerrados y verificables.
Por que los benchmarks existentes ya no sirven
El problema de la saturacion de benchmarks no es trivial. Cuando un modelo de IA supera el 90% en una prueba diseñada para medir sus capacidades, esa prueba deja de ser informativa. No permite distinguir entre un modelo medianamente bueno y uno excepcional, ni detectar mejoras marginales en capacidades de frontera. MMLU, que fue durante anos la referencia estandar de la industria, ya no cumple esa funcion. Lo mismo ocurrio con GPQA, las preguntas a prueba de Google, y con el benchmark ARC, ambos saturados en cuestion de meses o pocos anos tras su lanzamiento. Este ciclo de saturacion es uno de los desafios mas persistentes y costosos en la investigacion moderna de IA.
La solucion que propone HLE es elegante y brutal a la vez: disenar preguntas que, por construccion, los modelos de frontera no puedan responder. Cada pregunta fue validada contra LLMs de frontera antes de ser incluida. Si un modelo podia responderla correctamente, la pregunta era rechazada. De mas de 70.000 intentos registrados durante la recoleccion, aproximadamente 13.000 preguntas sobrevivieron el filtro inicial para luego pasar a revision experta humana de dos rondas. El resultado final es un dataset de 2.500 preguntas con una tasa de error cercana al 100% para los mejores modelos del planeta. Un fracaso diseñado con precision quirurgica para medir exactamente lo que la IA todavia no puede hacer.
La arquitectura del benchmark mas ambicioso de la historia
Para garantizar la calidad y dificultad de HLE, sus creadores establecieron un proceso de multiples etapas que combina validacion automatica mediante LLMs con revision humana experta de dos rondas. El proceso comenzo con mas de 70.000 intentos de modelos sobre preguntas candidatas. Solo aquellas que los modelos no podian responder avanzaron a la revision humana. Los revisores poseen al menos un titulo de maestria o doctorado en su campo y evaluaron las preguntas contra rubricas estandarizadas, ofreciendo retroalimentacion iterativa a los contribuyentes antes de la aprobacion final por parte de los organizadores.
Para atraer contribuciones de alta calidad, el proyecto establecio un fondo de premios de USD 500.000: USD 5.000 para cada una de las 50 mejores preguntas y USD 500 para las siguientes 500. Ademas, todos los contribuyentes con preguntas aceptadas obtuvieron coautoria en el paper de Nature, un incentivo no menor en la academia. Este modelo de incentivos explica la participacion masiva de expertos de primer nivel de instituciones como MIT, Stanford, Cambridge, Oxford y la Universidad de Sao Paulo, entre cientos de otras. El resultado es un benchmark genuinamente global con 14% de preguntas multimodales, 24% de opcion multiple y el resto de respuesta exacta verificable automaticamente.
Los resultados: precision devastadoramente baja en todos los modelos
Los numeros son impactantes por su uniformidad: todos los modelos de frontera evaluados en HLE muestran precision criticamente baja. GPT-4o, el modelo mas usado del mundo hasta hace pocos meses, logra apenas el 2,7%. Claude 3.5 Sonnet alcanza el 4,1%. Gemini 1.5 Pro llega al 4,6%. Los modelos de razonamiento muestran resultados algo mejores: o1 de OpenAI obtiene el 8,0% y DeepSeek R1 llega al 8,5%. Los modelos mas recientes, evaluados despues del lanzamiento publico del benchmark, muestran mejoras pero siguen por debajo del 30%: Claude 4 Sonnet obtiene el 7,8%, Gemini 2.5 Pro llega al 21,6% y GPT-5 alcanza el 25,3%. La barrera del 30% no fue superada por ningun modelo en las evaluaciones publicadas.
Estos resultados son parcialmente consecuencia del diseno del benchmark, dado que las preguntas fueron seleccionadas precisamente porque los modelos no podian responderlas, pero eso no minimiza su significado real. La brecha entre el desempeno de GPT-4o (2,7%) y GPT-5 (25,3%) en apenas unos meses sugiere que el progreso es real y acelerado. Sin embargo, tambien ilustra que incluso los modelos mas avanzados disponibles en 2026 estan a anos de demostrar capacidad experta genuina en los dominios mas exigentes del conocimiento humano. La pregunta ya no es si la IA puede superar a humanos en tareas simples, sino si puede operar al nivel de los mejores especialistas del mundo en sus campos de experticia.
⚠️ El problema de calibracion: mas grave que la baja precision
Que significa: Un modelo bien calibrado deberia expresar 50% de confianza cuando acierta el 50% del tiempo. Los modelos en HLE expresan alta confianza incluso cuando tienen tasas de error del 95-97%, lo que significa que creen que saben cuando en realidad no saben
Los numeros concretos: GPT-4o tiene error de calibracion RMS del 89%. Claude 3.5 Sonnet, 84%. Gemini 1.5 Pro, 88%. o1, 83%. DeepSeek R1, 73%. Incluso GPT-5, el mejor modelo en precision, tiene error de calibracion del 50%
Implicancia practica: En aplicaciones reales, un modelo que no sabe cuando esta equivocado es mas peligroso que uno que simplemente no sabe. Las alucinaciones confiadas son mas dificiles de detectar y corregir que las respuestas con incertidumbre declarada
La paradoja del conocimiento: GPT-4o acierta el 2,7% pero expresa alta confianza en sus respuestas, lo que implica que esta sistematicamente seguro de respuestas incorrectas. Es el equivalente digital del efecto Dunning-Kruger a escala industrial
El scaling de razonamiento: mas pensamiento no siempre es mejor
Uno de los hallazgos mas matizados del paper involucra el analisis de los modelos de razonamiento, disenados para generar tokens intermedios antes de producir una respuesta final simulando un proceso de pensar antes de responder. La intuicion es que mas tiempo de razonamiento deberia producir mejores respuestas en preguntas dificiles. HLE confirma esto, pero solo hasta un punto critico. Existe una relacion log-lineal entre el numero de tokens de razonamiento generados y la precision de las respuestas: modelos que piensan mas obtienen mejores resultados, pero ese beneficio tiene un techo claro y verificable.
Ese techo ocurre alrededor de 2 elevado a 14 tokens de razonamiento, aproximadamente 16.384 tokens. Mas alla de ese umbral, la precision no solo deja de mejorar sino que comienza a revertirse: el modelo piensa demasiado y empeora. Este fenomeno tiene implicancias importantes para el diseno de modelos futuros. Sugiere que simplemente aumentar el presupuesto de razonamiento no es la ruta correcta hacia el desempeno experto, y que los modelos necesitan mejorar no solo su conocimiento bruto sino su eficiencia cognitiva: saber cuando seguir pensando y cuando una respuesta ya esta suficientemente fundada.
📊 Distribucion de preguntas en HLE por categoria
Matematicas (41%): El area con mayor representacion, con problemas de nivel investigacion incluyendo teoria de categorias, topologia algebraica, analisis complejo, combinatoria avanzada y geometria diferencial
Biologia y Medicina (11%): Preguntas de biologia molecular, fisiologia especializada y medicina clinica que requieren conocimiento de publicaciones recientes o datos altamente especificos de subespecialidades
Computacion e IA (10%): Algoritmos, complejidad computacional, teoria de grafos y aprendizaje automatico teorico con razonamiento formal sobre estructuras matematicas abstractas
Fisica (9%), Humanidades y Cs. Sociales (9%), Quimica (7%), Ingenieria (4%), Otras (9%): El resto del espectro academico, con enfasis en preguntas que exigen sintesis no trivial de conocimiento altamente especializado o dominio de fuentes primarias en campos como linguistica historica, epigrafia o derecho comparado
Lo que HLE no mide: limites explicitos del benchmark
Los propios autores son explicitos sobre lo que HLE no pretende ser. Alta precision en HLE demostraria capacidad experta en preguntas academicas cerradas y conocimiento cientifico de frontera, pero no implicaria por si solo capacidades de investigacion autonoma ni inteligencia artificial general. HLE testea problemas estructurados con respuestas unicas y verificables, no resolucion de problemas abiertos, generacion de hipotesis novedosas ni creatividad cientifica. Un modelo que lograra el 100% en HLE demostraria dominio enciclopedico de alto nivel pero no necesariamente podria disenar un experimento original o adaptarse a contextos radicalmente nuevos sin precedente en la literatura.
El benchmark tambien presenta sesgos estructurales reconocidos por sus creadores. La distribucion de preguntas favorece fuertemente las matematicas y las STEM, reflejando los perfiles de los contribuyentes, mayoritariamente academicos de ciencias exactas de universidades del norte global. Las humanidades, las ciencias sociales y los saberes no occidentales estan subrepresentados. Ademas, el benchmark usa ingles como idioma exclusivo, lo que puede subestimar o sobreestimar capacidades en idiomas como el espanol, el mandarin o el arabe, donde los datos de entrenamiento y los contextos culturales son sustancialmente diferentes.
✅ Por que HLE importa para la investigacion y la gobernanza de IA
Punto de referencia objetivo: HLE proporciona una metrica dificilmente manipulable para comparar modelos, crucial para investigadores y reguladores que necesitan evaluar capacidades reales versus capacidades de marketing presentadas en comunicados de prensa
Senal anti-hype verificable: Cuando una empresa anuncia un modelo revolucionario, HLE ofrece una forma concreta de verificar si el progreso es real o solo relativo a benchmarks faciles ya saturados
Deteccion temprana de progreso genuino: A diferencia de benchmarks saturados, HLE puede detectar mejoras incrementales durante anos antes de ser superado, dando a la comunidad tiempo para prepararse ante avances hacia capacidades expertas reales
Insumo para politica publica: Reguladores en la UE, EE.UU. y el Reino Unido pueden usar HLE como referencia para establecer umbrales de capacidad que activen requisitos regulatorios adicionales para modelos de alto impacto
Legitimidad institucional: La publicacion en Nature le otorga una credibilidad que los benchmarks publicados unilateralmente por empresas de IA no tienen, creando un estandar independiente del sector privado
La perspectiva latinoamericana: soberania en la evaluacion de IA
America Latina ocupa un lugar marginal en el ecosistema de evaluacion de IA. De los casi 1.000 contribuyentes de HLE, solo una institucion latinoamericana aparece explicitamente citada entre los ejemplos ilustrativos del paper: la Universidad de Sao Paulo, a traves de una contribuyente brasilena. Esto refleja una tendencia estructural: la investigacion de frontera en IA, incluyendo la construccion de sus instrumentos de medicion, sigue concentrada en el norte global. Los parametros con que se mide la IA son diseñados en San Francisco, Cambridge y Zurich, no en Buenos Aires, Ciudad de Mexico o Bogota.
Esta concentracion tiene consecuencias concretas para Argentina y la region. Los modelos evaluados en HLE son los mismos que se despliegan comercialmente en America Latina: GPT-4o, Claude, Gemini. Sus tasas de error en preguntas expertas, que superan el 90%, se aplican independientemente del idioma o contexto cultural del usuario. Sin embargo, el sesgo del benchmark hacia el ingles y las STEM significa que las capacidades de estos modelos en dominios como el derecho argentino, la historia latinoamericana o la literatura en espanol no estan bien representadas ni en los instrumentos de evaluacion ni en los datos de entrenamiento. Los usuarios argentinos utilizan herramientas evaluadas con estandares que no contemplan sus contextos especificos.
Que sigue: el futuro de los benchmarks de IA
Los propios creadores de HLE reconocen que la historia reciente sugiere que hasta los benchmarks mas dificiles terminan siendo saturados. El camino de precision casi nula a precision casi perfecta en un lapso corto es un patron recurrente en la IA moderna: MMLU paso de ser un desafio formidable a ser trivial en pocos anos. Lo notable de GPT-5 logrando el 25,3% apenas semanas despues del lanzamiento de HLE, cuando los modelos originalmente evaluados no superaban el 8,5%, sugiere que ese proceso de saturacion ya esta en marcha y podria acelerarse con los proximos lanzamientos de modelos.
Mientras tanto, HLE cumple una funcion critica que va mas alla de la medicion tecnica: ancla la conversacion sobre capacidades de IA a datos concretos y verificables publicados en un foro cientifico independiente. En un campo donde las afirmaciones de capacidades humanas o superhumanas abundan en comunicados de prensa, tener un instrumento publicado en Nature que demuestra que el mejor modelo disponible falla el 74,7% de las preguntas de nivel experto es un correctivo saludable y necesario. No es que la IA no este progresando sino que ese progreso ocurre desde una linea de base que aun esta muy lejos de la comprension experta genuina en los dominios mas exigentes del conocimiento humano acumulado.
Referencias
Center for AI Safety, Scale AI y HLE Contributors Consortium. "A benchmark of expert-level academic questions to assess AI capabilities." Nature, Vol. 649, pp. 1139-1144, 28 de enero de 2026. https://doi.org/10.1038/s41586-025-09962-4
Hendrycks, D. et al. "Measuring massive multitask language understanding." Proceedings of ICLR, 2021.
Rein, D. et al. "GPQA: A graduate-level Google-proof Q&A benchmark." Proceedings of COLM, 2024.
Chollet, F., Knoop, M., Kamradt, G. y Landers, B. "ARC Prize 2024: technical report." arXiv:2412.04604, 2024.
Guo, D. et al. "DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning." Nature, Vol. 645, pp. 633-638, 2025.
Hendrycks, D. et al. "A definition of AGI." arXiv:2510.18212, 2025.
lastexam.ai - Repositorio publico de HLE con evaluaciones actualizadas: https://lastexam.ai



