Suscríbete a MUNDO IA

Investigadores lograron que ChatGPT pruebe una conjetura matemática que ningún humano había resuelto

Generated Image April 19, 2026 - 7_14PM

Investigadores lograron que ChatGPT pruebe una conjetura matemática que ningún humano había resuelto

La máquina que demostró lo que los matemáticos no podían
Un equipo de investigadores de la Vrije Universiteit Brussel documentó cómo ChatGPT-5.2 resolvió de manera autónoma la Conjetura 20 de Ran y Teng, un problema de teoría espectral de matrices que había permanecido sin demostración formal desde 2024. El resultado inauguró un método de trabajo inédito que sus propios autores denominaron "vibe-proving": la construcción de pruebas matemáticas originales mediante sesiones iterativas de conversación con un modelo de lenguaje comercial

En matemáticas, una conjetura es una afirmación suspendida en el aire: todo parece indicar que es verdadera, los cálculos la respaldan, los patrones la confirman, pero nadie ha construido todavía el argumento que la convierta en certeza formal. Permanece así, flotando entre la intuición y el rigor, hasta que alguien cierra la brecha con una demostración definitiva. Durante siglos, ese alguien fue siempre humano. A principios de 2026, por primera vez documentada, no lo fue.

Brecht Verbeken, investigador posdoctoral del Laboratorio de Análisis de Datos de la Vrije Universiteit Brussel (VUB), tenía entre manos la Conjetura 20 de Ran y Teng: un problema publicado en 2024 que describía la región espectral exacta de una familia de matrices no negativas estocásticas por filas, asociadas a ciclos de cuatro nodos. El objeto matemático es técnico, pero la pregunta de fondo resulta elegante: ¿dónde, con precisión, se ubican en el plano complejo los valores propios no reales de ese tipo de estructuras algebraicas? Ran y Teng creían saberlo. Nadie lo había probado.

Verbeken decidió intentarlo con una herramienta que ningún matemático de generaciones anteriores tuvo disponible. Le planteó el problema a ChatGPT-5.2, el modelo de OpenAI con razonamiento extendido. Lo que ocurrió en las semanas siguientes redefinió, de manera silenciosa pero contundente, lo que puede entenderse por colaboración científica.

El problema que nadie había cerrado

La conjetura de Ran y Teng pertenece al terreno de la teoría espectral de matrices, una rama con conexiones profundas en física, ciencias de la computación y modelado de sistemas dinámicos. Determinar con exactitud las regiones del plano complejo donde pueden habitar los valores propios no reales de ciertas matrices no es solo un ejercicio de abstracción: informa el diseño de algoritmos numéricos, la estabilidad de procesos estocásticos y la comprensión de cadenas de Markov con estructuras cíclicas. La conjetura era técnicamente accesible pero resistía los intentos de cierre formal desde su publicación.

Cuando Verbeken comenzó las sesiones de trabajo, no buscaba que la máquina "pensara" en ningún sentido filosófico. Buscaba una herramienta capaz de explorar caminos de demostración con rapidez y sin el cansancio que agota a cualquier mente humana después de horas de cálculo algebraico denso. "Tenía la sospecha de que podría ayudarme a probar problemas matemáticos no resueltos", declaró el investigador en el comunicado oficial de la VUB. "Y sin embargo, me sorprendió la eficiencia con la que funcionó."

El proceso se documentó con una transparencia inusual en la práctica científica. El equipo, que incluye también a los profesores Vincent Ginis y Andres Algaba del mismo laboratorio, analizó siete sesiones completas de diálogo y cuatro versiones sucesivas del argumento, cada una más refinada que la anterior. La lógica de trabajo siguió tres movimientos: el sistema proponía una estructura de demostración, los investigadores evaluaban su consistencia y señalaban los puntos débiles, y devolvían el problema con nuevas restricciones. La máquina no generó el resultado en una sola pasada. Lo construyó de manera iterativa, del mismo modo en que lo haría cualquier matemático que trabaja con un colaborador exigente y meticuloso.

El artículo resultante, publicado en arXiv en febrero de 2026, no afirma que un sistema computacional haya reemplazado al razonamiento matemático humano. Afirma algo más matizado y, en cierta medida, más perturbador: que un modelo de lenguaje disponible por suscripción ordinaria puede generar de manera autónoma la estructura central de una prueba matemática original, a nivel de investigación de vanguardia, con una intervención humana mínima durante el proceso de búsqueda.

Siete conversaciones y un teorema

El método que emergió de esas sesiones recibió el nombre de "vibe-proving", término acuñado por analogía directa con el "vibe coding" que se popularizó en el desarrollo de software: la práctica de guiar a un modelo de lenguaje con instrucciones aproximadas y refinamientos sucesivos, confiando en su capacidad de inferencia para completar los detalles técnicos. Trasladar esa dinámica al territorio de la demostración matemática formal representa un salto cualitativo considerable, porque la matemática no admite plausibilidad: cada paso del argumento debe ser correcto o el edificio entero se derrumba.

"Escuchar que la creatividad de estos sistemas está fundamentalmente limitada a reformulaciones de sus datos de entrenamiento es algo que oímos con frecuencia. Con nuestro trabajo podemos desmentir esa idea." Vincent Ginis, profesor del Laboratorio de Análisis de Datos, Vrije Universiteit Brussel

La distinción entre lo que aportó el modelo y lo que aportaron los investigadores quedó bien delimitada en el paper. ChatGPT-5.2 demostró ser especialmente valioso en la búsqueda de alto nivel: identificar qué técnicas algebraicas podían funcionar, explorar analogías con problemas ya resueltos y construir el andamiaje lógico general del argumento. Los investigadores humanos, por su parte, fueron imprescindibles en lo que los autores denominan "cierre crítico de corrección": verificar que cada paso fuera formalmente válido, detectar inferencias defectuosas y asegurar que la demostración final resistiera el escrutinio de pares con la solidez que exige la publicación científica.

El resultado matemático concreto fue un teorema que establece las condiciones necesarias y suficientes para que un número complejo pertenezca a la región espectral no real de la familia estudiada, con construcciones explícitas de los casos límite. Es, en el vocabulario de la disciplina, una caracterización completa del problema. "Formular pruebas candidatas puede ser ahora mucho más rápido, pero el cuello de botella pasa a ser la verificación humana. Eso lleva tiempo. Los modelos de lenguaje también nos ayudarán ahí", señaló el profesor Andres Algaba en el comunicado de la universidad flamenca.

El precedente no surge en el vacío. En diciembre de 2025, Johannes Schmitt, matemático de la ETH de Zúrich, publicó un artículo en el que GPT-5 y Gemini 3 Pro demostraron una desigualdad sobre integrales de descendientes extremales en espacios de móduli de curvas, un problema de geometría algebraica de considerable densidad técnica. Schmitt identificó con precisión qué líneas del argumento escribió el modelo y cuáles escribió él, ofreciendo un nivel de trazabilidad infrecuente en la literatura científica. Su conclusión fue similar a la de Verbeken: el sistema aportó una solución elegante que recurrió, de manera inesperada, a técnicas provenientes de un área diferente de la geometría algebraica, en lugar de aplicar los métodos habituales del campo.

Más que un asistente, menos que un matemático

Contribución relativa estimada del modelo de lenguaje y de los investigadores humanos en cada fase del proceso de vibe-proving, según la caracterización del equipo de la VUB en arXiv:2602.18918v1. Los porcentajes reflejan la distribución del trabajo documentada en el paper y no son cifras cuantitativas exactas declaradas por los autores, sino una interpretación editorial de su caracterización cualitativa.

El contexto más amplio ilumina la dimensión real del avance. En julio de 2025, un sistema experimental de OpenAI alcanzó el nivel de medalla de oro en la Olimpiada Internacional de Matemáticas, resolviendo cinco de seis problemas sin módulos especializados de razonamiento. AlphaGeometry2, el sistema de DeepMind, resolvió el 84% de los problemas de geometría de las olimpiadas históricas entre 2000 y 2024, superando el rendimiento promedio de un medallista de oro humano. Cada uno de esos hitos representó un tipo distinto de capacidad: razonamiento competitivo bajo presión en un caso, dominio de una disciplina específica mediante herramientas propietarias en el otro.

Lo que distingue el trabajo de la VUB es el carácter de la tarea y la accesibilidad del recurso. Resolver una conjetura de investigación activa, con un modelo disponible por suscripción ordinaria, en sesiones auditables y reproducibles, transforma la ecuación de lo que un investigador individual puede abordar. No hace falta un laboratorio con infraestructura extraordinaria ni un sistema diseñado con fines específicos. Hace falta una pregunta bien formulada, un interlocutor humano con dominio del campo y disciplina suficiente para iterar.

El matemático Terence Tao, considerado uno de los intelectos más agudos de su generación en la disciplina, también trabajó públicamente con modelos de lenguaje durante 2025, aunque en una dirección diferente. En lugar de solicitar resultados originales, utilizó ChatGPT para traducir un paper complejo al lenguaje formal de Lean, un asistente de pruebas que permite verificar argumentos matemáticos con precisión mecánica. La colaboración produjo una demostración formalizada de 1.125 líneas. Tao señaló con claridad las limitaciones del proceso: el modelo comprende los enunciados y redacta proposiciones correctas con fluidez, pero tiende a bloquearse ante los pasos más delicados. No es un matemático autónomo. Es un colaborador de gran potencia con zonas de fragilidad bien definidas.

El cuello de botella cambia de lugar. Antes de estos sistemas, el límite era la capacidad humana de generar y explorar hipótesis de demostración en cantidad suficiente. Ahora, según los autores del paper de la VUB, ese límite se desplaza hacia la verificación: confirmar que cada argumento generado por el modelo sea formalmente correcto sigue requiriendo juicio experto humano, y ese proceso no se acelera con la misma facilidad.

Lo que cambia, en todos estos casos, es el ritmo y el alcance del trabajo posible. Un investigador solo, con tiempo limitado, puede hoy explorar territorios matemáticos que antes requerían equipos enteros o años de trabajo individual. Las barreras no son únicamente de conocimiento: son de resistencia cognitiva, de tiempo de cómputo mental, de capacidad para mantener abiertas de manera simultánea múltiples estrategias de ataque sobre un mismo problema. En ese espacio preciso, la asistencia algorítmica no sustituye la competencia matemática; la multiplica sin reemplazar el criterio que decide cuándo un argumento es realmente correcto.

El caso de la conjetura de Ran y Teng no es el punto de llegada de esta historia. Es, con mayor probabilidad, uno de sus primeros capítulos documentados con rigor. El laboratorio de la VUB lo sabe. El título de su paper habla de "evidencia temprana". La expresión lleva todo el peso.

Referencias

Verbeken, Brecht; Ginis, Vincent; Algaba, Andres et al. "Early Evidence of Vibe-Proving with Consumer LLMs: A Case Study on Spectral Region Characterization with ChatGPT-5.2 (Thinking)." arXiv:2602.18918v1. 20 de febrero de 2026. DOI: 10.48550/arxiv.2602.18918

VUB Press Office. "ChatGPT can autonomously provide mathematical proofs." press.vub.ac.be. 15 de marzo de 2026.

Phys.org / Free University of Brussels. "ChatGPT can provide original mathematical proofs, researchers show." phys.org. 16 de marzo de 2026.

Schmitt, Johannes. "Extremal Descendant Integrals on Moduli Spaces of Curves: An Inequality Discovered and Proved in Collaboration with AI." arXiv:2512.14575v1. ETH Zürich. 16 de diciembre de 2025.

The Decoder. "GPT-5 allegedly solves open math problem without human help." the-decoder.com. 21 de diciembre de 2025.

SciTechDaily. "For the First Time, ChatGPT Has Solved an Unproven Math Problem in Geometry." scitechdaily.com. 29 de marzo de 2026.

Intuition Labs. "AI Reasoning: Gold-Medal Performance at the 2025 IMO." intuitionlabs.ai. 20 de julio de 2025.

AlphaGeometry2 Team, Google DeepMind. "Gold-medalist Performance in Solving Olympiad Geometry." arXiv:2502.03544v1. 2026.

36kr. "Terence Tao: Revolutionizing Research Paradigm with AI." en.36kr.com. 4 de noviembre de 2025.

Publicaciones Recientes

ChatGPT Image 18 jul 2026, 21_02_14

La asistencia automática elimina el “no sé”

La asistencia automática reduce la voluntad de decir “no sé” Cinco experimentos con 3.132 participantes encontraro
Leer Más
ChatGPT Image 18 jul 2026, 20_47_48

Imitar autores confunde a los detectores

Los detectores fallan cuando el texto imita a un autor Una prueba de Epoch AI encontró que tres detectores reconocen ca
Leer Más