Las IA alcanzan el 48% en el 'Último Examen de la Humanidad', lejos aún del dominio experto

Competente, pero todavía distante del dominio experto
La brecha de 42 puntos entre el rendimiento de Gemini y los expertos humanos sitúa a la IA en un terreno intermedio.
Mark

¿Por qué fue necesario crear un examen tan complejo? ¿No existían ya formas de medir el rendimiento de las IA?

Mimi

Existían benchmarks, pero muchos tenían un problema fundamental: las IA podían encontrar las respuestas en internet o habían sido entrenadas con preguntas similares. Este examen fue diseñado específicamente para evitar eso. Más de 70.000 preguntas fueron rechazadas porque los modelos ya las respondían correctamente.

Luke

Pero aquí hay una pregunta importante: ¿cómo sabemos que esas 2.500 preguntas finales son realmente representativas del conocimiento experto? Un panel de 1.000 expertos es grande, pero ¿cubrieron todas las disciplinas de manera equilibrada?

Mark

El resultado de Gemini es 48,4%. ¿Eso es bueno o malo?

Mimi

Depende de la perspectiva. Hace apenas un año, el mejor modelo tenía 8,3%. En ese sentido, es un avance espectacular. Pero comparado con expertos humanos que alcanzan 90%, sigue siendo una brecha enorme.

Luke

Y aquí viene lo importante: ¿esos expertos humanos fueron evaluados exactamente con el mismo examen? ¿O se trata de estimaciones de su desempeño típico en sus campos? Eso cambiaría mucho la interpretación.

Mark

Los investigadores predijeron que las IA superarían el 50% antes de fin de 2025. ¿Qué significa que casi lo logren pero no del todo?

Mimi

Significa que el ritmo de mejora es real pero no es exponencial infinito. Las IA están mejorando, pero cada punto porcentual adicional parece costar más esfuerzo que el anterior.

Luke

Aunque también hay que considerar que Gemini 3 Deep Think es un modelo específicamente diseñado para tareas de razonamiento profundo. No sabemos si otros modelos más generales podrían alcanzar esos números con arquitecturas diferentes.

  • Lo que comenzó como un 8,3% de aciertos en enero de 2025 ha escalado hasta casi la mitad de las respuestas correctas en poco más de un año, un ritmo de progreso que inquieta tanto como asombra.
  • La brecha de 42 puntos porcentuales entre el mejor modelo de IA y los expertos humanos pone en evidencia que la competencia no equivale aún al dominio real.
  • El diseño del examen fue deliberadamente implacable: de más de 70.000 preguntas propuestas, solo 2.500 sobrevivieron los filtros para garantizar que ninguna pudiera resolverse con una simple búsqueda en internet.
  • ChatGPT, Claude y DeepSeek participaron en la evaluación, pero ninguno superó al modelo de Google, lo que convierte a Gemini 3 Deep Think en el nuevo referente de capacidad en IA.
  • El debate sobre la inteligencia artificial general se reactiva: los modelos avanzan más rápido de lo previsto, pero el camino hacia una verdadera equivalencia con el experto humano sigue siendo largo y empinado.

En el umbral entre la máquina y el experto, investigadores del Center for AI Safety y Scale AI diseñaron una prueba de 2.500 preguntas de nivel doctoral para medir hasta dónde han llegado realmente los grandes modelos de lenguaje. El mejor resultado obtenido hasta ahora, un 48,4% logrado por Gemini 3 Deep Think, revela tanto el asombroso avance de la inteligencia artificial como la distancia que aún la separa del conocimiento humano especializado, que ronda el 90%. Este examen, publicado en Nature y construido por más de mil expertos de cincuenta países, se ha convertido en el espejo más honesto que la humanidad ha sostenido frente a sus propias creaciones.

A principios de 2025, investigadores del Center for AI Safety y Scale AI presentaron el Último Examen de la Humanidad: 2.500 preguntas de nivel doctoral elaboradas por más de mil expertos de 500 instituciones en 50 países. Publicado en Nature el 28 de enero, el examen abarcaba más de 100 disciplinas —desde mitología griega hasta física avanzada— y fue construido con un criterio implacable: cada pregunta debía ser precisa, verificable y no resoluble mediante una búsqueda en internet. De más de 70.000 propuestas iniciales, solo 2.500 superaron todos los filtros.

Cuando se lanzó la prueba, el modelo o1 de OpenAI respondió correctamente apenas el 8,3% de las preguntas. Los investigadores ya anticipaban entonces que, dado el ritmo de desarrollo en IA, los modelos podrían superar el 50% antes de que terminara 2025. La predicción fue casi exacta.

A 12 de febrero de 2026, Gemini 3 Deep Think lidera la clasificación con un 48,4% de aciertos. ChatGPT, Claude y DeepSeek también fueron evaluados, pero ninguno alcanzó esa marca. Sin embargo, la cifra contrasta con el 90% que los expertos humanos alcanzan en sus propios campos, una brecha de 42 puntos que sitúa a la IA en un terreno intermedio: capaz en muchos aspectos, pero todavía lejos del dominio especializado humano.

El Último Examen de la Humanidad ha reabierto el debate sobre la AGI y se ha consolidado como el referente más riguroso para medir el avance real de los grandes modelos de lenguaje. Sus resultados seguirán siendo el espejo más honesto disponible mientras la inteligencia artificial continúa evolucionando.

A principios de 2025, investigadores del Center for AI Safety y Scale AI presentaron una prueba sin precedentes: el Último Examen de la Humanidad, un conjunto de 2.500 preguntas diseñado para medir si los sistemas de inteligencia artificial podían aproximarse al conocimiento especializado humano. La prueba fue publicada en Nature el 28 de enero y rápidamente se convirtió en un referente para evaluar las capacidades reales de los grandes modelos de lenguaje más avanzados del momento.

La construcción del examen fue un esfuerzo colosal. Más de 1.000 expertos procedentes de 500 instituciones distribuidas en 50 países contribuyeron a su elaboración. Las preguntas abarcaban más de 100 materias diferentes, desde mitología griega hasta complejos problemas de física sobre fuerzas y movimiento en sistemas sin fricción. Cada cuestión fue sometida a criterios estrictos: debía ser precisa, verificable y no resoluble mediante una simple búsqueda en internet. De más de 70.000 propuestas iniciales, apenas 13.000 lograron superar un filtro automático que buscaba detectar preguntas que los modelos de inteligencia artificial pudieran responder correctamente. Tras una revisión adicional por especialistas, la cifra se redujo a las 2.500 cuestiones finales, todas equivalentes a nivel de doctorado.

Los impulsores del examen fueron deliberadamente cautelosos con el diseño. Rechazaron cualquier pregunta que pudiera encontrarse fácilmente en la red o que los modelos hubieran respondido correctamente en fases preliminares de prueba. El objetivo era claro: crear un estándar que realmente midiera el dominio experto, no la capacidad de recuperar información disponible públicamente.

Cuando se lanzó la prueba, el modelo o1 de OpenAI ocupó la primera posición con apenas un 8,3% de aciertos. Los investigadores, sin embargo, ya anticipaban entonces que dado el ritmo acelerado de desarrollo en inteligencia artificial, los modelos podrían superar el 50% antes de que finalizara 2025. La predicción resultó ser acertada, aunque el margen temporal fue más ajustado de lo esperado.

A 12 de febrero de 2026, Gemini 3 Deep Think lidera la clasificación con un 48,4% de aciertos. ChatGPT, Claude y DeepSeek también fueron evaluados en la prueba, pero ninguno alcanzó la marca del modelo de Google. La cifra, aunque significativa en términos de progreso, contrasta de manera notable con el rendimiento de expertos humanos, que rondan el 90% en sus respectivos campos de especialización. Esa brecha de aproximadamente 42 puntos porcentuales sitúa a la inteligencia artificial en un terreno intermedio: competente en muchos aspectos, pero todavía distante del dominio experto que caracteriza a los especialistas humanos.

Los resultados reabrieron el debate sobre la proximidad de la inteligencia artificial general, o AGI. Aunque los modelos han avanzado considerablemente desde el 8,3% inicial, la distancia que aún los separa del nivel humano sugiere que el camino hacia una verdadera equivalencia de capacidades sigue siendo sustancial. El Último Examen de la Humanidad se ha consolidado como una herramienta de medición rigurosa, y sus resultados continuarán siendo un punto de referencia mientras los sistemas de inteligencia artificial continúan evolucionando.

Los investigadores anticipaban que los modelos podrían superar el 50% antes de finalizar 2025
— Investigadores del Center for AI Safety y Scale AI
Fale Conosco FAQ