En un mercado donde la inteligencia artificial avanza a ritmo vertiginoso, Anthropic cerró su cuarta generación de modelos con Claude Opus 4.5, una herramienta que no solo establece nuevos récords en evaluaciones de programación, sino que aspira a integrarse en el flujo de trabajo cotidiano de millones de personas. El hito técnico —superar el 80% en SWE-Bench verificado— es apenas la superficie de una apuesta más profunda: que los modelos de IA sean útiles no solo en laboratorios, sino en las hojas de cálculo y los navegadores que ya habitamos cada día.
Anthropic lanza Claude Opus 4.5: más potente en programación y ahora domina Excel
Conocer los detalles correctos para recordar es fundamental
¿Por qué importa tanto que Opus 4.5 supere el 80% en SWE-Bench? ¿Qué significa eso en la práctica?
SWE-Bench mide qué tan bien un modelo puede resolver problemas reales de ingeniería de software. Superar el 80% significa que el modelo puede escribir código que funciona en contextos complejos, no solo ejemplos simples. Para desarrolladores, eso es la diferencia entre una herramienta útil y una que requiere supervisión constante.
Entiendo. Pero ¿por qué Anthropic decidió integrar Excel y Chrome específicamente? ¿No podría haber elegido otras herramientas?
Excel y Chrome son ubicuos en oficinas. La mayoría de trabajadores pasan horas en ellos. Integrar el modelo con estas herramientas significa que la IA puede ayudar con tareas que la gente hace todos los días: analizar datos, buscar información, crear reportes. Es menos glamoroso que hablar de benchmarks, pero es donde la IA toca la vida real.
La función de chat sin fin suena conveniente, pero ¿cómo funciona técnicamente? ¿El modelo realmente "olvida" cosas?
El modelo comprime su memoria en segundo plano. Piensa en ello como tomar notas sobre lo importante de una conversación larga y descartar los detalles menores. El usuario no ve esto sucediendo, pero el modelo mantiene lo esencial para continuar sin perder el hilo.
¿Esto significa que Anthropic está ganando la carrera contra OpenAI y Google?
Es más complicado. Anthropic está ganando en ciertos aspectos técnicos y en cómo piensa sobre la utilidad práctica. Pero la carrera es larga y el mercado es grande. Lo que importa ahora es si los usuarios y empresas realmente adoptan estas mejoras.
O Pulso
- Anthropic completó su línea de cuarta generación con Opus 4.5, intensificando la carrera contra OpenAI, Google y otros rivales que lanzan actualizaciones sin pausa.
- El modelo rompió la barrera del 80% en SWE-Bench verificado, un umbral que la comunidad de desarrolladores consideraba especialmente difícil de alcanzar.
- La integración con Microsoft Excel y navegadores web convierte a Opus 4.5 en un asistente capaz de automatizar investigación, gestión de datos y presentaciones directamente en las herramientas de oficina más usadas.
- La función de 'chat sin fin' resuelve una fricción crónica para usuarios de pago: el modelo comprime su memoria en segundo plano, permitiendo conversaciones complejas y prolongadas sin interrupciones ni pérdida de contexto.
- Según la jefa de producto de Anthropic, el verdadero avance no es solo ver más información, sino saber qué información importa y cómo usarla — una distinción que redefine qué significa mejorar un modelo de IA.
En un mercado donde la inteligencia artificial avanza a ritmo vertiginoso, Anthropic cerró su cuarta generación de modelos con Claude Opus 4.5, una herramienta que no solo establece nuevos récords en evaluaciones de programación, sino que aspira a integrarse en el flujo de trabajo cotidiano de millones de personas. El hito técnico —superar el 80% en SWE-Bench verificado— es apenas la superficie de una apuesta más profunda: que los modelos de IA sean útiles no solo en laboratorios, sino en las hojas de cálculo y los navegadores que ya habitamos cada día.
Anthropic presentó el lunes Claude Opus 4.5, el cierre de su línea de modelos de cuarta generación, tras haber lanzado previamente Sonnet y Haiku. Con este lanzamiento, la empresa refuerza su posición en un mercado de inteligencia artificial donde las capacidades técnicas y la utilidad práctica se han vuelto inseparables.
El nuevo modelo sobresale en evaluaciones clave para desarrolladores: SWE-Bench, Terminal-bench, Tau2-Bench y ARC-AGI 2, entre otras. El logro más destacado es ser el primer modelo en superar el 80% en SWE-Bench verificado, un hito que la comunidad técnica considera especialmente significativo.
Más allá de los benchmarks, Anthropic apostó por la utilidad en entornos reales. Opus 4.5 integra navegadores web y hojas de cálculo de Microsoft Excel, permitiendo automatizar tareas de investigación, gestión de datos y elaboración de presentaciones. La apuesta responde a una convicción clara: los modelos más avanzados deben conectarse con las herramientas que las personas ya usan.
Dianne Na Penn, jefa de gestión de productos de investigación, subrayó que la mejora va más allá de ampliar la ventana de contexto: 'Conocer los detalles correctos para recordar es fundamental'. Esa filosofía habilitó el 'chat sin fin', una función para usuarios de pago que comprime la memoria del modelo en segundo plano, permitiendo conversaciones prolongadas y complejas sin interrupciones ni pérdida de hilo.
Con estas capacidades, Opus 4.5 apunta tanto a desarrolladores que exigen código de calidad como a trabajadores de oficina que buscan automatizar su día a día, diferenciándose en un mercado donde el rendimiento bruto ya no es suficiente.
Anthropic presentó el lunes Claude Opus 4.5, cerrando así su línea de modelos de cuarta generación tras haber lanzado previamente Sonnet y Haiku. Con esta versión, la empresa refuerza su posición en un mercado de inteligencia artificial cada vez más competitivo, donde las capacidades técnicas y la utilidad práctica se han convertido en factores decisivos.
El nuevo modelo destaca por su desempeño en una serie de evaluaciones especializadas que importan a desarrolladores y empresas. Opus 4.5 sobresale en pruebas de programación como SWE-Bench y Terminal-bench, en evaluaciones de uso de herramientas como Tau2-Bench y MCP Atlas, y en resolución de problemas generales con ARC-AGI 2 y GPQA Diamond. Lo más notable: es el primer modelo en superar el 80% en SWE-Bench verificado, un hito que la comunidad de desarrolladores considera especialmente significativo.
Pero Anthropic no se ha limitado a mejorar números en laboratorios. La empresa ha invertido esfuerzo en hacer que Opus 4.5 sea útil en contextos de trabajo real. El modelo ahora integra navegadores web y hojas de cálculo de Microsoft Excel, lo que permite a los usuarios automatizar tareas como investigación, gestión de datos y elaboración de presentaciones. Estas integraciones responden a una realidad: los modelos de IA más avanzados necesitan conectarse con las herramientas que las personas ya usan cada día.
Dianne Na Penn, jefa de gestión de productos de investigación en Anthropic, explicó a medios especializados que la mejora no se reduce a ampliar la ventana de contexto. "Hemos mejorado la calidad general del contexto largo durante el entrenamiento, pero las ventanas de contexto no serán suficientes por sí solas", señaló. "Conocer los detalles correctos para recordar es fundamental, además de disponer de una ventana de contexto más larga". En otras palabras: no basta con que el modelo vea más información; debe saber qué información es relevante y cómo usarla.
Esta mejora en la gestión de contexto habilitó una función que los usuarios de pago llevaban tiempo pidiendo: el chat sin fin. La característica permite que las conversaciones continúen indefinidamente sin interrupciones. El modelo comprime su memoria en segundo plano de manera automática, sin notificar al usuario, evitando así que se pierda información durante interacciones prolongadas. Es un cambio que suena técnico pero que en la práctica significa que los usuarios pueden mantener conversaciones complejas y multifacéticas sin tener que reiniciar o perder el hilo.
Con estos cambios, Opus 4.5 se posiciona como una herramienta pensada tanto para desarrolladores que necesitan código de calidad como para trabajadores de oficina que buscan automatizar tareas cotidianas. En un mercado donde OpenAI, Google y otros competidores lanzan actualizaciones constantemente, Anthropic apunta a diferenciarse no solo en rendimiento bruto sino en utilidad tangible.
Citações Notáveis
Hemos mejorado la calidad general del contexto largo durante el entrenamiento, pero las ventanas de contexto no serán suficientes por sí solas. Conocer los detalles correctos para recordar es fundamental.— Dianne Na Penn, jefa de gestión de productos de investigación de Anthropic