GPT-6 Astra domina manipulación robótica con 95% de éxito y costes 60% menores

Los modelos digitales operan sin pérdida; la física acumula errores que el tacto no puede corregir.
Explicación de por qué todos los modelos fallan en tareas de precisión submilimétrica sin retroalimentación táctil.
Mark

¿Por qué importa que Astra logre 95% en una tarea de bloques y cuencos? Suena como un benchmark más.

Mimi

Porque no es un benchmark de papel. Es un modelo emitiendo comandos reales a brazos robóticos físicos, frame a frame, en hardware que puede fallar. Si estás construyendo un producto de logística o ensamblaje, esto es lo que necesitas saber: ¿funciona en el mundo real?

Luke

Pero hay que ser cuidadoso con cómo se midió. Los ensayos de Astra corrieron en hardware diferente al de Fable, no intercalados, y los evaluadores sabían qué modelo estaban calificando. Eso no invalida el resultado, pero un fundador debería pedir una corrida ciega antes de cambiar de arquitectura.

Mark

¿Y el costo? Vi que Astra cuesta $0,94 por ejecución versus $2,12 para Fable 5.1.

Mimi

Ese es el número que mueve el P&L. Si haces mil picks al día, la diferencia es material. Pero ojo: ese costo usa precios de lista. OpenAI cachea el 20% de los prompts, así que el gasto real de Astra es aún menor.

Luke

Cierto, pero el caching también afecta a Fable 5.1. La pregunta es si la ventaja de costo se mantiene en tu hardware específico, con tu tarea específica. Los números de RoboCurve son reales, pero son de RoboCurve.

Mark

¿Qué pasó con la tarea de precisión, la del puzle?

Mimi

Todos fracasaron. Astra 10%, Fable 5.1 10%, Fable 5 0%. Cuando necesitas precisión submilimétrica, los modelos digitales chocan contra el mismo techo: no tienen retroalimentación táctil de alta frecuencia.

Luke

Y eso es importante porque revela dónde está el límite real. No es que Astra sea malo en precisión. Es que ningún modelo base sin tacto puede hacer inserción fina. Necesitas un control loop clásico encima del LLM, no debajo.

Mark

¿Entonces Astra es solo para tareas gruesas?

Mimi

Para tareas gruesas es excelente. Pick-and-place, manipulación sin tolerancias críticas, ensamblaje simple. Ahí ya está listo. Para precisión, todavía necesitas ingeniería adicional.

Luke

Y eso es lo que un fundador debería hacer esta semana: si ya usa Fable 5.1, correr 50 ensayos paralelos con Astra en su tarea más repetitiva y medir costo y latencia reales. Si exige precisión, pedir una demo ciega antes de invertir en un sistema basado en LLMs.

  • GPT-6 Astra: 95% de éxito (19/20) en pick-and-place; Claude Fable 5.1: 40% (8/20)
  • Costo por ejecución: Astra $0,94 vs Fable 5.1 $2,12 (2,3 veces menor)
  • Latencia: Astra 2,5 minutos vs Fable 5.1 6,8 minutos por tarea
  • Precisión submilimétrica: todos los modelos 10% o menos de éxito
  • Presentación: 3 de septiembre 2026 por OpenAI; entrenamiento en 100.000+ GPUs en Stargate, Texas

Astra completó 19 de 20 ensayos colocando bloques en cuencos, versus 8 de 20 para Fable 5.1, con latencia de 2,5 minutos y costo de $0,94 por ejecución. En tareas de precisión submilimétrica, todos los modelos fracasaron por igual (10% de éxito), revelando que falta retroalimentación táctil de alta frecuencia para manipulación fina.

OpenAI presentó GPT-6 Astra el 3 de septiembre, logrando 95% de éxito controlando brazos robóticos en tareas de manipulación gruesa, superando significativamente a Claude Fable 5.1 (40%) con costos 2,3 veces menores.

OpenAI presentó GPT-6 Astra el 3 de septiembre, y los primeros datos sobre su capacidad para controlar brazos robóticos físicos revelan un salto significativo respecto a sus competidores más cercanos. Cuando se le dio control directo de dos brazos YAM para completar una tarea simple—recoger un bloque rojo de una mesa e introducirlo en un cuenco—Astra logró hacerlo correctamente en 19 de 20 intentos, una tasa de éxito del 95%. Claude Fable 5.1 de Anthropic, el modelo más avanzado de su competidor, completó la misma tarea solo en 8 de 20 intentos (40%), mientras que su predecesor Fable 5 apenas lo hizo una vez de veinte (5%). Estos números provienen de una evaluación publicada por RoboCurve, una organización sin fines de lucro que ejecutó 120 ensayos controlados bajo condiciones idénticas.

La diferencia no es académica. Para cualquier fundador que esté construyendo un producto donde un modelo de lenguaje controla máquinas en el mundo real, esta es la métrica que importa: no responder preguntas sobre papel, sino emitir objetivos de movimiento seis grados de libertad, fotograma a fotograma, en hardware físico que puede fallar. En cada ensayo, el modelo recibía tres flujos de video en tiempo real (una cámara cenital y dos montadas en la muñeca del brazo) más datos de posición, y emitía comandos de movimiento que un solver de cinemática inversa traducía a instrucciones para los motores. RoboCurve evaluó cada intento en una escala de cinco niveles, desde ningún progreso útil hasta colocación exitosa en la posición final.

La ventaja económica es tan notable como la técnica. Astra ejecutó cada tarea exitosa en 2,5 minutos y costó $0,94 por ejecución, usando solo 2.100 tokens de salida. Fable 5.1 tardó 6,8 minutos, costó $2,12 por ejecución y consumió 12.900 tokens. Astra usó 6,2 veces menos tokens de salida que su competidor más cercano en la misma tarea, una diferencia que se traduce en bucles de decisión más rápidos y costos unitarios dramáticamente menores cuando se ejecutan miles de operaciones. El reporte de RoboCurve aclara que OpenAI cachea automáticamente cerca del 20% de los prompts de entrada, lo que significa que el gasto operativo real de Astra sería aún más bajo que estas cifras de precio de lista.

Pero cuando RoboCurve cambió la tarea, el panorama se invirtió por completo. La segunda prueba requería precisión submilimétrica: recoger una pieza circular azul por su pomo central e insertarla en una ranura circular coincidente del tablero. Aquí, los tres modelos fracasaron casi por igual. Astra completó la tarea en solo 2 de 20 intentos (10%), exactamente lo mismo que Fable 5.1, mientras que Fable 5 no lo logró ni una sola vez. Astra siguió siendo más rápido y más barato, pero el resultado final fue idéntico. Según los datos de RoboCurve, Astra llegaba consistentemente a la etapa 3 (la pieza posicionada encima de la ranura) y luego se detenía o desalineaba en la inserción final. El reporte identifica la causa: los tres modelos comparten un mismo techo cuando falta retroalimentación táctil de alta frecuencia y compliance. Los modelos digitales operan en espacios vectoriales sin pérdida, mientras que la manipulación física acumula pequeños errores con cada movimiento que un controlador sin tacto no puede corregir en los últimos milímetros de contacto.

Astra no fue probado solo en brazos robóticos. Según reportes posteriores, el modelo lidera todas las comparativas cabeza a cabeza publicadas contra sus competidores, con ventajas especialmente amplias en benchmarks de razonamiento como ARC-AGI-3 (98,6% versus 30,2% para Claude Opus 5) y FrontierMath Tier 4 v2 (97,6% versus 87,8% para Fable 5.1). En programación, ocupa el primer lugar del leaderboard Code Arena WebDev con 1.797 puntos, 35 puntos por encima de Fable 5.1. Sin embargo, no todos los benchmarks coinciden: Artificial Analysis sitúa a Astra en 61 puntos de su Intelligence Index, el mismo puntaje que su predecesor GPT-5.6 Sol y cinco puntos por debajo de Fable 5.1. Además, el resultado de Astra en ARC-AGI-3 oscila entre 99,9% con un harness personalizado de OpenAI y 62,7% con el harness estándar, una brecha que ilustra cuánto importa el andamiaje en benchmarks sensibles.

El reporte de RoboCurve es explícito sobre sus limitaciones metodológicas. Los ensayos del cuenco con Astra se ejecutaron en hardware diferente al de los modelos Fable, no de forma intercalada sino dos días después, y los evaluadores humanos conocían qué modelo estaban calificando en cada intento. Son limitaciones razonables para una primera publicación de datos, pero cualquier fundador que vaya a tomar decisiones arquitectónicas sobre estos números debería exigir corridas ciegas e intercaladas antes de firmar un contrato con un proveedor.

Para equipos que construyen productos donde un modelo de lenguaje controla hardware físico, los resultados dibujan un mapa concreto. Si el producto hace pick-and-place grueso—logística de almacén, ensamblaje simple, manipulación de objetos sin tolerancias críticas—Astra ya parece listo como política de alto nivel sobre brazos comerciales. Los números muestran 95% de fiabilidad, $0,94 por ejecución completa y bucles de decisión del orden de minutos. Si el producto exige inserción de precisión—electrónica, cirugía, ensamblaje micromecánico—todavía no hay modelo base que sirva en zero-shot. Hace falta una capa de control con retroalimentación táctil o un sistema de corrección por fuerza, no basta con pedirle más capacidad de razonamiento al modelo. El multiplicador real es el costo unitario. Una operación de fulfillment que hoy cuesta $2,12 por ítem podría caer a $0,94 solo cambiando de modelo, según los datos del reporte. Multiplicado por miles de picks diarios, la diferencia se vuelve material en el estado de resultados.

Welcome to the AGI era
— Greg Brockman, presidente y cofundador de OpenAI, en la presentación de GPT-6 Astra
Los tres modelos comparten un mismo techo cuando falta retroalimentación táctil de alta frecuencia y compliance
— Reporte de RoboCurve sobre limitaciones en tareas de precisión
Möchten Sie die ganze Geschichte? Das Original lesen bei El Ecosistema Startup ↗
Kontakt FAQ