En septiembre de 2026, el desarrollador Simon Willison le encomendó a un agente de inteligencia artificial una tarea geoespacial cotidiana —diseñar rutas de running desde su casa usando datos abiertos— y el sistema la resolvió en 27 minutos sin que él escribiera una sola línea de código. Lo que el experimento reveló no fue solo la destreza creciente de estas herramientas, sino también una tensión más profunda: la capacidad de actuar sin dejar rastro auditable. En el horizonte donde la autonomía de las máquinas avanza, la pregunta que emerge no es si pueden hacer la tarea, sino si podemos enten
GPT-6 Astra diseña rutas de running en 27 min: qué aprendió Willison sobre agentes IA
El código real que ejecutó el modelo desapareció cuando el hilo se compactó
¿Por qué importa que Willison no pudiera ver el código que ejecutó el agente? Al final, la ruta funcionó.
Porque en producción, cuando algo falla o se comporta de forma inesperada, necesitas auditar exactamente qué hizo el sistema. Si el código desaparece, no puedes debuggear, no puedes aprender, no puedes mejorar.
Pero espera —¿el HTML final sí mostraba las coordenadas? ¿Entonces la ruta en sí era recuperable, solo no el algoritmo?
Exacto. El resultado final era inspeccionable. Pero la lógica de decisión, el razonamiento del agente, eso se perdió.
¿Esto significa que ChatGPT Work no es confiable para tareas críticas?
No es que no sea confiable. Es que es opaco. Para tareas donde necesitas auditoría, compliance o aprendizaje iterativo, la opacidad es un problema real.
¿Y OpenAI sabe que esto es un problema? ¿Lo reconocen?
Willison lo propuso como una regla de diseño que deberían copiar. No es que OpenAI lo haya negado; es que aún no lo han implementado como estándar.
¿Cuánto cuesta realmente usar esto entonces?
Willison gastó sesenta y cinco dólares en cuatro días de uso casual. Su suscripción es veinte dólares mensuales. Eso es un subsidio de tres veces.
Pero eso fue con GPT-6 Astra en modo Max. ¿Cuál sería el coste con un modelo más barato o en modo fast?
Buena pregunta. Willison no lo probó. Pero el modo fast es el doble de costo por 2.5× de velocidad, así que no es obvio que sea más barato por tarea.
¿Entonces qué debería hacer un fundador ahora?
Auditar la trazabilidad de sus agentes y medir coste por tarea completa, no por token. Y exigir que el código se persista antes de cualquier compactación.
Il Polso
- GPT-6 Astra completó una cadena compleja —geocodificación, descarga de datos OSM, cálculo de rutas y visualización interactiva— con una sola instrucción en lenguaje natural, sin intervención humana.
- Cuando Willison pidió ver el código Python ejecutado, el agente no pudo mostrarlo: la compactación automática del hilo había borrado la traza, haciendo imposible auditar la lógica de decisión.
- El coste real del experimento triplicó el precio de la suscripción mensual, exponiendo que el modelo de precios por token oculta el gasto verdadero en producción.
- OpenAI lanzó GPT-6 Astra como su modelo más capaz —47% más rápido que su predecesor— pero su propio chief scientist advirtió que monitorear el razonamiento interno será un cuello de botella para escalar.
- Willison propone una regla de diseño urgente: cualquier sistema con compactación de hilos debe preservar y exponer la traza anterior, o los equipos construyen sobre una caja negra.
En septiembre de 2026, el desarrollador Simon Willison le encomendó a un agente de inteligencia artificial una tarea geoespacial cotidiana —diseñar rutas de running desde su casa usando datos abiertos— y el sistema la resolvió en 27 minutos sin que él escribiera una sola línea de código. Lo que el experimento reveló no fue solo la destreza creciente de estas herramientas, sino también una tensión más profunda: la capacidad de actuar sin dejar rastro auditable. En el horizonte donde la autonomía de las máquinas avanza, la pregunta que emerge no es si pueden hacer la tarea, sino si podemos entender cómo la hicieron.
A finales de septiembre de 2026, Simon Willison le pidió a ChatGPT Work, corriendo sobre GPT-6 Astra en modo Max, que diseñara rutas de running de 5 y 10 kilómetros en bucle desde su casa usando datos abiertos de OpenStreetMap. El agente completó la tarea en 27 minutos y entregó una visualización HTML interactiva, además de archivos GPX y GeoJSON descargables. Para cualquier fundador que trabaje con inteligencia artificial, el resultado ilustra dos realidades simultáneas: el alcance real de los agentes autónomos actuales y las fricciones que aparecen en todo despliegue prolongado.
El agente operó en pasos claros: geocodificó la dirección con Nominatim, descargó la red de calles desde la API Overpass, calculó los bucles localmente y generó un archivo HTML con la ruta dibujada en D3.js. El resultado era funcional e inspeccionable. Pero cuando Willison pidió ver el código Python ejecutado, el agente no pudo mostrarlo: el hilo se había compactado automáticamente y la traza había desaparecido. Willison calificó esto como un anti-feature y propuso que cualquier sistema con compactación de hilos preserve el texto anterior y lo exponga mediante llamadas a herramientas.
GPT-6 Astra, el modelo detrás de la tarea, es la nueva generación de OpenAI: 47% más rápido que su predecesor, con precios de diez dólares por millón de tokens de entrada y cincuenta por millón de salida. Greg Brockman declaró en su presentación que es razonable hablar de una era de AGI, mientras que Jakub Pachocki advirtió que monitorear el razonamiento interno del modelo será un cuello de botella para escalar.
El experimento expone tres limitaciones que cualquier fundador encontrará: visibilidad opaca si no se captura el código de inmediato, errores de configuración en permisos de acceso, y un coste real que en cuatro días de uso casual triplicó el valor de la suscripción mensual. La conclusión práctica es directa: audita la trazabilidad de tus agentes persistiendo logs fuera del hilo, y mide el coste por tarea completa, no por millón de tokens, para no construir sobre subsidios que no durarán.
A finales de septiembre de 2026, Simon Willison, desarrollador y autor conocido por sus análisis de tecnología, realizó un experimento que puso en evidencia tanto el alcance como los puntos ciegos de los agentes autónomos modernos. Le pidió a ChatGPT Work, corriendo sobre GPT-6 Astra en modo Max, que diseñara rutas de running de 5 kilómetros y 10 kilómetros en bucle desde su casa usando datos abiertos de OpenStreetMap. El agente completó la tarea en 27 minutos y entregó dos formatos: una visualización HTML interactiva incrustada en la interfaz de ChatGPT y archivos descargables en formato GPX y GeoJSON. Para cualquier fundador que trabaje con inteligencia artificial, el experimento revela dos cosas simultáneamente: primero, el techo actual de lo que pueden hacer los agentes sin intervención humana —una sola instrucción en lenguaje natural resolvió un problema geoespacial no trivial sin escribir una sola línea de código—; segundo, una fricción que aparece una y otra vez en todos los despliegues largos de estos sistemas.
Lo que hizo el agente fue descomponerse en pasos claros. Utilizó Nominatim para geocodificar la dirección de Willison, luego consultó la API Overpass para descargar la red local de calles y senderos desde OpenStreetMap, y calculó los bucles localmente en su máquina. Para la visualización final, recurrió a una herramienta de renderizado que generó un archivo HTML con la ruta dibujada usando D3.js versión 7.9.0, cargado desde un CDN permitido por las políticas de seguridad del sistema. El resultado fue funcional, inspeccionable, y dejaba entrever toda la tubería de procesamiento: geocodificación, descarga de datos, cálculo, visualización.
Pero aquí llegó el problema que Willison decidió documentar públicamente. Cuando le pidió al agente que mostrara el código Python exacto que había ejecutado para generar la ruta, ChatGPT no pudo proporcionarlo. La razón: el hilo de conversación se había compactado automáticamente, y la traza anterior se había perdido. Willison calificó esto como un anti-feature —una característica que en realidad perjudica al usuario— y propuso una regla de diseño que cualquier equipo construyendo agentes debería adoptar: cualquier sistema que use compactación de hilos debe preservar el texto anterior a la compactación y exponerlo a través de llamadas a herramientas. El archivo HTML resultante seguía siendo inspectable, mostraba las coordenadas completas de la ruta, pero la lógica algorítmica del ruteo en sí, el detalle técnico de cómo el agente decidió qué caminos tomar, ya no era recuperable desde la conversación.
GPT-6 Astra, el modelo que ejecutó esta tarea, es la siguiente generación de OpenAI, presentada oficialmente días antes del experimento de Willison. Según reportes de Wired y Geeky Gadgets, OpenAI lo describe como el mejor modelo del mundo para uso de computadora: navega navegadores, opera software, escribe código y resuelve problemas matemáticos con una fluidez sin precedentes. Los números concretos del lanzamiento son significativos: 47 por ciento menos tiempo en completar tareas comparado con GPT-5.6 Sol, su predecesor. En cuanto a precios, OpenAI fijó diez dólares por millón de tokens de entrada y cincuenta dólares por millón de tokens de salida, con un modo rápido opcional que multiplica la velocidad por 2.5 al doble del costo. El acceso inicial fue limitado al programa Daybreak de OpenAI y organizaciones seleccionadas, pero después se abrió a suscriptores de ChatGPT Plus, Pro, Business y Enterprise, además de estar disponible en la API de OpenAI y Amazon Bedrock. Greg Brockman, presidente de OpenAI, fue más allá en la presentación y declaró que es razonable sentir que estamos en la era de la AGI —inteligencia artificial general—. Jakub Pachocki, chief scientist, añadió un matiz crítico: monitorean el chain-of-thought del modelo para alinearlo con valores humanos, pero advirtió que mantener esa monitorización será un cuello de botella para escalar más allá.
ChatGPT Work es la versión sin código del agente Codex de OpenAI, diseñada para profesionales no técnicos. Está disponible en la aplicación de escritorio de ChatGPT a partir del plan de veinte dólares mensuales, y según TechCrunch, ya aloja unos veinte millones de usuarios, mientras que la aplicación conjunta de ChatGPT cuenta con más de mil millones de usuarios en línea. Su producto estrella, el Data Agent, se presentó el diez de septiembre de 2026: un plugin que se conecta a fuentes aprobadas como Redshift, BigQuery, Snowflake, Databricks, MongoDB y ClickHouse, trae archivos de Google Drive y SharePoint, y construye dashboards interactivos respondiendo preguntas en lenguaje natural. Empresas como NTT Data, Thermo Fisher, ServiceTitan, Zipline, CookUnity y Empower ya lo están usando en programas piloto.
El experimento de Willison expone tres limitaciones críticas que cualquier fundador encontrará cuando pruebe estos sistemas. Primero, visibilidad opaca: no ves el código que ejecutó el agente a menos que pidas una captura inmediata; si el hilo se compacta, lo pierdes. Segundo, errores de configuración: en su prueba con TechCrunch, dar permiso de solo lectura a Google Drive produjo mensajes circulares; la aplicación a veces exige acceso completo. Tercero, coste real: en cuatro días de uso casual, Willison consumió ochenta millones de tokens valorados por el propio modelo en sesenta y cinco dólares —un subsidio de tres veces sobre su suscripción de veinte dólares mensuales—. Thibault Sottiaux, líder de producto de Work en OpenAI, reconoció que están empujando la frontera de eficiencia cada día, pero el problema persiste.
Para cualquier startup que dependa de inteligencia artificial generativa, el experimento de Willison no es un truco: es un termómetro del estado real de los agentes en septiembre de 2026. La vara que pone es exigente y útil. Dos acciones concretas que los fundadores pueden implementar esta semana: audita la trazabilidad de tus agentes, exigiendo que el código, las llamadas a API y los prompts completos se persistan fuera del hilo en logs estructurados, S3 o un tool call que vuelque el artefacto antes de cualquier compactación; y mide coste por tarea completa, no por millón de tokens, porque el modelo de precios engaña cuando el consumo real es tres veces el subsidio que pagas.
Citazioni salienti
Cualquier sistema LLM que use compactación debe preservar el texto pre-compactado y exponerlo vía tool calls— Simon Willison, propuesta de regla de diseño para agentes autónomos
Es razonable sentir que estamos en la era de la AGI— Greg Brockman, presidente de OpenAI, en la presentación de GPT-6 Astra