GPT-6 Astra: precio, API y el asterisco de los 272.000 tokens
OpenAI anunció GPT-6 Astra el 3 de septiembre de 2026. Greg Brockman, presidente de la compañía, lo llamó un generational leap y dijo que podría verse como la llegada de la AGI.
Yo abrí la tabla de precios y me quedé mirando un asterisco.
El asterisco dice esto: cualquier request que supere los 272.000 tokens de input dobla la tarifa de input y la de caché, y multiplica el output por 1,5. Para la request entera. No para los tokens que se pasan del umbral.
Ahora piensa en tu agente. El que arrastra el historial de tool calls y va acumulando contexto en cada iteración. Ese agente no cruza el umbral cuando tú lo decides: lo cruza en la iteración 14, cuando una herramienta devuelve 6.000 tokens de logs más de lo habitual. Y esa request, completa, pasa a costar casi el doble.
Mi tesis: Astra es un bisturí caro para tareas largas y autónomas, no el reemplazo por defecto de tu modelo de trabajo. Y la decisión de usarlo no se toma leyendo benchmarks, se toma leyendo tu contador de tokens.
Qué es GPT-6 Astra y dónde puedes usarlo
GPT-6 Astra es el modelo de razonamiento de gama alta de OpenAI, lanzado el 3 de septiembre de 2026 y orientado a tareas largas y autónomas: computer use, respuesta a incidentes y refactors de varias horas. En la API se identifica como gpt-6-astra, admite 1,05 millones de tokens de contexto y su knowledge cutoff es el 30 de abril de 2026. Cuesta $10 por millón de tokens de input y $50 de output, con una tarifa premium que dobla el input a partir de 272.000 tokens por request.
Está en la API de OpenAI, en Azure y en Bedrock, y en ChatGPT para Plus, Pro, Business y Enterprise con rollout escalonado. Los primeros en tenerlo fueron los clientes del programa de ciberseguridad de OpenAI. Ese detalle no es casual: mira la fila de ExploitBench más abajo.
Los números de contexto son los que esperas de un modelo pensado para tareas largas: 1,05 millones de tokens de contexto máximo, hasta 922.000 de input y hasta 128.000 de output.
Y sabe usarlos. OpenAI mide 100% en MRCR v2 8-needle en la banda de 256K–512K, y 96,3% en la banda de 512K–1M. Recuperación casi perfecta en contextos enormes.
Aquí está la ironía del lanzamiento: el modelo es excelente con contexto largo, y el precio te empuja a no usarlo. La capacidad técnica y el incentivo económico apuntan en direcciones opuestas.
Cuánto cuesta GPT-6 Astra: precio de la API y el asterisco
GPT-6 Astra cuesta $10 por millón de tokens de input y $50 por millón de output, según la ficha oficial del modelo en la API de OpenAI. Y viene con un asterisco: si una request supera los 272.000 tokens de input, se aplica tarifa premium a la request entera —input y caché al doble, output ×1,5—, no solo al exceso.
Estas son las tarifas por millón de tokens:
| Concepto | Tarifa base | Si la request pasa de 272.000 tokens de input |
|---|---|---|
| Input | $10 | $20 |
| Cached input | $1 | $2 |
| Cache write | $12,50 | $25 |
| Output | $50 | $75 |
Hay además un fast mode que, según OpenAI, cobra el doble a cambio de hasta ~2,5x de velocidad. Útil para tareas interactivas, irrelevante para un batch nocturno.
Y un dato que conviene tener presente: OpenAI ha puesto a Astra exactamente al mismo precio que Claude Fable 5.1, $10 de entrada y $50 de salida. Nadie está compitiendo por precio en la gama alta.
Vamos con el cálculo que importa.
Imagina una request de tu agente con 270.000 tokens de input y 8.000 de output:
- Input: 270.000 × $10 / 1M = $2,70
- Output: 8.000 × $50 / 1M = $0,40
- Total: $3,10
Ahora una tool devuelve 5.000 tokens de logs más de lo normal. La request sube a 275.000 de input:
- Input: 275.000 × $20 / 1M = $5,50
- Output: 8.000 × $75 / 1M = $0,60
- Total: $6,10
Un 1,9% más de tokens de input. Un 97% más de factura.
Multiplícalo por 100 requests al día y tienes $310 frente a $610. Al mes (30 días), $9.000 de diferencia por 5.000 tokens de logs que nadie revisó.
Y ojo con dar por hecho que la caché te salva.
Lo que está documentado es que el multiplicador se dispara por los tokens de input de la request y que afecta también a la tarifa de caché. Lo que no dice ninguna fuente es si los tokens servidos desde caché cuentan para llegar a los 272.000.
Hay un indicio de que sí: en la API de OpenRouter, el override de tarifa de esta familia de modelos se indexa por min_prompt_tokens, y los tokens de caché siguen siendo prompt tokens. Si 260.000 de tus 280.000 tokens vienen de caché y el umbral los cuenta, esa caché pasa de $1 a $2 el millón igual.
Lanza una request de prueba y mira la factura antes de montar tu estrategia de caché alrededor de ese número.
Cómo evitar cruzar el umbral sin darte cuenta
Tres cosas, en este orden:
- Mide antes de enviar, no después. Si tu telemetría te dice el coste al final del mes, ya es tarde. Necesitas el contador de tokens de input por request, en vivo y con alertas. Lo desarrollé paso a paso en cómo medir el consumo de tokens de un agente de IA.
- Poda el historial de forma agresiva. Resume los tool outputs antiguos, trunca los logs a las líneas relevantes y no le metas el repositorio entero "por si acaso". Un agente que necesita 270.000 tokens de contexto casi siempre tiene un problema de diseño, no de memoria.
- Pon un techo duro por request y falla rápido. Mejor abortar y partir la tarea que descubrir el gasto en la facturación.
GPT-6 Astra vs Claude Opus 5 y GPT-5.6 Sol: benchmarks y letra pequeña
GPT-6 Astra supera a Claude Opus 5 y a GPT-5.6 Sol en tareas agénticas largas, pero empata con Opus 5 en código de frontera. Estas son las cifras que publicó OpenAI:
| Benchmark | Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (computer use) | 72,6% | 65,7% | 70,2% |
| Terminal-Bench 4.0 | 57,7% | 37,3% | 52,3% |
| FrontierMath Tier 4 v2 | 97,6% | 83,0% | 73,2% |
| GPQA Diamond | 96,0% | 94,6% | 93,7% |
| ExploitBench | 100% | 78,5% | 70,0% |
| ARC-AGI-3 (harness con estado) | 99,9% | 7,8% | 30,2% |
| SRE-Bench | 88,0% | 55,9% | — |
| DeepSWE v1.1 | 74,1% | — | 69,9% |
| FrontierCode 1.1 | 53,3% | — | 53,4% |
En computer use, además, resuelve ese 72,6% en unos 40 minutos por tarea según OpenAI: tarda un 47% menos que los ~75 minutos de Sol. Si automatizas navegador o escritorio, ahí hay una mejora real que notas en la latencia y en el número de reintentos.
Ahora la letra pequeña.
El 99,9% de ARC-AGI-3 no es tuyo. Ese resultado depende de un harness con estado y caro, montado para el benchmark. En llamadas stateless normales a la API —las que hace tu código— la puntuación cae, según la organización del benchmark, al rango del ~17–63%. La diferencia entre 99,9% y 17% no está en el modelo: está en la infraestructura que lo envuelve. Cuando veas ese número en un hilo de Twitter, lo que estás viendo es un sistema completo, no un endpoint.
Y el precio por token miente. En el Intelligence Index de Artificial Analysis, Astra y GPT-5.6 Sol empatan a 61 puntos, y Astra cuesta 2,5 veces más por token ($7,70 frente a $3,08 por millón, precio mezclado). Titular fácil: "pagas 2,5x por lo mismo". Falso.
Correr ese índice consumió 42M de tokens de output con Astra y 70M con Sol. Astra razona menos en voz alta y llega antes. Por eso el coste por tarea sale $1,67 frente a $0,95: la brecha por token es 2,5x, la brecha por tarea es 1,8x. Ambos números son de la variante max, que es la que mide Artificial Analysis — con menos reasoning effort la cuenta cambia.
Es la misma lección que con Gemini 3.8 Flash y su coste por tarea: el proveedor te da el precio por token, tu arquitectura decide el coste por tarea. Compara siempre lo segundo.
Un aviso antes de que abras la calculadora: las fuentes públicas no se ponen de acuerdo sobre el precio de Sol. OpenRouter lo lista a $2/$10 por millón; Artificial Analysis calcula con $4/$20. No hagas números con una cifra que leíste en un hilo. Mira la tabla oficial de OpenAI el día que vayas a decidir, y crúzalo con lo que ya sabes de la API de GPT-5.6 en la práctica.
¿Y lo de la AGI? En FrontierCode 1.1, código de frontera, Astra saca 53,3% y Opus 5 saca 53,4%. Empate técnico. Un modelo que insinúa AGI no empata en programación difícil con un modelo de la generación anterior. Que es más o menos lo que ya se veía en la comparativa de Opus 5, GPT-5.6 y Kimi K3: las diferencias de frontera son estrechas y el marketing es ancho.
Límites de la API de GPT-6 Astra: lo que no te da
Antes de planificar una migración, comprueba que tu stack sobrevive a estos límites:
- Tool calling solo vía Responses API. Si tu agente vive en Chat Completions, no hay herramientas. Migras o no usas Astra.
- No hay fine-tuning, ni Realtime, ni Assistants, ni generación nativa de media. Cualquier flujo que dependa de eso se queda fuera.
- Reasoning effort:
low,medium,high,xhigh,max. El valornoneexiste en la API, perogpt-6-astrano lo acepta. Este modelo siempre razona, y ese razonamiento se factura como output a $50 el millón. No puedes apagarlo para una clasificación tonta. - Zero Data Retention solo para clientes "elegibles". No es una promesa universal. Si tienes un requisito de cumplimiento, confírmalo por escrito antes de meter datos de cliente.
Cómo llamar a GPT-6 Astra desde TypeScript
Lo mínimo que funciona, con Responses API y control de razonamiento:
import OpenAI from "openai";
const client = new OpenAI();
const incidente =
"PagerDuty #4821: latencia p99 por encima de 3s en checkout-api desde las 02:14 UTC";
// Con gpt-6-astra el tool calling SOLO existe en la Responses API.
// En Chat Completions no tienes herramientas con este modelo.
const response = await client.responses.create({
model: "gpt-6-astra",
// low | medium | high | xhigh | max. Este modelo no acepta "none":
// siempre razona, y ese razonamiento se paga como output.
reasoning: { effort: "high" },
input: [
{ role: "developer", content: "Eres un SRE. Diagnostica y propón un fix." },
{ role: "user", content: incidente },
],
tools: [
{
type: "function",
name: "query_logs",
description: "Consulta los logs de un servicio en una ventana temporal",
parameters: {
type: "object",
properties: {
service: { type: "string" },
since: { type: "string", description: "Fecha ISO 8601" },
},
required: ["service", "since"],
additionalProperties: false,
},
strict: true,
},
],
});
console.log(response.usage?.input_tokens, response.usage?.output_tokens);
Y el guardarraíl que yo pondría antes de cada llamada, no después:
const PREMIUM_INPUT_THRESHOLD = 272_000;
const SAFETY_MARGIN = 20_000; // lo que puede crecer el input dentro de la iteración
export function assertBelowPremiumTier(estimatedInputTokens: number) {
if (estimatedInputTokens > PREMIUM_INPUT_THRESHOLD - SAFETY_MARGIN) {
throw new Error(
`Contexto de ${estimatedInputTokens} tokens: la request entraría en tarifa premium. Poda el historial o parte la tarea.`
);
}
}
Veinte mil tokens de margen parecen exagerados hasta que ves lo que ocupa un git diff grande o un volcado de logs. Prefiero abortar la iteración a pagar el doble por una request que nadie decidió hacer.
Cuándo merece la pena GPT-6 Astra (y cuándo no)
| Caso de uso | ¿Astra? | Por qué |
|---|---|---|
| Agentes autónomos de horas o días (refactors grandes, migraciones) | Sí | 57,7% en Terminal-Bench 4.0 frente al 52,3% de Opus 5 y el 37,3% de Sol |
| Computer use y automatización de escritorio o navegador | Sí | 72,6% en OSWorld 2.0 y un 47% más rápido por tarea que Sol |
| Incidentes de producción, on-call, postmortems | Sí | 88,0% en SRE-Bench frente al 55,9% de Sol |
| Seguridad ofensiva autorizada | Sí | 100% en ExploitBench; es a quien OpenAI dio acceso primero |
| Razonamiento matemático de frontera | Sí | 97,6% en FrontierMath Tier 4 v2 frente al 73,2% de Opus 5 |
| Código del día a día: features, bugs, PRs | No | 53,3% vs 53,4% de Opus 5 en FrontierCode 1.1. Empate, pagando más |
| Chat, soporte, RAG conversacional | No | Pagas un razonamiento que nadie pidió y que no puedes desactivar |
| Clasificación y extracción en volumen | No | El peor caso posible: input largo, output corto, tarifa de gama alta |
| Cualquier flujo con fine-tuning, Realtime o Assistants | No | No existen para este modelo |
La lectura corta: si la tarea la termina una persona en diez minutos, Astra es caro. Si la tarea son ocho horas de un senior peleándose con una terminal, es barato.
Y esto no va de elegir un modelo, va de enrutar por tarea. Modelo barato por defecto, escalado a Astra solo cuando la tarea es larga, autónoma y verificable. Es el mismo criterio que aplico en el curso Construye con IA: de la idea al producto: la arquitectura decide la factura, no el modelo.
Qué hacer esta semana
Una sola cosa: instrumenta el contador de tokens de input por request y mira cuántas de tus llamadas actuales caen entre 200.000 y 300.000 tokens.
Ese histograma es tu exposición real al tier premium. Si tienes una cola larga acercándose a 272.000, no tienes un problema de modelo: tienes un problema de gestión de contexto que hoy te sale barato y con Astra te costaría el doble.
Arregla eso primero. Después decide si necesitas el bisturí.
En Dominicode Labs estamos midiendo coste por tarea de estos modelos sobre proyectos reales, con los routers y los guardarraíles que usamos en producción.
Preguntas frecuentes
¿Qué es GPT-6 Astra?
Es el modelo de razonamiento de gama alta de OpenAI, anunciado el 3 de septiembre de 2026. En la API se identifica como gpt-6-astra, admite 1,05 millones de tokens de contexto (hasta 922.000 de input y 128.000 de output) y su knowledge cutoff es el 30 de abril de 2026. Está disponible en la API de OpenAI, Microsoft Azure y Amazon Bedrock, y en ChatGPT para Plus, Pro, Business y Enterprise.
¿Cuánto cuesta GPT-6 Astra?
$10 por millón de tokens de input y $50 por millón de output. El input cacheado son $1 y la escritura de caché $12,50. Si una request supera los 272.000 tokens de input, se aplica tarifa premium a toda la request: input y caché al doble ($20 y $2) y output ×1,5 ($75). Hay además un fast mode que cobra el doble a cambio de hasta ~2,5x de velocidad.
¿Debo migrar mis agentes a GPT-6 Astra?
Solo los que ejecutan tareas largas y autónomas: computer use, respuesta a incidentes, refactors de varios días, seguridad ofensiva autorizada. Para el resto de tu producto —chat, clasificación, código del día a día— estarías pagando un razonamiento más caro para obtener prácticamente el mismo resultado. Enruta por tarea, no cambies el modelo por defecto.
¿Qué pasa exactamente si mi request supera los 272.000 tokens de input?
Se aplica tarifa premium a toda la request, no solo al exceso: input y caché al doble, output multiplicado por 1,5. Pasar de 270.000 a 275.000 tokens sube un ejemplo típico de $3,10 a $6,10. Por eso el guardarraíl va antes de la llamada y con margen, no después de leer la factura.
¿GPT-6 Astra es AGI?
OpenAI lo insinúa: Greg Brockman habló de un generational leap que podría verse como la llegada de la AGI. Los datos son más modestos. En FrontierCode 1.1 empata con Claude Opus 5 (53,3% frente a 53,4%), y su 99,9% en ARC-AGI-3 depende de un harness con estado y caro que tú no tienes: en llamadas stateless normales baja al rango ~17–63%. Es el mejor modelo para ciertas tareas largas. No es otra categoría de cosa.
¿GPT-6 Astra es mejor que Claude Opus 5?
En tareas agénticas largas sí; en código del día a día no. Astra gana en Terminal-Bench 4.0 (57,7% frente a 52,3%), OSWorld 2.0 (72,6% frente a 70,2%) y FrontierMath Tier 4 v2 (97,6% frente a 73,2%). Pero en FrontierCode 1.1 empatan: 53,3% Astra contra 53,4% Opus 5. Para features, bugs y PRs, Astra no te da más y te cuesta más.
¿GPT-6 Astra soporta tool calling en Chat Completions?
No. Con gpt-6-astra las herramientas solo funcionan a través de la Responses API. Tampoco hay fine-tuning, Realtime, Assistants ni generación nativa de media. Si tu agente depende de alguna de esas piezas, la migración es de arquitectura, no de cambiar el string del modelo.
¿Es Astra 2,5 veces más caro que GPT-5.6 Sol?
Por token sí: $7,70 frente a $3,08 por millón en el precio mezclado de Artificial Analysis. Por tarea la brecha se estrecha a 1,8x — $1,67 frente a $0,95 — porque correr el Intelligence Index consumió 42M de tokens de output con Astra y 70M con Sol. Ojo: las fuentes públicas se contradicen sobre el precio de Sol (OpenRouter lo lista a $2/$10, Artificial Analysis calcula con $4/$20), así que haz tus números contra la tabla oficial de OpenAI el día que vayas a decidir.
¿Se puede desactivar el razonamiento de GPT-6 Astra para bajar el coste?
No del todo. Con gpt-6-astra el reasoning effort admite low, medium, high, xhigh y max; el valor none que sí existe en la API para otros modelos aquí no está disponible. Puedes bajarlo a low para reducir tokens de razonamiento, aunque si tu caso de uso no necesita razonar en absoluto, la respuesta correcta no es bajar el effort: es usar otro modelo.
Por Bezael Pérez — Developer senior con más de 15 años de experiencia y fundador de Dominicode.
¿Te resultó útil este artículo?
Compártelo con tu comunidad y ayuda a otros desarrolladores.
