AI From U AI FROM U.COM

Blog / Guías

Elegir entre astra, sol, terra y luna

Empieza en terra, sube una clase de peticiones a sol cuando el razonamiento profundo se nota, gasta astra con intención y deja el volumen de fondo a luna.

Elegir entre astra, sol, terra y luna

Cuatro modelos, un endpoint, un presupuesto. La pregunta que de verdad tiene una cuenta nueva no es cuál de ellos es el mejor, sino a cuál debe ir cada parte del trabajo — y la respuesta nunca es un solo nombre. Es una decisión de enrutado que se toma una vez por clase de petición y luego se comprueba contra tu propio consumo detallado. Lo que sigue es esa decisión, en el orden en que conviene tomarla.

Empieza por terra

terra es la opción por defecto, no el apaño. Su papel publicado es el trabajo de asistente del día a día — RAG, agentes, herramientas y programación — y eso ya cubre la mayor parte de lo que un producto envía de verdad: conversación normal, extracción con una estructura que rellenar, y esa ayuda con el código que es más teclear que pensar. En entrada es la mitad que sol, 0.5 frente al 1 de sol, y su peso de salida es 3 frente al 5 de sol.

Así que empieza ahí una clase de peticiones nueva y sé honesto con el resultado. Si las respuestas de terra son las que habrías publicado igualmente, has encontrado el modelo correcto y has pagado por él la mitad de abajo de la factura. Subir de modelo es una decisión que se toma con pruebas que puedas señalar — un fallo que puedas enseñarle a alguien — y no por precaución.

Cuándo una clase de peticiones se gana sol

sol es el ancla de toda la tabla de tarifas: un token de entrada de sol es un crédito, y todos los demás números de esta página son una proporción respecto a ese. Su papel publicado es razonamiento profundo, programación difícil, tareas tipo Codex e investigación, y esa frase es también la prueba para mover algo. Sube una clase de peticiones a sol cuando la profundidad de razonamiento se note de verdad: el error difícil alrededor del cual terra da vueltas, el análisis de varios pasos cuyos pasos intermedios tienen que ser correctos para que lo sea la conclusión, el cambio que exige tener un fichero entero en la cabeza a la vez.

El movimiento cuesta el doble de entrada que terra y dos tercios más de salida: 1 y 5 frente a 0.5 y 3. Es un precio pequeño para una clase de peticiones que fallaba y ahora funciona, y un mal precio para una que ya iba bien. Mueve la clase, no la aplicación: ninguno de estos cuatro modelos es un ajuste global, y lo más barato de esta página son las peticiones que nunca ascendiste.

Para qué está astra

astra es razonamiento de frontera en una ventana de 1M de tokens, para el trabajo más difícil de todos, y su precio está puesto para que lo gastes con intención: 2.5 en entrada y 12.5 en salida, frente al 1 y el 5 de sol. Léelo como una instrucción y no como una advertencia. astra es para la revisión final antes de publicar algo, para el análisis sobre el que alguien va a actuar, para la tarea de una sola vez que nadie va a releer: el trabajo en el que una respuesta equivocada cuesta más que los tokens.

Una cosa que no entra en la decisión: la longitud. Aquí ningún modelo tiene recargo por contexto largo. Las tarifas de contexto largo de cada modelo son iguales a las suyas de contexto corto, fila por fila, así que un documento largo no cambia a qué modelo hay que enviarlo. Elige por lo difícil que sea el trabajo y deja que el tamaño de la entrada sea el que sea.

luna se encarga del fondo

No todo lo que envía un producto merece un modelo de razonamiento. Clasificar, etiquetar, resumir en corto, decidir en qué cola entra un elemento — las pasadas que corren sobre cada registro y que nadie lee por separado — son de luna, cuyo papel publicado es borradores rápidos, clasificación, resúmenes y chat de alto volumen. Con 0.05 en entrada es veinte veces más barato que sol, y su peso de salida es 0.3.

Eso sí, mantén sus prompts ligeros o devolverás el ahorro entero. Un trabajo de fondo no necesita todo tu contexto: ese system prompt largo que hace bueno a tu asistente principal suele ser peso muerto dentro de un clasificador, y un ahorro de veinte veces en la tarifa se deshace enviando veinte veces más tokens. Manda el elemento, las etiquetas y nada más.

Mezcla los cuatro y luego revisa la factura

Créditos por token, por modelo y por clase, tomados directamente del catálogo con el que este sitio pone precio a todo lo demás: las cuatro filas de las que los párrafos anteriores son proporciones.

MODELOENTRADALECTURA DE CACHÉESCRITURA DE CACHÉSALIDA + RAZONAMIENTO
astra2.50.252.512.5
sol10.115
terra0.50.050.53
luna0.050.0050.050.3

Nada de esto es un ajuste que se elige una sola vez. Los cuatro modelos comparten un endpoint y una clave, y el modelo es un campo del cuerpo que ya estás enviando: una palabra que cambiar en la petición que debe salir barata, una palabra en la petición que tiene que salir bien.

POST /v1/chat/completions

{
  "model": "terra",
  "messages": [
    {"role": "user", "content": "Resume este ticket en una línea."}
  ]
}

Si tu código ya nombra un modelo al estilo de OpenAI, se lee como la clase a la que pertenece, así que una configuración existente sigue funcionando mientras decides por qué cambiarla. Eso es lo que hace barata la prueba de la mezcla: no estás migrando nada para dejar una clase de peticiones corriendo en otro sitio durante una semana.

Un agente que da vueltas en un bucle tiene dos cosas más que acertar. Mantén un prefijo estable al principio de cada turno — el system prompt, las definiciones de herramientas, las instrucciones que no cambian entre turnos — porque un token leído desde un prefijo en caché se cobra a una décima parte de la tarifa de entrada de su propio modelo, y un bucle que reconstruye su prompt en cada turno paga el precio completo por las mismas palabras una y otra vez. Y enruta los niveles a propósito, no por costumbre: el planificador que decide el siguiente paso suele haberse ganado sol o astra, los trabajadores que ejecutan sus pasos son terra, y la pasada que ordena los resultados después es luna. Un agente, tres modelos, a propósito.

Y luego compruébalo. Cada petición aparece detallada en tu portal contra las tarifas de la tabla de arriba — el modelo, la clase de token, los créditos — de modo que la mezcla que crees estar ejecutando es algo que puedes verificar en vez de suponer. Eso es lo que convierte todo lo anterior en un procedimiento y no en una opinión: coge el enrutado de esta página, haz pasar por él una semana de tu tráfico real y vuelve a leer el detalle.

Cada petición aparece detallada en tu portal contra las tarifas de la tabla de arriba — el modelo, la clase de token, los créditos — de modo que la mezcla que crees estar ejecutando es algo que puedes verificar en vez de suponer.

Traducción automática, pendiente de revisión por un hablante nativo. La versión en inglés es la de referencia.