Elegir el modelo por tarea es, con diferencia, la palanca de coste más grande. La mayoría de las tareas —clasificar, extraer, resumir— las resuelve un modelo pequeño a una fracción del precio del grande. El error más caro es usar el modelo más potente para todo: reserva el grande para lo que de verdad lo necesita y enruta el resto al pequeño.

Es la primera de las 7 palancas para reducir la factura de OpenAI y la que más mueve la aguja.

Qué modelo por tipo de tarea

TareaModeloCoste relativo
Clasificar, etiquetar, enrutarPequeñoMuy bajo
Extraer datos de un textoPequeñoMuy bajo
Resumir, reescribirPequeño / medioBajo
Redacción con matiz, tonoMedioMedio
Razonamiento complejo, código difícilGrandeAlto

El error de usar el grande para todo

El modelo más potente es también el más caro por token, a veces un orden de magnitud. Si lo usas para clasificar tickets o extraer campos de una factura, pagas precio de razonamiento avanzado por una tarea que un modelo pequeño clava. En volumen, esa diferencia es la mayor parte de una factura hinchada.

Cómo decidir

Parte de la tarea, no del modelo. Pregúntate qué capacidad mínima la resuelve bien: si un modelo pequeño da la calidad que necesitas, ahí se acaba la decisión. Sube de nivel solo cuando la calidad del pequeño se queda corta de forma medible, no por defecto.

Cómo enrutar

El patrón habitual es una puerta barata delante: un clasificador pequeño (o unas reglas) mira cada petición y la manda al modelo adecuado. Lo simple va al pequeño; solo lo que de verdad lo necesita escala al grande. Así pagas el modelo caro únicamente en la fracción de peticiones que lo justifican.

Ponle número

Antes de fijar el enrutado, mide cuánto cambia el coste por modelo. Pon tus tokens y tu volumen en la calculadora de coste de tokens y compara el mismo trabajo en un modelo grande y en uno pequeño: verás la diferencia mensual de golpe. Todo esto forma parte del coste por tarea que mide e-ficient.

Preguntas frecuentes

¿Qué modelo de IA debo usar para cada tarea? Uno pequeño para clasificar, extraer y resumir; uno medio para redacción con matiz; reserva el grande para razonamiento complejo o código difícil. Empieza por el pequeño y sube solo si la calidad se queda corta.

¿Cuánto se ahorra eligiendo bien el modelo? Es la palanca de mayor impacto: enrutar las tareas simples a un modelo pequeño puede bajar el coste de esas peticiones entre un 50 y un 90 %.

¿Se combina con las otras palancas? Sí. Sobre el modelo ya bien elegido se apilan el prompt caching y el batch API.


En e-ficient medimos el coste por tarea de empresas que ya tienen IA en producción y te decimos cuánto ahorrarías con cada palanca a tu volumen real. La primera auditoría es gratuita si contratas un plan con compromiso de tres meses y devuelve un diagnóstico en 72 horas.