Cómo elegir un LLM para una función de producto: calidad, latencia y costo
El modelo adecuado para una función se define por su nivel de calidad, su margen de latencia y su límite de costo, no por cuál modelo encabeza la clasificación general.

Elige el modelo que supere el nivel de calidad exigido por una función, dentro de su margen de latencia y su límite de costo. No el modelo que encabeza una clasificación general. La documentación propia de cada proveedor importante plantea la decisión de la misma forma: capacidad, velocidad y costo tiran en direcciones opuestas, y elegir un modelo significa elegir un punto dentro de ese equilibrio.
Qué es y por qué importa
Capacidad, velocidad y costo no son tres decisiones separadas. Un modelo que supera tu nivel de calidad al doble de la latencia, o a diez veces el costo, suele ser el modelo equivocado, aunque técnicamente sea "mejor". La guía propia de Anthropic sobre selección de modelos indica a quienes construyen productos que sopesen capacidad, velocidad y costo juntos antes de elegir un modelo de partida. El marco de selección de modelos de OpenAI reduce la misma decisión a cuatro preguntas: con qué frecuencia se ejecuta el flujo de trabajo, qué tan rápido debe llegar el resultado, cómo se usará ese resultado y cuánta calidad exige realmente la tarea. OpenAI formula la regla sin rodeos: usa el ajuste más ligero que cumpla tu nivel de calidad.
Hay dos formas razonables de empezar. El camino de eficiencia primero comienza con un modelo pequeño, rápido y económico, lo prueba con instrucciones reales y lo mejora solo donde falla en una capacidad concreta. Esto encaja con prototipos, requisitos de latencia estrictos, productos sensibles al costo y tareas de alto volumen como clasificación o extracción. El camino de capacidad primero hace lo contrario. Empieza con el modelo más potente disponible, optimiza la instrucción para ese modelo, y luego reduce a algo más económico con el tiempo, una vez probada la función. Esto encaja con razonamiento complejo, trabajo técnico o científico, y cualquier caso donde equivocarse en la respuesta cueste más que los tokens adicionales.
Una función construida sobre generación aumentada por recuperación muestra por qué el modelo es solo la mitad de la decisión. Cuando el paso de recuperación encuentra el pasaje correcto, un modelo más pequeño suele responder bien. Cuando la recuperación es débil, incluso un modelo de frontera produce una respuesta segura pero equivocada. La elección del modelo y la calidad de la recuperación son palancas separadas, y probarlas por separado es la única forma de saber cuál de las dos está limitando realmente la función.
Cómo funciona en la práctica
La mayoría de los equipos cambian tres cosas, normalmente en este orden: el ajuste de esfuerzo o profundidad de razonamiento, el modelo en sí, y el modo de facturación bajo el que corre la solicitud.
El esfuerzo es la palanca más pequeña. Varios proveedores exponen un parámetro, a menudo llamado esfuerzo o profundidad de razonamiento, que intercambia inteligencia por latencia y costo dentro de un mismo modelo, sin cambiar de modelo en absoluto. Anthropic recomienda ajustar el esfuerzo antes de cambiar de modelo, ya que es un cambio más pequeño y más reversible. OpenAI empareja sus modelos con niveles de esfuerzo de razonamiento de la misma forma: un nivel bajo para extracción simple y problemas acotados, un nivel medio para trabajo técnico complejo con revisiones previstas, y un nivel muy alto reservado para análisis exigentes con requisitos estrictos.
El modo de facturación es un segundo eje, independiente del modelo elegido. La documentación de precios de OpenAI, consultada el 6 de octubre de 2026, indica que el procesamiento por lotes cuesta aproximadamente la mitad de la tarifa estándar por token, a cambio de una latencia medida en horas en lugar de segundos. Un nivel rápido cuesta aproximadamente el doble de la tarifa estándar para obtener la menor latencia. La guía de optimización de la API de Gemini de Google documenta el mismo patrón en cuatro niveles: el nivel estándar cuesta el precio completo con latencia de segundos a minutos, el nivel flexible ofrece un descuento del 50 por ciento para una latencia objetivo de 1 a 15 minutos y puede ser desplazado durante picos de tráfico, el nivel prioritario cuesta entre un 75 y un 100 por ciento más que el estándar a cambio de latencia garantizada de segundos, y el nivel por lotes ofrece un descuento del 50 por ciento para una latencia de hasta 24 horas con reintentos automáticos.
La diferencia de precio entre un modelo insignia y un modelo más pequeño de la misma familia puede ser considerable. La página de precios de OpenAI muestra un modelo insignia de ejemplo con un precio de 10 USD por millón de tokens de entrada y 50 USD por millón de tokens de salida en el nivel estándar, frente a un modelo más pequeño de la misma línea a 0.10 USD y 0.50 USD respectivamente. Una diferencia de 100 veces tanto en la tarifa de entrada como en la de salida. Esa diferencia es el argumento económico para dirigir las solicitudes al modelo más barato que aún pueda hacer el trabajo, en lugar de enviar cada solicitud al mismo modelo por defecto.
El almacenamiento en caché de contexto es una tercera palanca de costo que no tiene nada que ver con qué modelo se elige. La documentación de optimización de Google documenta un descuento del 90 por ciento en los tokens almacenados en caché cuando un contexto inicial grande y repetido, como una instrucción de sistema larga o un documento de referencia, se reutiliza entre solicitudes, junto con un tiempo hasta el primer token más rápido cuando hay un acierto de caché.
Equilibrios y casos límite
El enrutamiento entre varios modelos es la forma en que los equipos aplican todo esto a la vez: enviar la mayoría de las solicitudes a un modelo económico y rápido por defecto, y escalar solo las que lo necesiten a un modelo más capaz. Anthropic describe dos versiones de esto: un ejecutor que escala decisiones difíciles a un modelo asesor, y un orquestador que delega trabajo masivo a modelos trabajadores de menor costo. Una función que recurre a MCP para alcanzar herramientas o un modelo más grande a mitad de tarea es una forma común en que este enrutamiento se implementa en un producto agéntico.
Antes de comprometerte con un modelo, construye un conjunto de evaluación a partir de tus propias instrucciones y tus propios datos. La orientación de cada proveedor converge en la misma práctica: prueba los modelos candidatos con entradas reales, compara precisión, calidad de respuesta y cómo maneja cada uno los casos límite, y luego sopesa la diferencia de costo frente a lo que realmente vale esa ganancia de precisión para la función. Una puntuación en una clasificación general, o la afirmación de marketing de un proveedor, no te dirá eso. La calidad en un benchmark general no siempre predice la calidad en tu tarea específica.
La elección del modelo tampoco es el mismo problema que la seguridad. Para funciones agénticas o de alta autonomía, las barreras de seguridad y las puertas de aprobación sobre lo que la función tiene permitido hacer suelen importar más para la seguridad del producto que qué modelo hay detrás. Un modelo más capaz no sustituye un límite de permisos, un paso de aprobación antes de una acción irreversible, o un registro de auditoría de lo que la función realmente hizo.
El error más común es recurrir por defecto al modelo más capaz y más caro para cada llamada dentro de una función, incluidas las partes estrechas y bien acotadas de esta. La clasificación, la extracción y las búsquedas breves rara vez necesitan la profundidad de razonamiento de un modelo de frontera. Dirigir ese tráfico a un modelo más económico normalmente no cuesta nada en calidad mientras reduce la factura de forma considerable.
Preguntas frecuentes
¿Siempre debo empezar con el modelo más económico?
Para la mayoría de las funciones de producto, sí. Empieza con el modelo más pequeño o económico que pueda plausiblemente hacer el trabajo, pruébalo con instrucciones reales, y mejora solo donde falle en una capacidad concreta. Reserva un comienzo centrado en capacidad para tareas donde la precisión importa más que el costo desde el principio, como el razonamiento complejo o el trabajo agéntico de largo alcance.
¿Cuál es la diferencia entre cambiar de modelo y cambiar el esfuerzo?
El esfuerzo, a veces llamado profundidad de razonamiento, es un ajuste dentro de un mismo modelo que intercambia inteligencia por latencia y costo sin cambiar de modelo en absoluto. Los proveedores recomiendan ajustar el esfuerzo primero, ya que es un cambio más pequeño y más reversible que sustituir el modelo subyacente.
¿Un modelo más económico siempre significa peor calidad?
No para todas las tareas. Un modelo más pequeño puede igualar a un modelo insignia en trabajo estrecho y bien acotado como extracción o clasificación, y la única forma de saberlo es poner a prueba a ambos con tu propio conjunto de evaluación en lugar de asumir que la calidad escala con el precio.
¿Cuánto se puede ahorrar realmente con el procesamiento por lotes o el almacenamiento en caché?
El procesamiento por lotes suele costar aproximadamente la mitad de la tarifa estándar por token a cambio de una latencia medida en horas en lugar de segundos. Reutilizar un contexto grande y repetido mediante el almacenamiento en caché puede reducir aún más los costos: un proveedor documenta un descuento del 90 por ciento en tokens almacenados en caché, además de un tiempo hasta el primer token más bajo.
Un equipo que esté definiendo el alcance de una nueva función de IA puede aplicar la misma prueba antes de escribir cualquier texto de producto sobre ella: probar primero el modelo más pequeño que pueda funcionar, y recurrir al más grande solo cuando aparezca una brecha real en las evaluaciones. Kallos Labs puede actuar como esa segunda opinión sobre dónde trazar esa línea; contáctanos a través de la página de automatización con IA si eso resulta útil.