Qué es un token y por qué importa
Los modelos de lenguaje no leen palabras ni letras, sino tokens: trozos de texto de longitud variable. Una palabra corta y frecuente suele ser un token; una larga o poco común se divide en dos o tres. En español, como regla rápida, 100 palabras son unos 140–150 tokens, algo más que en inglés porque nuestras palabras son más largas y los modelos se entrenan sobre todo con texto en inglés.
Importa por dos razones. Primero, el coste: las API de IA se facturan por millón de tokens, con un precio para lo que envías (entrada) y otro, más alto, para lo que el modelo genera (salida). Segundo, el límite de contexto: cada modelo admite un máximo de tokens por conversación; si lo superas, tiene que olvidar el principio o rechazar la petición.
Cómo usar la calculadora
- Pega el texto que vas a enviar al modelo (tu prompt, un documento, un correo…).
- Elige el tipo de texto. El español consume más tokens que el inglés; el código, más todavía.
- Indica cuántos tokens esperas de respuesta. Orientación: una respuesta corta, 100–300; un correo o resumen, 300–800; un artículo o informe, 1.500–3.000.
- Si es para una automatización, pon el número de peticiones al mes y verás el coste mensual por modelo.
Qué precisión tiene
El recuento es una estimación basada en la longitud del texto y en el idioma, con un margen de error de aproximadamente un 10–15 %. Cada proveedor usa su propio tokenizador y el resultado exacto solo lo da la API (Anthropic ofrece un endpoint gratuito de recuento). Para presupuestar, la estimación es más que suficiente; para facturar a un cliente, usa el recuento real que devuelve cada petición.
Cómo reducir el coste
- Usa el modelo más pequeño que haga bien la tarea. Para clasificar, extraer o resumir textos cortos, Haiku o equivalentes cuestan una fracción de los modelos grandes con resultados casi iguales.
- Recorta la entrada. Elimina cabeceras, firmas, texto repetido. Si procesas un PDF, extrae solo las páginas relevantes.
- Limita la salida. Pide respuestas concretas ("responde solo con la categoría") y fija un máximo de tokens en la petición.
- Aprovecha la caché de prompts. Si envías siempre las mismas instrucciones largas, los proveedores permiten cachearlas y cobran mucho menos por las repeticiones.
- Usa el modo por lotes para tareas que no necesitan respuesta inmediata: suele costar la mitad.
Si vas a montar una automatización, en la guía qué es n8n y cómo automatizar con IA explicamos dónde encaja la IA en un flujo y cómo controlar el gasto.
Preguntas frecuentes
¿El texto que pego se envía a algún servidor?
No. Todo el cálculo se hace en tu navegador con JavaScript. Puedes comprobarlo desconectando Internet: la herramienta sigue funcionando.
¿Por qué el resultado no coincide exactamente con el que da la API?
Porque cada proveedor usa un tokenizador distinto y aquí usamos una aproximación por longitud e idioma. El margen habitual es del 10–15 %. Para el número exacto, usa el recuento que devuelve la propia API.
¿Los precios están actualizados?
Se indican con su fecha bajo la tabla y se revisan periódicamente. Los proveedores cambian tarifas con frecuencia, así que antes de contratar comprueba la página oficial de precios de cada uno (enlazadas en la nota).
¿Qué diferencia hay entre tokens de entrada y de salida?
Los de entrada son todo lo que envías al modelo: instrucciones, contexto, documentos, historial de la conversación. Los de salida son lo que el modelo genera. La salida es varias veces más cara por token porque generar texto cuesta más cómputo que leerlo.