← AI Notes · LLMs · Standard v1

¿Qué son los Tokens?

¿Qué son los tokens y por qué determinan el coste y la velocidad de un producto de IA?

When to use this note

Cuando tengas que estimar coste, latencia o margen de una feature de IA — o justificar por qué un prompt debe recortarse.

Definition

Un token es la unidad mínima que un LLM procesa. Puede ser una palabra completa, un fragmento de palabra o un signo. Todo lo que envías al modelo y todo lo que responde se cuenta en tokens — y esa cuenta determina tanto el coste como la latencia de cada interacción.

Why it matters

Los tokens son la unidad económica de un producto de IA. Un margen sano, una respuesta rápida y una experiencia sostenible dependen de gestionarlos con la misma seriedad con la que un SaaS gestiona su infraestructura. Ignorarlos es la vía más rápida a un producto insostenible.

Practical examples
  • "Inteligencia" puede consumir 3 tokens en un tokenizador BPE; "AI" consume 1. Un PDF corporativo de 20 páginas puede rondar los 12.000 tokens — más que muchos context windows pequeños.
  • El precio típico de un LLM se expresa como "X USD por millón de tokens de entrada / Y USD por millón de tokens de salida". Sin esa cuenta no puedes calcular el margen de una feature.
Applied inside Nadia OS
Flowin AI

En Flowin AI mido el coste por match en tokens antes de convertirlo a euros. Optimizar tokens —eliminar campos redundantes del prompt, recortar el histórico— es optimizar margen y latencia al mismo tiempo, sin tocar el modelo.

AI Identity Passport (PersonaOS)

En PersonaOS el payload de identidad que viaja en cada llamada tiene un presupuesto de tokens explícito. Si la identidad crece sin control, cada llamada del usuario se vuelve más lenta y más cara — así que la memoria portátil se diseña token a token, no campo a campo.

Common mistakes
  • "Un token es una palabra."
    Un token es una pieza de texto que el tokenizador decide. Palabras cortas en inglés suelen ser 1 token; palabras largas o en español pueden ser 2–4. Un emoji o un carácter chino pueden costar más que una palabra corta.
  • "El coste solo depende del prompt."
    Coste = tokens de entrada × precio de entrada + tokens de salida × precio de salida. La salida suele ser mucho más cara que la entrada. Controlar la longitud de la respuesta es tan importante como controlar el prompt.
  • "Los tokens solo importan para el coste."
    También determinan la latencia (más tokens = más tiempo) y el uso de context window. Un producto lento pierde usuarios antes que un producto caro.
Key takeaways
  • Los tokens son la unidad económica y física de un producto de IA. Diseña con ellos a la vista.
  • Cost per interaction = tokens in × precio in + tokens out × precio out. Aprende esa fórmula de memoria.
  • Optimizar tokens es una palanca de producto, no un tema técnico. Se decide en el diseño del prompt y de la experiencia, no en la infraestructura.
Resources
  • OpenAI Tokenizer
    Pega texto y ve cuántos tokens consume — la mejor forma de calibrar la intuición.
  • Anthropic — Token counting
    API oficial para contar tokens antes de llamar al modelo — clave para estimar coste sin sorpresas.
Citations
  1. docsOpenAI — Pricing · OpenAI · accessed 2026-07-08
    Fuente canónica del precio por millón de tokens (entrada/salida) usado en la fórmula de coste.
Suggested next reading
Version: v1Last updated: 2026-07-08Lifecycle: activeLocales: ES, EN