More in
Noticias de AI en el Trabajo
OpenAI Abrio la Publicidad en ChatGPT a Pequenas Empresas con Cualquier Presupuesto
jun. 6, 2026
La AI Esta en Todas Partes en el Trabajo. Solo 1 de Cada 10 Dice que Transformo el Empleo
jun. 6, 2026
El Momento de $10.5B del Vibe Coding: AI Ahora Inicia la Mayoria de los Nuevos Desarrollos de Software
jun. 6, 2026
Los Agentes de AI Tienen Ahora Mas Acceso al Sistema que sus Empleados. Pocos Estan Asegurados
jun. 5, 2026
¿Deberia Construir su AI o Comprarla? Observe lo que Compraron los Gigantes.
jun. 5, 2026
Uber Limita el Gasto de AI por Empleado a $1,500 por Puesto Tras un Descontrol Presupuestario
jun. 5, 2026
La Orden Ejecutiva de AI de Trump es Desregulatoria. Su Riesgo de Cumplimiento No Cambio
jun. 4, 2026
La AI Empujo a 220 Unicornios por Debajo de $1B. Las Empresas Pre-ChatGPT Enfrentan un Ajuste de Cuentas
jun. 4, 2026
Los Precios por Token Cayeron un 67% Este Ano. Su Factura de AI Sigue Subiendo
jun. 3, 2026 · Currently reading
Las Pequenas Empresas que Usan AI Reportan Mayores Ingresos y Jornadas Laborales Mas Cortas
jun. 3, 2026
Los Precios por Token Cayeron un 67% Este Año. Su Factura de AI Sigue Subiendo

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
Sus proveedores cotizan precios más bajos. Su equipo de finanzas está marcando una partida de AI más grande. Ambas afirmaciones son correctas.
Eso no es una contradicción. Es la trampa de costos definitoria de la AI empresarial en 2026, y la mayoría de los CEO todavía no tienen un marco para comprenderla.
Según un análisis de Fortune publicado el 22 de mayo de 2026, el giro hacia flujos de trabajo de inteligencia artificial (AI) agéntica está provocando que el gasto empresarial total aumente con fuerza, incluso mientras el costo unitario de la inferencia de AI sigue bajando. El problema no es el precio por token. Es la cantidad de tokens que consumen las cargas de trabajo de AI modernas.
La Paradoja de Jevons Está Gestionando su Presupuesto de AI

Los economistas tienen un nombre para este patrón. La Paradoja de Jevons sostiene que cuando un recurso se abarata, el consumo total tiende a crecer más rápido de lo que cae el precio, porque el menor costo habilita nuevos casos de uso que antes no eran viables. El carbón. La electricidad. El ancho de banda. Ahora, los tokens.
Los costos combinados de inferencia de AI cayeron aproximadamente un 67% interanual, pasando de aproximadamente 18,40 a 6,07 dólares por millón de tokens entre el primer trimestre de 2025 y el primero de 2026, según análisis de costos de la industria de 2026. Es una caída de precios real y significativa.
Sin embargo, el 73% de las empresas reportó en 2026 que sus costos reales de AI superaron las proyecciones originales. Esa brecha no es un error de presupuestación. Es la Paradoja de Jevons en acción: la AI más barata permitió a las empresas desplegar más, en más lugares, con cargas de trabajo más complejas.
Datos Clave
- Los precios por token cayeron aproximadamente un 67% interanual (aprox. de 18,40 a 6,07 dólares por millón de tokens, del T1 2025 al T1 2026). (Análisis de costos de la industria 2026)
- El 73% de las empresas reportó que el gasto en AI superó las proyecciones originales en 2026. (Análisis de costos 2026)
- Un análisis de Goldman Sachs proyecta que la AI agéntica podría incrementar la demanda total de tokens hasta 24 veces. (Tom's Hardware, citando a Goldman Sachs)
Por Qué la AI Agéntica Desborda el Presupuesto
Los casos de uso simples de AI, un chatbot respondiendo una pregunta o un modelo resumiendo un documento, consumen tokens en un solo intercambio. Un prompt de entrada, una respuesta de salida. Ese costo se puede modelar en una hoja de cálculo.
Las cargas de trabajo agénticas no funcionan así. Un agente que completa una tarea de forma autónoma dispara entre 10 y 20 llamadas al modelo por acción del usuario. Cada paso del flujo de trabajo es una llamada de inferencia separada. La generación aumentada por recuperación (RAG), en la que el modelo incorpora documentos relevantes para responder con precisión, infla las ventanas de contexto entre 3 y 5 veces. Los agentes de monitoreo siempre activos funcionan de forma continua las 24 horas del día, generando tokens tanto si un humano está mirando como si no.
El efecto compuesto es considerable. Un único flujo de trabajo agéntico que parece "una sola tarea" puede consumir cincuenta veces más tokens que la misma solicitud gestionada por un modelo básico de llamada única.
El análisis de Goldman Sachs reportado por Tom's Hardware puso una cifra a esto: la AI agéntica podría incrementar la demanda total de tokens empresariales hasta 24 veces en comparación con el consumo actual. No es una previsión para un futuro lejano. Empresas como Uber ya lo están viviendo.
El director de tecnología de Uber reveló que la empresa agotó todo su presupuesto de AI para 2026 en cuatro meses. La adopción interna de Claude Code, el asistente de codificación de AI de Anthropic, saltó del 32% al 84% entre sus aproximadamente 5.000 ingenieros. El costo mensual por ingeniero oscila entre 500 y 2.000 dólares, según los reportes de Fortune y Tom's Hardware. Con esa tasa de adopción y esa base de ingeniería, el gasto se acumula rápidamente.
Y como reportó Fortune, Microsoft ha reconocido que para algunas cargas de trabajo, el costo de procesamiento de AI supera lo que costaría un trabajador humano realizando la misma tarea.
GitHub Acaba de Cambiar el Modelo de Facturación. Otros Seguirán.
Esta realidad de costos está redefiniendo la forma en que los proveedores de AI estructuran sus contratos.
El 1 de junio de 2026, GitHub migró Copilot de suscripciones de tarifa plana a un modelo basado en uso con "GitHub AI Credits" vinculados directamente al consumo de tokens. Microsoft está moviendo su suite Copilot más amplia hacia la misma estructura de créditos en el mismo período.
Esto importa para su próxima negociación con proveedores. El modelo de licencia por puesto fijo, que hacía que el presupuesto de AI se pareciera a un gasto de SaaS predecible, está terminando. Está entrando en territorio de servicio medido, y la factura escala con el uso, no con la cantidad de empleados.
Los modelos de gobernanza para AI, tratados con mayor profundidad en AI Agéntica y la Brecha de Gobernanza, no fueron diseñados para el consumo medido. La mayoría de las empresas todavía no tienen visibilidad del costo por flujo de trabajo.
Qué Hacer al Respecto
Los tokens más baratos son una ventaja real si los aprovecha correctamente. Pero aprovecharlos requiere tratar la infraestructura de AI como trata el cómputo en la nube: como un servicio medido con controles de costos a nivel de flujo de trabajo, no como una licencia de tarifa plana por puesto.
Aquí hay un marco práctico de partida.
Instrumente el costo de tokens por flujo de trabajo antes de escalar. No puede optimizar lo que no mide. Antes de expandir un flujo de trabajo agéntico a toda su organización, mida cuánto cuesta realmente por tarea completada. Compárelo con el equivalente en trabajo humano. Algunos flujos de trabajo mostrarán una ventaja de costos de 10 veces. Otros mostrarán lo contrario.
Establezca presupuestos y guardrails para los agentes. Cada agente desplegado debería tener un presupuesto máximo de tokens por tarea. Cuando el agente lo supere, la tarea debería escalar a un humano o caer de vuelta a un modelo más económico. Esto es estándar en la gestión de costos en la nube y debería serlo también en la gestión de AI.
Decida qué flujos de trabajo justifican el gasto agéntico. No toda tarea necesita un agente autónomo de múltiples pasos. Una tarea simple de clasificación o resumen puede usar un modelo de llamada única a una fracción del costo. Los modelos de pesos abiertos más baratos son cada vez más viables para inferencias de menor riesgo, como se analiza en el análisis de Nvidia Nemotron para CTO. Ajuste el modelo a la complejidad del flujo de trabajo.
Renegocie en la renovación con datos de uso en mano. Si su proveedor está migrando a facturación basada en créditos, sus datos de consumo real del período de tarifa plana son su palanca de negociación. Conozca lo que ha estado consumiendo antes de acordar una nueva estructura de precios.
Trate la AI como un servicio público, no como una licencia de software. Las empresas eléctricas no le venden "electricidad ilimitada" a una tarifa mensual fija. Tampoco lo harán los proveedores de AI, una vez que la adopción agéntica madure por completo. Construya ahora sus procesos internos de gobernanza y finanzas en torno a la contabilidad basada en consumo, antes de que el modelo de facturación cambie bajo sus pies.
El hallazgo del BCG AI Radar 2026 de que el 90% de los CEO espera que la AI agéntica genere ROI este año sugiere que la mayoría de las organizaciones están apostando fuerte por esta tecnología. Pero los cálculos de ROI que asumen precios de tarifa plana estarán equivocados. La estructura de costos ha cambiado. La estrategia necesita ponerse al día.
Para una visión más amplia de cómo están evolucionando las relaciones con los proveedores de AI, el análisis de la posición de Anthropic como proveedor a partir de su filing de IPO cubre las implicaciones estratégicas de que la AI se convierta en un gasto de infraestructura fundamental.
La Auditoría de Costos del Agente en 3 Preguntas
Antes de desplegar cualquier flujo de trabajo agéntico a escala, responda estas tres preguntas:
- ¿Cuál es el costo en tokens por tarea completada, medido en 100 ejecuciones reales (no demos)?
- ¿Ese costo supera la alternativa de trabajo humano en su escala actual y a 10 veces esa escala?
- ¿Qué guardrail limita el costo cuando el agente se comporta de forma inesperada o el alcance de la tarea se amplía?
Si no puede responder las tres, el flujo de trabajo no está listo para producción a escala.
Preguntas Frecuentes
¿Por qué sube mi factura de AI si los precios por token están bajando?
Porque las cargas de trabajo de AI modernas consumen muchos más tokens que las aplicaciones simples de chat que asumía la mayoría de los modelos de presupuesto. Los flujos de trabajo agénticos disparan entre 10 y 20 llamadas al modelo por tarea de usuario, y la generación aumentada por recuperación (RAG) expande las ventanas de contexto entre 3 y 5 veces. El precio por token es más bajo, pero el volumen consumido es dramáticamente mayor. El gasto total sube aunque el precio unitario baje, lo cual es la Paradoja de Jevons aplicada a la infraestructura de AI.
¿Qué debería hacer antes de mi próxima renovación con un proveedor de AI?
Recopile sus datos reales de consumo de tokens por flujo de trabajo del período de tarifa plana actual. A medida que los proveedores migran a facturación basada en créditos, esos datos se convierten en su línea base de negociación. Conozca lo que ha estado consumiendo antes de acordar una nueva estructura de precios.
¿Qué cargas de trabajo de AI no justifican el gasto agéntico en tokens?
Las tareas de un solo paso que no se benefician de cadenas de razonamiento: clasificación de documentos, resúmenes básicos, extracción de entidades, puntuación de sentimiento. Estas pueden ejecutarse en modelos de llamada única más económicos o en alternativas de pesos abiertos. Reserve el gasto agéntico de múltiples pasos para flujos de trabajo donde el razonamiento autónomo realmente cambia la calidad del resultado, como análisis complejos, investigación de múltiples fuentes o tareas que requieren toma de decisiones secuencial.
Fuente: Fortune, 22 de mayo de 2026 | Tom's Hardware | Duperrin, 1 de junio de 2026

Co-Founder, Rework.com