Mejores frameworks de agentes de IA para desarrolladores en 2026: 13 SDK ordenados por experiencia de desarrollo

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
Actualizado en agosto de 2026. Si usted es un ingeniero que elige un SDK para escribir código, y no un equipo de negocio que configura un lienzo, empiece por LangGraph si el agente debe sobrevivir a una caída a mitad de una tarea, por el OpenAI Agents SDK o el Claude Agent SDK si ya estandarizó en un proveedor de modelos, o por Google ADK si su equipo abarca más de un lenguaje. Esta guía ordena 13 frameworks y SDK centrados en código, de código abierto y comerciales, únicamente por experiencia de desarrollo: cuánto boilerplate exigen antes de que corra un primer agente, si una llamada defectuosa a una herramienta falla en CI o en producción, cómo hacen streaming, si un agente sobrevive a un reinicio, si se puede cambiar el modelo subyacente, cómo se despliega y qué tan buena es realmente la documentación. Todos los precios de abajo provienen de la página de precios del propio proveedor, consultada en agosto de 2026.
Este es un enfoque distinto al de nuestra guía de mejores frameworks de agentes de IA de código abierto, que ordena 15 frameworks por términos de licencia y ajuste al autoalojamiento. Esta deja de lado ese criterio y plantea una pregunta más acotada: cuál SDK es realmente el mejor para escribir código, ya sea con licencia MIT o vendido bajo los términos comerciales de un proveedor. Por eso el OpenAI Agents SDK, el Claude Agent SDK, Google ADK y Microsoft Agent Framework aparecen junto a LangGraph y CrewAI, algo que un resumen puramente de código abierto no puede hacer. Una nota de alcance antes de seguir: un framework de agentes, en esta guía, planifica una secuencia de pasos y llama a herramientas para ejecutarlos. No es una herramienta de IA para programar que autocompleta una línea mientras un humano dirige cada pulsación de tecla, ni un constructor no-code de agentes que un equipo de negocio configura mediante un lienzo visual. ¿Aún duda entre escribir código y arrastrar nodos? Lea primero agentes de IA no-code vs código.
Cómo evaluamos: 8 factores que realmente separan estos SDK
Una lista de funciones dice poco cuando todos los frameworks afirman admitir herramientas y memoria. Estas ocho preguntas predicen si un framework encaja de verdad con su equipo, y son el criterio detrás de cada sección de abajo.
| Dimensión | La pregunta real |
|---|---|
| Experiencia de desarrollo | Cuánto boilerplate antes de que corra un primer agente, y qué tan legible es el código seis meses después |
| Seguridad de tipos | Si una llamada malformada a una herramienta falla una verificación de tipos en CI o genera un incidente en producción |
| Streaming y asincronía | Si se pueden transmitir tokens y eventos de herramientas a una UI o a un log en tiempo real |
| Evals y pruebas integradas | Si el framework incluye una forma de probar un agente contra escenarios, o la construye usted mismo |
| Durabilidad y reanudabilidad | Si un agente sobrevive a un reinicio del proceso a mitad de tarea, o empieza desde cero |
| Portabilidad de modelos | Si se puede cambiar el modelo subyacente sin reescribir el agente |
| Estrategia de despliegue | Local, serverless, autoalojado o gestionado, y cuánto cuesta realmente cada opción |
| Calidad de la documentación | Documentación oficial, guías de migración y si el proyecto se mantiene activamente o está discretamente en modo de mantenimiento |
La durabilidad es lo que los ingenieros subestiman hasta el primer incidente en producción. Para conocer los patrones subyacentes más allá de la implementación de un framework concreto, consulte memoria de agentes de IA. Los evals se omiten por la misma razón: son invisibles hasta que un agente falla frente a un cliente, y lo que está en juego sigue creciendo. Los agentes pasaron de aproximadamente un 12% a un 66.3% de éxito en tareas en OSWorld, el benchmark de tareas reales de uso del computador, en el año previo a 2026, según el AI Index de Stanford HAI, lo que convierte a un agente que falla en silencio en lugar de recuperarse en un error más caro que antes. Observabilidad de agentes de IA cubre qué instrumentar sin importar cuál de los SDK de abajo lo incluya de forma nativa.
Datos Clave
- Más de 1.1 millones de repositorios públicos de GitHub importan ahora un SDK de LLM, un 178% más que el año anterior, y 693,867 de ellos se crearon solo en los últimos 12 meses, según el informe Octoverse de GitHub.
- El 57.3% de las organizaciones reporta tener agentes de IA en producción, según la encuesta State of Agent Engineering de LangChain a 1,340 profesionales (del 18 de noviembre al 2 de diciembre de 2025), pero solo el 52.4% de los encuestados ejecuta evaluaciones offline sobre conjuntos de prueba, justo la brecha que las herramientas de evals integradas de un framework existen para cerrar.
- Las empresas que compran IA lista para usar en lugar de construir la suya pasaron del 53% en 2024 al 76% en 2025, según State of Generative AI in the Enterprise de Menlo Ventures, el trasfondo de por qué un SDK comercial de un proveedor ahora pertenece a la misma lista corta que un framework de código abierto.
- La cuota de los modelos de código abierto en el uso de LLM empresarial cayó al 11% en 2025, desde el 19% en 2024, aunque el gasto empresarial total en IA generativa se triplicó aproximadamente hasta $37 mil millones, según Menlo Ventures. Eso es elección de modelo, no de framework, pero explica por qué varios frameworks de abajo usan por defecto un modelo frontera cerrado aunque el código de orquestación sea de código abierto.
- Gartner predice que más del 40% de los proyectos de IA agéntica serán cancelados a finales de 2027, citando el valor de negocio poco claro y los controles de riesgo inadecuados, los dos modos de falla que la durabilidad y los evals están diseñados para detectar temprano.
Tabla comparativa rápida
| Herramienta | Ideal para | Precio de partida | Principal fortaleza | Principal limitación |
|---|---|---|---|---|
| LangGraph | Agentes de larga duración que deben sobrevivir a un reinicio | Gratis (MIT); LangSmith Plus $39/usuario/mes | Checkpointing nativo, pausa, reanudación, depuración con viaje en el tiempo | La curva de aprendizaje más pronunciada de esta lista |
| OpenAI Agents SDK | Equipos estandarizados en los modelos de OpenAI | SDK gratuito; tokens del modelo desde $5/$30 por M (nivel insignia) | Búsqueda web, intérprete de código y búsqueda de archivos nativos | Ata su arquitectura a la hoja de ruta de modelos de OpenAI |
| Claude Agent SDK | Equipos que quieren el propio bucle de agente de Claude Code como biblioteca | SDK gratuito; tokens del modelo desde $1 a $5 por M de entrada | Hooks, subagentes y sesiones del mismo harness que ejecuta Claude Code | No es de código abierto; solo modelos Claude |
| Google ADK | Equipos con varios lenguajes que necesitan evals integrados | Gratis (Apache 2.0); tokens de Gemini desde $0.75/M de entrada | El soporte de lenguajes más amplio (5) más un framework de evaluación real | Sin una tarifa fija publicada para el despliegue gestionado |
| Microsoft Agent Framework | Equipos de ingeniería estandarizados en .NET y Azure | Gratis (MIT); uso de tokens de Azure OpenAI | Seguridad de tipos respaldada por el compilador en C#, sucesor actual de AutoGen y Semantic Kernel | SDK unificado más joven; el soporte de Go sigue en preview |
| AWS Strands | Equipos que quieren tracing y evals activados por defecto | Gratis (Apache 2.0); cómputo de AWS más tokens del modelo | Tracing y Strands Evals integrados, genuinamente agnóstico al modelo | Sin precio fijo; requiere primero una estimación de uso |
| Vercel AI SDK | Equipos de TypeScript que transmiten la salida del agente a una UI | Gratis (Apache 2.0); tokens del modelo | Streaming con tipos seguros directo a React y Next.js | Solo TypeScript, sin Python |
| Mastra | Equipos de TypeScript que quieren evals y workflows integrados | Núcleo gratuito (Apache 2.0); Cloud Teams $250/mes | Agentes, workflows, memoria y evals como un solo conjunto de primitivas | Solo TypeScript; ecosistema más pequeño que los frameworks de Python |
| CrewAI | La demo multiagente funcional más rápida | Gratis (MIT); Enterprise personalizado | API basada en roles, legible sin conocimiento profundo del framework | La durabilidad y los evals más profundos están detrás de AMP, de pago |
| Pydantic AI | Equipos de Python que quieren salidas validadas | Gratis (MIT); Logfire desde $0 | Salidas estructuradas y validadas por construcción | La coreografía multiagente es menos opinada, más hecha por usted |
| LlamaIndex Workflows | Agentes basados en eventos con fuerte recuperación de datos | Gratis (MIT); LlamaCloud desde $50/mes | Pasos de eventos tipados, la mayor trayectoria en recuperación de datos aquí | La mayoría de los tutoriales aún asumen un caso de uso de RAG |
| Agno | Flotas de agentes de alta concurrencia | Gratis (Apache 2.0); AgentOS Pro $150/mes | Runtime ligero, benchmarks de rendimiento publicados | Las afirmaciones de rendimiento las publica el proveedor, verifíquelas usted |
| Atomic Agents | Equipos que quieren el núcleo más pequeño y auditable | Gratis (MIT); no existe nivel de pago | Seguridad de tipos basada en Pydantic en cada entrada y salida | Sin plataforma alojada ni evals integrados, usted ensambla ambos |
Lenguaje, seguridad de tipos y portabilidad de modelos
El soporte de lenguajes decide quién de su equipo puede siquiera tocar el código. La seguridad de tipos decide si una llamada defectuosa a una herramienta es un error en tiempo de compilación o una alerta a las 2 a. m.

| Framework | Lenguajes | Modelo de seguridad de tipos | Portabilidad de modelos |
|---|---|---|---|
| LangGraph | Python, TypeScript | Esquemas de estado tipados (TypedDict o Pydantic en Python, objetos tipados en TS) | Cualquier proveedor mediante las integraciones de modelos de LangChain |
| OpenAI Agents SDK | Python, TypeScript | Salidas estructuradas respaldadas por Pydantic (Python); interfaces tipadas (TS) | Nativo de OpenAI; más de 100 proveedores mediante la extensión oficial de LiteLLM (mejor esfuerzo) |
| Claude Agent SDK | Python, TypeScript | Interfaces tipadas, esquemas de herramientas estructurados | Solo modelos Claude |
| Google ADK | Python, Java, Kotlin, Go, TypeScript | Tipado estático en cuatro de cinco lenguajes | Optimizado para Gemini, explícitamente agnóstico al modelo |
| Microsoft Agent Framework | Python, .NET (C#), Go (preview) | Impuesto por el compilador en C#; type hints en Python | Microsoft Foundry, Azure OpenAI, OpenAI, Anthropic, Ollama y más |
| AWS Strands | Python, TypeScript | Interfaces tipadas en todo el framework | Integración nativa con Bedrock/AgentCore; Anthropic, OpenAI, Gemini y más |
| Vercel AI SDK | Solo TypeScript | Inferencia de tipos de extremo a extremo hasta la UI mediante InferAgentUIMessage |
Cualquier proveedor con un adaptador del SDK |
| Mastra | Solo TypeScript | TypeScript nativo en todo el framework, sin diseño portado de Python | Cualquier proveedor |
| CrewAI | Solo Python | Tipado estándar de Python | Cualquier proveedor mediante LiteLLM |
| Pydantic AI | Solo Python | Salidas validadas por construcción, la mejor propuesta de Python puro aquí | Cualquier proveedor, agnóstico al modelo por diseño |
| LlamaIndex Workflows | Python, TypeScript | Eventos tipados que se pasan entre los pasos del workflow | Cualquier proveedor |
| Agno | Solo Python | Tipado estándar de Python | Cualquier proveedor |
| Atomic Agents | Solo Python | Esquemas Pydantic en cada entrada y salida, construido sobre Instructor | Cualquier proveedor que Instructor admita, más Ollama y LMStudio en local |
Streaming, durabilidad y evals integrados
Esta es la tabla que vale la pena leer dos veces. El streaming ya es requisito mínimo, todos los frameworks de aquí lo tienen. La durabilidad y los evals son donde aparecen las brechas reales, y donde la página de marketing de un framework suele decir menos que su documentación.
| Framework | Streaming | Durabilidad / reanudabilidad | Herramientas de eval o pruebas integradas |
|---|---|---|---|
| LangGraph | Sí | Checkpointing nativo, pausa, reanudación, depuración con viaje en el tiempo | Mediante LangSmith, un producto de pago aparte |
| OpenAI Agents SDK | Sí | La Sessions API cubre el historial básico; el estado durable entre reinicios corre por su cuenta | Ninguna integrada |
| Claude Agent SDK | Sí | Las sesiones se reanudan o se bifurcan; los subagentes acotan el contexto en tareas largas | Ninguna integrada |
| Google ADK | Sí, incluido streaming bidireccional Live y de voz | Estado del workflow gestionado mediante Agent Runtime | Criteria, User Simulation, Environment Simulation, Custom Metrics, Optimization |
| Microsoft Agent Framework | Sí | Estado basado en sesiones; el Harness Agent añade compactación de contexto para tareas largas | Servicios de evaluación listados como categoría de integración de primera clase |
| AWS Strands | Sí | Con trazas por defecto; un sistema de hooks se dispara en cada llamada a una herramienta | Strands Evals: defina casos, elija evaluadores, ejecute experimentos antes de lanzar |
| Vercel AI SDK | Sí, su razón de ser original | DurableAgent mediante el Workflow DevKit complementario (un add-on, no parte del núcleo) |
Ninguna integrada |
| Mastra | Sí | Suspensión y reanudación de workflows nativas | Los evals son una primitiva de primera clase del framework, no un add-on |
| CrewAI | Sí | El estado de los Flows persiste en local; la durabilidad más profunda está detrás de AMP, de pago | La observabilidad y los evals están detrás de AMP, no en el núcleo de código abierto |
| Pydantic AI | Sí | Usted persiste por su cuenta los objetos de historial de mensajes | Mediante Logfire, un producto de pago aparte |
| LlamaIndex Workflows | Sí | El contexto del workflow puede serializarse y reanudarse entre pasos | Herramientas de evaluación de recuperación heredadas de su trayectoria en RAG |
| Agno | Sí | Almacenamiento integrado de sesión y estado diseñado para la concurrencia | Monitoreo mediante AgentOS; sin un conjunto de evals dedicado |
| Atomic Agents | Sí | Ninguna integrada, usted conecta la persistencia | pytest estándar; sin un producto de evals dedicado |
1. LangGraph: el control más profundo sobre el estado y la durabilidad
LangGraph modela un agente como un grafo de nodos y aristas en lugar de un único bucle de prompt, lo que hace que pausar, reanudar y depurar con viaje en el tiempo sean primitivas nativas y no algo añadido después. Ese modelo de checkpointing es la razón por la que es el framework al que recurren los equipos cuando el modo de falla de un agente es "perdió todo su progreso" y no solo "dio una respuesta equivocada". Funciona de forma independiente o dentro del ecosistema más amplio de LangChain, tanto en Python como en TypeScript. Para un recorrido práctico por los patrones principales, consulte construir un agente de IA con LangGraph.
El compromiso es el propio modelo mental de grafo. Lleva más tiempo aprenderlo que una crew basada en roles, y la capa de observabilidad más profunda, LangSmith, es gratuita para un usuario pero se cobra por usuario a partir de ahí.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Checkpointing nativo, pausa, reanudación, depuración con viaje en el tiempo | La curva de aprendizaje más pronunciada de todos los frameworks aquí |
| Aprobación human in the loop como primitiva de primera clase | La observabilidad completa (LangSmith) es de pago más allá de un usuario gratuito |
| Funciona con cualquier proveedor de modelos mediante las integraciones de LangChain | Más boilerplate que CrewAI para un solo agente simple |
| Soporte de Python y TypeScript | Las herramientas de despliegue (LangGraph Platform) son una capa de pago aparte |
Precios: Framework gratuito y de código abierto (MIT). LangSmith/LangGraph Platform: Developer $0/usuario (5,000 trazas gratuitas/mes, luego pago por uso, máximo 1 usuario), Plus $39/usuario/mes (10,000 trazas gratuitas/mes, 1 despliegue pequeño gratuito incluido), Enterprise personalizado con opciones autoalojadas e híbridas. Excedente: $1.50 por unidad de cómputo (LCU), $1.00 por unidad de almacenamiento (LSU). Fuente: langchain.com/pricing.
Ideal para: equipos de ingeniería que necesitan que un agente pause, reanude y recupere el estado sin perder progreso, y no solo que genere una buena respuesta.
2. OpenAI Agents SDK: el SDK más ligero de un proveedor de modelos frontera
La ventaja del OpenAI Agents SDK es la cercanía: lo construye la misma empresa que entrena los modelos que ejecuta, así que la búsqueda web, el intérprete de código y la búsqueda de archivos son funciones nativas medidas, no algo que se conecta mediante un tercero. El conjunto de primitivas (Agents, Handoffs, Guardrails, Sessions) es deliberadamente pequeño, uno de los frameworks más rápidos de aprender de principio a fin aquí.
A pesar de la marca, no está atado de forma rígida a los modelos de OpenAI. Una extensión oficial de LiteLLM le da acceso a más de 100 proveedores, incluidos Anthropic y Gemini, con el mismo código de agente, aunque ese soporte es oficialmente de mejor esfuerzo, no un contrato garantizado.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Herramientas nativas de búsqueda web, intérprete de código y búsqueda de archivos | Los costos escalan directamente con el uso de tokens, fáciles de subestimar |
| Conjunto mínimo de primitivas, rápido de aprender de principio a fin | El estado durable entre reinicios corre por su cuenta; la Sessions API cubre solo el historial |
| Soporte genuino multiproveedor mediante la extensión oficial de LiteLLM | El soporte de proveedores de LiteLLM es oficialmente de mejor esfuerzo, no parte del núcleo |
| Python y TypeScript, licencia MIT | Sin herramientas de eval dedicadas incluidas en el propio SDK |
Precios: SDK gratuito y de código abierto (MIT). El costo es el uso del modelo. El nivel insignia (por ejemplo, gpt-5.6-sol o gpt-5.5) cuesta $5.00 por millón de tokens de entrada y $30.00 por millón de tokens de salida; un nivel medio como gpt-5.6-terra cuesta $2.00 de entrada / $12.00 de salida, y un nivel económico como gpt-5.6-luna cuesta $0.20 de entrada / $1.20 de salida. Las herramientas integradas se facturan aparte: búsqueda web $10 por cada 1,000 llamadas más los tokens de contenido a tarifas del modelo, intérprete de código de $0.03 a $1.92 por sesión de 20 minutos según la memoria del contenedor (1GB a 64GB), búsqueda de archivos $0.10 por GB por día de almacenamiento (1GB gratis) más $2.50 por cada 1,000 llamadas a la herramienta. Fuente: developers.openai.com/api/docs/pricing.
Ideal para: equipos estandarizados en los modelos de OpenAI que quieren la menor huella de dependencias más búsqueda web, intérprete de código y búsqueda de archivos nativos sin ensamblarlos por separado.
3. Claude Agent SDK: el propio bucle de agente de Claude Code como biblioteca
El Claude Agent SDK, renombrado desde Claude Code SDK a finales de 2025, le entrega el mismo bucle de ejecución de herramientas, la misma gestión de contexto y las mismas herramientas integradas (edición de archivos, bash, búsqueda web, web fetch) que impulsan al propio Claude Code, programables en Python y TypeScript. Es un punto de partida significativamente distinto al de una abstracción de nivel de investigación: lo que obtiene es un harness que ya ha ejecutado millones de sesiones reales de programación y de agentes, no un diseño nuevo.
Tres funciones destacan para el uso en producción. Los hooks ejecutan código personalizado en puntos del ciclo de vida. Los subagentes lanzan agentes hijo especializados con su propio contexto, la forma más limpia de esta lista de evitar que la context window de una tarea larga se infle. Las sesiones mantienen el contexto entre intercambios y pueden reanudarse o bifurcarse después. Lo que no tiene es una licencia de código abierto OSI: el uso se rige por los Commercial Terms of Service de Anthropic, una diferencia real frente a todos los frameworks MIT o Apache 2.0 de aquí, que conviene leer antes de construir un producto revendido sobre él.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| El mismo bucle de agente y las mismas herramientas, probados en producción, que ejecutan Claude Code | No es de código abierto; se rige por términos comerciales, no MIT ni Apache 2.0 |
| Hooks, Subagents y Sessions para control del ciclo de vida y aislamiento de contexto | Solo modelos Claude, sin portabilidad entre proveedores |
| Soporte de cliente MCP y herramientas integradas de archivos, bash y web desde el inicio | Sin un framework de evals incluido; usted trae el suyo |
| Python y TypeScript, respaldado por el equipo que construye los modelos | Los desarrolladores externos no pueden ofrecer el inicio de sesión de claude.ai ni sus límites de uso dentro de un producto construido sobre el SDK |
Precios: Sin tarifa de licencia separada por el SDK, pero el uso se rige por los Commercial Terms of Service de Anthropic, no por una licencia de código abierto. El costo es el uso de tokens de la API de Claude: Claude Sonnet 5 cuesta $2 por millón de tokens de entrada y $10 por millón de tokens de salida (su precio introductorio pasó a ser la tarifa estándar), Claude Opus 5 cuesta $5 de entrada / $25 de salida, Claude Haiku 4.5 cuesta $1 de entrada / $5 de salida. El prompt caching reduce un acierto de caché a aproximadamente el 10% del precio base de entrada. Búsqueda web (herramienta de servidor): $10 por cada 1,000 búsquedas. Ejecución de código: 1,550 horas gratuitas por organización al mes, luego $0.05 por hora por contenedor. Fuente: platform.claude.com/docs (pricing) y code.claude.com/docs (SDK overview).
Ideal para: equipos que quieren el bucle de agente, los hooks y el modelo de subagentes de Claude Code, probados en producción, como biblioteca en lugar de ensamblar un equivalente desde cero.
4. Google ADK: el soporte de lenguajes más amplio y los evals integrados más profundos
El Agent Development Kit de Google aplica la disciplina de la ingeniería de software ordinaria a la construcción de agentes, centrado en código según su propia descripción, y lo respalda con la cobertura de lenguajes más amplia de esta lista: Python, Java, Kotlin, Go y TypeScript, todos bajo Apache 2.0. Una opción de Agent Config no-code y una UI de desarrollo integrada conviven con la vía centrada en código, así que un equipo mixto no necesita que todos escriban en el mismo lenguaje.
La característica más destacada de ADK entre estos 13 es su propuesta de evaluación: un framework integrado genuino con Criteria, User Simulation, Environment Simulation, Custom Metrics y un componente de Optimization, más cercano a un conjunto de pruebas real que el "traiga sus propias herramientas de eval" que exige la mayoría de los frameworks. El streaming también va más allá, con agentes bidireccionales reales Live y de voz mediante la Gemini Live API, no solo texto token a token. Si prefiere comprar una suite gestionada en lugar de escribir código contra un SDK, mejores plataformas de agentes de IA enterprise cubre esa alternativa.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Cinco lenguajes admitidos, el más amplio de cualquier framework aquí | El precio del despliegue mediante Agent Runtime no es una tarifa fija publicada |
| Un framework de evaluación integrado genuino, no un añadido | Mejor documentado y más probado en batalla en Python; los demás lenguajes van detrás |
| Streaming bidireccional Live y de voz mediante la Gemini Live API | Optimizado para Gemini, así que los despliegues fuera de Google implican más trabajo de integración |
| Vías de despliegue en Cloud Run, GKE o Agent Runtime gestionado | SDK multilenguaje más jóvenes (Go, Kotlin) que el lanzamiento principal de Python |
Precios: Framework gratuito (Apache 2.0). Ejecutarlo cuesta tokens de la API de Gemini más el cómputo en que lo despliegue. Gemini 3.7 Flash: nivel gratuito disponible; nivel de pago $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida hasta el 31 de diciembre de 2026, y sube a $1.50 de entrada / $7.50 de salida el 1 de enero de 2027. El despliegue gestionado mediante el Agent Runtime de la Gemini Enterprise Agent Platform es basado en consumo; Google no mostró una tarifa fija publicada al momento de escribir esto, así que presupueste una estimación de uso de Vertex AI en lugar de un precio de lista, la misma advertencia honesta que aplica a AWS Bedrock AgentCore. Fuente: github.com/google/adk-python, adk.dev, ai.google.dev/gemini-api/docs/pricing.
Ideal para: equipos de ingeniería con varios lenguajes que quieren las herramientas de evaluación integradas más completas de cualquier framework de esta lista.
5. Microsoft Agent Framework: seguridad de tipos respaldada por el compilador para .NET y Azure
Microsoft Agent Framework, disponible de forma general desde el 3 de abril de 2026, es el sucesor directo tanto de AutoGen como de Semantic Kernel, construido por los mismos equipos detrás de cada uno. Combina las abstracciones simples de uno y varios agentes de AutoGen con las funciones enterprise de Semantic Kernel, gestión de estado basada en sesiones, seguridad de tipos, middleware, telemetría, y añade Workflows basados en grafos para rutas de ejecución multiagente explícitas que ninguno de los predecesores tenía por sí solo.
La propuesta de seguridad de tipos es genuinamente diferenciadora para un equipo de C#: el compilador respalda la afirmación de una manera que un lenguaje de tipado dinámico no puede. El framework también incluye un "Harness Agent", un agente con todo incluido para tareas largas de varios pasos con planificación, compactación de contexto, acceso a archivos y memoria, control de aprobación de herramientas y observabilidad integrados, una combinación de durabilidad y evals que pocos frameworks de aquí ofrecen en un solo paquete. El soporte abarca ahora Python, .NET y un SDK de Go en preview público, y a pesar del nombre, se conecta a Microsoft Foundry, Anthropic, Azure OpenAI, OpenAI y Ollama, no solo a los modelos propios de Microsoft.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Seguridad de tipos impuesta por el compilador en C#, estado de sesión, middleware y telemetría | El soporte de Go está en preview público; los agentes declarativos y RAG aún no están |
| Un SDK unificado en lugar de elegir entre AutoGen y Semantic Kernel | Producto unificado más joven, aún con asperezas frente a los originales maduros |
| El "Harness Agent" agrupa planificación, memoria y aprobación de herramientas desde el inicio | El ecosistema y los tutoriales de la comunidad aún se ponen al día con el antiguo AutoGen |
| Soporte de modelos de varios proveedores (Foundry, Azure OpenAI, OpenAI, Anthropic, Ollama) | El mejor ajuste se estrecha fuera de un stack estandarizado en Microsoft |
Precios: Gratuito y de código abierto (MIT), sin tarifa de licencia. El costo es el uso de la API del modelo al que lo conecte, comúnmente el precio por tokens de Azure OpenAI Service. Fuente: learn.microsoft.com/en-us/agent-framework.
Ideal para: equipos de ingeniería estandarizados en .NET y Azure que quieren seguridad de tipos respaldada por el compilador y un sucesor actual y activamente desarrollado de AutoGen y Semantic Kernel en lugar de cualquiera de los proyectos heredados.
6. AWS Strands: tracing y evals activados por defecto
Strands es la apuesta propia de AWS sobre cómo debería ser un SDK de agentes de producción, construido a partir de los patrones que AWS ya ejecuta dentro de Amazon Q Developer, AWS Glue y su VPC Reachability Analyzer. Llegó a la versión 1.0 el 21 de mayo de 2026, el lanzamiento que lo llevó de "bueno para un solo agente" a una orquestación multiagente genuinamente lista para producción, con patrones de agente como herramienta y de enjambre más soporte de MCP integrado.
Lo que distingue a Strands aquí es que la observabilidad y los evals no son una ocurrencia tardía: cada decisión del agente recibe un atributo de traza por defecto, no detrás de una bandera opcional, y un sistema de hooks (BeforeToolCallEvent, AfterToolCallEvent) le permite interceptar el bucle en cualquier punto. Strands Evals permite a un equipo definir casos de prueba, elegir evaluadores y ejecutar experimentos antes de lanzar, una respuesta integrada genuina y no un producto de pago aparte. También es agnóstico al modelo por diseño: integración nativa con Bedrock y AgentCore, pero Anthropic, OpenAI, Gemini y otros funcionan sin reescritura. El paquete de Python strands-agents registró 16.7 millones de descargas al mes a junio de 2026.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Tracing activado por defecto y un sistema de hooks en cada llamada a una herramienta | Framework más joven que LangGraph o CrewAI, con menor trayectoria comunitaria |
| Strands Evals: defina casos, elija evaluadores, ejecute experimentos antes de lanzar | La integración nativa más profunda es con AWS; otras nubes requieren más configuración |
| Genuinamente agnóstico al modelo: Bedrock, Anthropic, OpenAI, Gemini y más | Sin alojamiento gestionado por parte de Strands; usted elige el destino de cómputo de AWS |
| Despliegue en AgentCore, Lambda, Fargate, EKS, Docker o Terraform | Los patrones de enjambre multiagente son más nuevos que el modelo de grafo de LangGraph |
Precios: Framework gratuito (Apache 2.0). Ejecutarlo cuesta el destino de cómputo en que lo despliegue (Lambda, Fargate, EKS o los precios basados en consumo de Bedrock AgentCore) más los costos de tokens del proveedor del modelo. Fuente: strandsagents.com, github.com/strands-agents.
Ideal para: equipos que quieren tracing y evals activados por defecto en lugar de añadidos después, y que quieren cambiar de proveedor de modelos sin reescribir el código del agente.
7. Vercel AI SDK: streaming con tipos seguros del modelo a la UI
El Vercel AI SDK es el framework que la mayoría de los equipos JavaScript full-stack ya tiene instalado para otra cosa, transmitir completions de chat a una app de Next.js o React, así que añadir un agente es un paso incremental y no una dependencia nueva. La interfaz Agent de AI SDK 6, implementada por ToolLoopAgent, codifica el patrón que la mayoría de los equipos solía armar a mano con generateText y un contador de pasos: llamar al modelo, ejecutar las llamadas a herramientas, anexar resultados, repetir, hasta 20 pasos por defecto mediante stopWhen: stepCountIs(20). Los hooks stopWhen y prepareStep dan un control fino sobre cuándo termina el bucle y qué contexto ve cada paso, y una bandera needsApproval añade control human in the loop a herramientas individuales.

Donde realmente lidera esta lista es en la seguridad de tipos que llega hasta la interfaz: los tipos fluyen automáticamente desde la definición de un agente hasta los componentes de la UI mediante InferAgentUIMessage, así que un cambio en la forma de retorno de una herramienta es un error de compilación en el frontend, no una sorpresa en tiempo de ejecución. La durabilidad es una historia más reciente aquí: DurableAgent, del Workflow DevKit complementario, convierte un agente en un workflow reanudable donde cada ejecución de herramienta pasa a ser un paso reintentable y observable, aunque es un add-on y no parte del núcleo del SDK.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Streaming con tipos seguros directo a Next.js, React, Svelte o Vue | Solo TypeScript, sin Python, un límite real si ahí vive alguna herramienta de ML |
ToolLoopAgent codifica el bucle agéntico en lugar de código maxSteps armado a mano |
Sin herramientas de eval integradas en el SDK principal |
needsApproval para control human in the loop en herramientas individuales |
Los workflows durables y reanudables requieren el add-on aparte Workflow DevKit |
| Funciona con cualquier proveedor de modelos para el que el SDK tenga un adaptador | Abstracción Agent más joven que el modelo de grafo de LangGraph |
Precios: Gratuito y de código abierto (Apache 2.0). El costo es el uso de la API del modelo al que lo apunte. Fuente: github.com/vercel/ai, vercel.com/blog/ai-sdk-6.
Ideal para: equipos de TypeScript que construyen un producto de cara al usuario donde la salida del agente debe fluir directamente a una interfaz web con seguridad de tipos total.
8. Mastra: agentes, workflows y evals como un solo conjunto de primitivas de TypeScript
Mastra está construido con la API primero para TypeScript, no portado de un diseño de Python, lo que se nota en lo naturalmente que se integra en un servicio existente de Next.js o Node en lugar de requerir un microservicio de Python aparte solo para ejecutar agentes. Lo que lo separa de la mayor parte de esta lista es la amplitud en un solo paquete: agentes, workflows, recuperación de datos, evals y memoria son todos primitivas de primera clase del mismo framework, en lugar de la capa de orquestación más tres productos de proveedores añadidos que terminan siendo la mayoría de los frameworks.
La durabilidad también es nativa, suspensión y reanudación de workflows más almacenamiento de memoria conectable, no algo que construye usted mismo. El framework principal sigue siendo Apache 2.0; un directorio ee/ aparte lleva una licencia comercial necesaria solo en producción para funciones enterprise específicas, una estructura de open-core y no una totalmente cerrada.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Agentes, workflows, memoria y evals como un conjunto coherente de primitivas | Solo TypeScript, sin Python |
| Suspensión y reanudación de workflows nativas, no añadidas | Ecosistema de plugins más pequeño que las integraciones de LangChain |
| Diseño TypeScript con la API primero, encaja en un servicio existente de Next.js o Node | Licencia open-core: el directorio ee/ requiere una licencia de pago en producción |
| Documentación activa y cadencia de lanzamientos rápida | Más joven que los incumbentes centrados en Python, con menos historias de guerra en producción |
Precios: Framework autoalojado gratuito (núcleo Apache 2.0). Mastra Cloud: Starter gratis (100,000 eventos de observabilidad, 24 horas de CPU, 15 días de retención, luego $10 por cada 100,000 eventos y $0.35 por hora de CPU), Teams $250/mes (1,000,000 de eventos, 250 horas de CPU, 6 meses de retención, luego $8 por cada 100,000 eventos y $0.25 por hora de CPU, más SSO y documentación SOC 2), Enterprise personalizado con una tarifa anual fija en lugar de medición por traza. Fuente: mastra.ai/pricing.
Ideal para: equipos de TypeScript que quieren evals y workflows durables integrados en el mismo framework en lugar de ensamblados con tres proveedores distintos.
9. CrewAI: la demo multiagente funcional más rápida
CrewAI define los agentes por rol, objetivo e historia de fondo, los agrupa en una crew y los ejecuta de forma secuencial o jerárquica contra un conjunto de tareas. Esa estructura, más un gran ecosistema de tutoriales y cursos, es la razón por la que suele ser el camino más rápido de cero a una demo multiagente funcional de todo lo de esta lista. Los Flows añaden una capa de control más determinista y centrada en código para los equipos que superan las crews puramente autónomas. Para una configuración práctica, consulte construir un agente de IA con CrewAI.
La plataforma alojada AMP de CrewAI Inc gestiona el despliegue, la observabilidad y los evals, y el precio se simplificó en 2026 a un nivel Basic gratuito y un nivel Enterprise personalizado tras discontinuar un plan Professional de autoservicio.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| El camino más rápido a una demo multiagente funcional de cualquier framework aquí | La durabilidad y los evals más profundos están detrás del producto en la nube AMP, de pago |
| Tanto crews autónomas como Flows deterministas en el mismo framework | Ya no hay un nivel de pago de autoservicio, solo gratuito o Enterprise personalizado |
| Gran comunidad, cursos y plantillas | La abstracción de juego de roles puede sentirse como sobrecarga para un solo agente simple |
| Licencia MIT, totalmente permisiva | Control de estado menos granular que LangGraph para ramificaciones complejas |
Precios: Framework de código abierto gratuito (MIT). AMP alojado: Basic gratis (50 ejecuciones de workflow al mes, editor visual, copiloto de IA, integración con GitHub), Enterprise personalizado (añade SSO, RBAC, identidad de carga de trabajo, redacción de PII y un programa de onboarding de 45 días). Fuente: crewai.com/pricing.
Ideal para: equipos de ingeniería que quieren un prototipo multiagente funcionando en una tarde y decidirán sobre la durabilidad en producción cuando sepan qué necesita sobrevivir el agente.
10. Pydantic AI: salidas validadas por construcción
Pydantic AI viene del equipo detrás del propio Pydantic, la biblioteca de validación de la que ya dependen la mayoría de las API web de Python, y se nota: las salidas del agente son estructuradas y validadas por construcción en lugar de analizadas con esperanza a partir de un bloque de texto, y las dependencias de las herramientas se inyectan como FastAPI inyecta las dependencias de las solicitudes. Eso convierte una llamada malformada a una herramienta en un error de tipos detectado en las pruebas, la mejor propuesta de seguridad de tipos de Python puro de toda esta lista, y no un incidente detectado en producción.
El framework en sí es totalmente abierto y gratuito, siempre. Logfire, el producto opcional de observabilidad del equipo, es una capa de pago aparte para los equipos que quieren tracing y seguimiento de evals encima de la validación que el framework ya da gratis.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Salidas estructuradas y validadas por construcción, no por esperanza | Ecosistema más joven que LangGraph o CrewAI, con menos plantillas de la comunidad |
| La inyección de dependencias al estilo FastAPI facilita las pruebas | Catálogo más pequeño de integraciones prediseñadas que el ecosistema de LangChain |
| Respaldado por un equipo en el que la mayoría de los equipos de Python ya confía para la validación | La coreografía multiagente es menos opinada, usted diseña más por su cuenta |
| Agnóstico al modelo, licencia MIT, siempre gratuito | La observabilidad opcional de Logfire es un producto de pago aparte |
Precios: Framework gratuito y de código abierto (MIT), siempre. Logfire: nivel gratuito con 10 millones de spans, logs y métricas al mes; nivel Team $49/mes (5 usuarios incluidos, hasta 12 usuarios en total a $25 por usuario adicional, $2 por millón de registros más allá de los 10 millones incluidos); nivel Growth $249/mes (usuarios ilimitados, hasta 90 días de retención, 5,000 solicitudes diarias a la API de consultas). Fuente: pydantic.dev/pricing.
Ideal para: equipos de Python que quieren un error de tipos en CI en lugar de una llamada malformada a una herramienta en producción.
11. LlamaIndex Workflows: agentes tipados y basados en eventos para trabajo con fuerte recuperación de datos
LlamaIndex Workflows modela un agente como un conjunto de pasos asíncronos que emiten y consumen eventos tipados, de modo que un agente de varios pasos se lee como una pequeña máquina de estados en lugar de un DSL de grafo dedicado. Surgió directamente de la trayectoria de LlamaIndex en conectores de datos y recuperación, lo que se nota en lo naturalmente que maneja agentes cuyo trabajo central es extraer de documentos y datos estructurados y no una conversación abierta.
El framework de orquestación sigue siendo gratuito y abierto sin importar lo que haga después. LlamaCloud, el producto alojado de LlamaIndex Inc, gestiona el análisis y la indexación a tarifas basadas en uso, mantenido como un producto genuinamente separado del código de orquestación.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Eventos tipados entre los pasos del workflow, fáciles de razonar | La mayoría de los tutoriales y ejemplos aún asumen un caso de uso de RAG |
| Los mejores conectores de datos y primitivas de recuperación de su clase | Comunidad específica de multiagente más pequeña que LangGraph o CrewAI |
| Funciona de forma independiente o en capas bajo todo el stack de LlamaIndex | Las herramientas de eval para agentes generales son más limitadas que las de Google ADK |
| Python y TypeScript, licencia MIT | LlamaCloud alojado es un producto aparte basado en uso, no gratuito |
Precios: Framework de orquestación gratuito y de código abierto (MIT). LlamaCloud: Free (10,000 créditos), Starter $50/mes (40,000 créditos, pago por uso hasta 400,000), Pro $500/mes (400,000 créditos, más un bono por tiempo limitado de 800,000 créditos por un pago único de $1,000), Enterprise personalizado con descuentos por volumen. Tarifa de créditos: 1,000 créditos equivalen a $1.25. Fuente: llamaindex.ai/pricing.
Ideal para: equipos cuyo agente tiene como trabajo central la recuperación sobre documentos o datos estructurados, no la conversación de propósito general.
12. Agno: el runtime orientado al rendimiento para flotas de agentes
Agno, renombrado desde Phidata en enero de 2025, se posiciona menos como una biblioteca y más como un sistema operativo agéntico, construido en torno a las abstracciones Agents, Teams y Workflows más un runtime llamado AgentOS que es dueño del estado durable y lo expone por HTTP. La propuesta es la velocidad: los propios benchmarks publicados por Agno afirman una instanciación de agentes unas 5,000 veces más rápida y unas 50 veces menos memoria que LangGraph, una afirmación del proveedor que conviene contrastar con su propia carga de trabajo antes de confiar en ella, no una cifra verificada de forma independiente.
El precio de AgentOS se hizo público en 2026, pasando de un costo de plano de control no listado a un nivel de autoservicio real, lo cual importa si usted evaluó Agno a principios de año basándose en la suposición de "solo enterprise".
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Runtime genuinamente ligero, útil para flotas de agentes de alta concurrencia | Las afirmaciones de rendimiento las publica el proveedor; verifique con su propia carga de trabajo |
| Soporte multimodal y almacenamiento de sesiones integrados | Comunidad más pequeña y menos tutoriales de terceros que los principales frameworks |
| AgentOS Pro ahora tiene precios publicados de autoservicio | Solo Python, sin vía en TypeScript |
| Apache 2.0, framework principal totalmente permisivo | Sin conjunto de evals dedicado; AgentOS cubre el monitoreo, no las pruebas de escenarios |
Precios: Framework principal gratuito y de código abierto (Apache 2.0). AgentOS Control Plane: Free (plano de control local, soporte de la comunidad), Pro $150/mes (plano de control en vivo con una conexión, 4 usuarios incluidos, monitoreo, retención, conocimiento y chats ilimitados, usuarios adicionales $30/mes cada uno, conexiones adicionales $95/mes cada una), Enterprise personalizado (canal dedicado de Slack, líder técnico, SLA de soporte, SSO/RBAC personalizados, opción de plano de control autoalojado). Fuente: agno.com/pricing.
Ideal para: equipos que ejecutan grandes cantidades de agentes ligeros y concurrentes donde la sobrecarga de instanciación es un cuello de botella medido, no solo sospechado.
13. Atomic Agents: el núcleo más pequeño y auditable
Atomic Agents organiza todo en torno a la atomicidad: componentes pequeños, de un solo propósito, componibles y predecibles, evitando deliberadamente la sensación de "caja negra autónoma" de los frameworks más grandes. Se parece más a ensamblar bloques bien etiquetados que a adoptar un runtime opinado, y está construido sobre Instructor y Pydantic, de modo que la seguridad de tipos recorre todo el framework por diseño y no como un añadido sobre un núcleo más laxo.
No hay plataforma alojada de ningún tipo, ni producto de evals, ni nivel enterprise. Que eso sea una limitación o todo el sentido depende de cuánto quiera usted que el plano de control de un proveedor se asiente dentro de su stack. El proyecto sigue genuinamente activo: la versión 2.0 se lanzó con una guía de migración, el repositorio tiene 989 commits en su rama principal y mantiene su propio Discord y subreddit.
| Lo que obtiene | Lo que no obtiene |
|---|---|
| Seguridad de tipos basada en Pydantic en cada entrada y salida, sin excepciones | Sin plataforma alojada de ningún tipo, solo autoalojamiento |
| Lo bastante pequeño para leer todo el bucle del agente en una tarde | Sin producto de evals dedicado; pytest estándar es la vía documentada |
| Funciona con OpenAI, Anthropic, Gemini, Cohere y más mediante Instructor | Sin durabilidad ni checkpointing integrados, usted conecta la persistencia |
| Licencia MIT, mantenido activamente (v2.0, 989 commits, comunidad viva) | Ecosistema más pequeño que cualquier framework de Python más arriba en esta lista |
Precios: Gratuito y totalmente de código abierto (MIT), sin producto alojado, sin nivel de pago, sin brazo comercial. El costo es solo el uso de la API del modelo al que lo conecte. Fuente: github.com/BrainBlend-AI/atomic-agents.
Ideal para: equipos que quieren leer y entender cada línea del bucle de su agente y no quieren el plano de control alojado de un proveedor en ninguna parte del stack.
Cómo elegir: marco de decisión
Empiece por el lenguaje y el compromiso con un modelo, y luego pruebe la seguridad de tipos, la durabilidad, los evals, el streaming, la recuperación de datos y las necesidades de despliegue.

| Si necesita... | Elija... | Por qué |
|---|---|---|
| El máximo control sobre un estado ramificado que debe sobrevivir a un reinicio | LangGraph | Checkpointing nativo, pausa, reanudación, depuración con viaje en el tiempo |
| El SDK más ligero de un proveedor de modelos frontera | OpenAI Agents SDK | Primitivas mínimas, búsqueda web, intérprete de código y búsqueda de archivos nativos |
| El bucle de agente de Claude Code, probado en producción, como biblioteca | Claude Agent SDK | Hooks, subagentes, sesiones, el mismo harness que ejecuta Claude Code |
| La cobertura de lenguajes más amplia con evals integrados reales | Google ADK | Cinco lenguajes, más herramientas de Criteria, Simulation y Custom Metrics |
| Seguridad de tipos respaldada por el compilador para un entorno .NET o Azure | Microsoft Agent Framework | Sucesor unificado actual de AutoGen y Semantic Kernel |
| Tracing y evals por defecto, genuinamente agnóstico al modelo | AWS Strands | Tracing por defecto, Strands Evals, funciona con cualquier proveedor |
| Streaming de la salida del agente con tipos seguros directo a una UI web | Vercel AI SDK | InferAgentUIMessage lleva los tipos del agente a la interfaz |
| Agentes, workflows, memoria y evals en un solo framework de TypeScript | Mastra | No tres productos de proveedores añadidos, sino un conjunto coherente de primitivas |
| El camino más rápido a un prototipo multiagente | CrewAI | API basada en roles, legible sin experiencia profunda en el framework |
| Salidas de agente que fallen una verificación de tipos en lugar de fallar en producción | Pydantic AI | Salidas estructuradas y validadas por construcción |
| Agentes con fuerte recuperación de datos construidos en torno a documentos y datos | LlamaIndex Workflows | La mayor trayectoria en RAG y conectores de datos de esta lista |
| Miles de agentes ligeros y concurrentes | Agno | Diseñado a propósito para una baja sobrecarga de instanciación, verifique las afirmaciones usted mismo |
| El núcleo más pequeño y auditable sin dependencia de un proveedor | Atomic Agents | Tipado con Pydantic, mínimo, sin plataforma alojada de la que depender |
Qué hacer a continuación
No evalúe los 13 a la vez. Elija los dos que encajen con su lenguaje y su compromiso con un modelo (LangGraph más el SDK propio de su proveedor de modelos es una pareja inicial común) y construya el mismo agente pequeño en ambos: una llamada a una herramienta, un traspaso de varios pasos y una caída deliberada a mitad de tarea. El framework cuya propuesta de durabilidad resista cuando usted mate el proceso es el que debe elegir para construir. Si su equipo prefiere no escribir el código de orquestación en absoluto, nuestro resumen de mejores plataformas de agentes de IA cubre alternativas gestionadas y no-code, y cómo construir un agente de IA recorre los pasos subyacentes sin importar en qué SDK termine.

On this page
- Cómo evaluamos: 8 factores que realmente separan estos SDK
- Datos Clave
- Tabla comparativa rápida
- Lenguaje, seguridad de tipos y portabilidad de modelos
- Streaming, durabilidad y evals integrados
- 1. LangGraph: el control más profundo sobre el estado y la durabilidad
- 2. OpenAI Agents SDK: el SDK más ligero de un proveedor de modelos frontera
- 3. Claude Agent SDK: el propio bucle de agente de Claude Code como biblioteca
- 4. Google ADK: el soporte de lenguajes más amplio y los evals integrados más profundos
- 5. Microsoft Agent Framework: seguridad de tipos respaldada por el compilador para .NET y Azure
- 6. AWS Strands: tracing y evals activados por defecto
- 7. Vercel AI SDK: streaming con tipos seguros del modelo a la UI
- 8. Mastra: agentes, workflows y evals como un solo conjunto de primitivas de TypeScript
- 9. CrewAI: la demo multiagente funcional más rápida
- 10. Pydantic AI: salidas validadas por construcción
- 11. LlamaIndex Workflows: agentes tipados y basados en eventos para trabajo con fuerte recuperación de datos
- 12. Agno: el runtime orientado al rendimiento para flotas de agentes
- 13. Atomic Agents: el núcleo más pequeño y auditable
- Cómo elegir: marco de decisión
- Qué hacer a continuación