Melhores frameworks de AI agents para desenvolvedores em 2026: 13 SDKs classificados por experiência do desenvolvedor

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
Atualizado em agosto de 2026. Se você é um engenheiro escolhendo um SDK para escrever código, e não um time de negócios configurando um canvas, comece pelo LangGraph se o agente precisa sobreviver a uma queda no meio da tarefa, pelo OpenAI Agents SDK ou pelo Claude Agent SDK se você já padronizou em um único fornecedor de modelo, ou pelo Google ADK se o seu time abrange mais de uma linguagem. Este guia classifica 13 frameworks e SDKs orientados a código, open source e comerciais, puramente por experiência do desenvolvedor: quanto boilerplate eles exigem antes de o primeiro agente rodar, se uma chamada de ferramenta malformada falha no CI ou em produção, como fazem streaming, se um agente sobrevive a um reinício, se dá para trocar o modelo subjacente, como você faz a implantação e qual a qualidade real da documentação. Todo preço abaixo vem da página de preços do próprio fornecedor, consultada em agosto de 2026.
Este é um recorte diferente do nosso guia de melhores frameworks open source de AI agents, que classifica 15 frameworks por termos de licença e adequação ao auto-hospedado. Este aqui abandona essa lente e faz uma pergunta mais estreita: qual SDK é realmente o melhor para escrever código, seja ele licenciado sob MIT ou vendido sob os termos comerciais de um fornecedor. É por isso que o OpenAI Agents SDK, o Claude Agent SDK, o Google ADK e o Microsoft Agent Framework aparecem aqui ao lado de LangGraph e CrewAI, algo que um levantamento puramente open source não consegue fazer. Uma observação de escopo antes de continuar: um framework de agentes, neste guia, planeja uma sequência de etapas e chama ferramentas para executá-las. Ele não é uma ferramenta de IA para programação que autocompleta uma linha enquanto um humano conduz cada tecla, e não é um construtor no-code de AI agents que um time de negócios configura em um canvas visual. Ainda em dúvida entre escrever código e arrastar nós? Leia primeiro no-code vs código em AI agents.
Como avaliamos: 8 critérios que realmente separam estes SDKs
Uma lista de recursos não diz muito quando todo framework afirma suportar ferramentas e memória. Estas oito perguntas preveem se um framework realmente se encaixa no seu time, e são a lente por trás de cada seção abaixo.
| Dimensão | A pergunta real |
|---|---|
| Experiência do desenvolvedor | Quanto boilerplate antes de o primeiro agente rodar, e quão legível é o código seis meses depois |
| Type safety | Uma chamada de ferramenta malformada falha em uma checagem de tipos no CI ou vira um incidente em produção |
| Streaming e async | Dá para fazer streaming de tokens e eventos de ferramentas para uma UI ou um log em tempo real |
| Evals e testes embutidos | O framework traz uma forma de testar um agente contra cenários, ou você mesmo constrói uma |
| Durabilidade e capacidade de retomada | Um agente sobrevive a um reinício do processo no meio da tarefa, ou recomeça do zero |
| Portabilidade de modelo | Dá para trocar o modelo subjacente sem reescrever o agente |
| Modelo de implantação | Local, serverless, auto-hospedado ou gerenciado, e quanto cada opção realmente custa |
| Qualidade da documentação | Documentação oficial, guias de migração e se o projeto é mantido ativamente ou está em modo de manutenção sem alarde |
A durabilidade é o critério que os engenheiros subestimam até o primeiro incidente em produção. Para os padrões subjacentes além da implementação de qualquer framework específico, veja memória de AI agents. Os evals são pulados pelo mesmo motivo: ficam invisíveis até um agente falhar na frente de um cliente, e o que está em jogo só aumenta. Os agentes saltaram de cerca de 12% para 66,3% de sucesso em tarefas no OSWorld, o benchmark de tarefas reais de uso de computador, no ano que antecedeu 2026, segundo o AI Index da Stanford HAI, o que torna um agente que falha em silêncio em vez de se recuperar um erro mais caro do que costumava ser. Observabilidade de AI agents cobre o que instrumentar, independentemente de qual SDK abaixo já traga isso de fábrica.
Fatos Principais
- Mais de 1,1 milhão de repositórios públicos do GitHub já importam um SDK de LLM, alta de 178% ano a ano, com 693.867 deles criados apenas nos últimos 12 meses, segundo o relatório Octoverse do GitHub.
- 57,3% das organizações relatam ter AI agents em produção, segundo a pesquisa State of Agent Engineering da LangChain, com 1.340 profissionais (de 18 de novembro a 2 de dezembro de 2025), mas só 52,4% dos respondentes rodam avaliações offline em conjuntos de teste, exatamente a lacuna que o ferramental de evals embutido de um framework existe para fechar.
- As empresas que compram IA pronta em vez de construir a própria subiram de 53% em 2024 para 76% em 2025, segundo o State of Generative AI in the Enterprise, da Menlo Ventures, o pano de fundo que explica por que o SDK de um fornecedor comercial hoje pertence à mesma shortlist que um framework open source.
- A fatia dos modelos open source no uso enterprise de LLMs caiu para 11% em 2025, ante 19% em 2024, mesmo com o gasto total das empresas em IA generativa quase triplicando, para $37 bilhões, segundo a Menlo Ventures. Isso é escolha de modelo, não de framework, mas explica por que vários frameworks abaixo adotam por padrão um modelo de fronteira fechado, mesmo quando o código de orquestração em si é open source.
- A Gartner prevê que mais de 40% dos projetos de agentic AI serão cancelados até o fim de 2027, apontando valor de negócio pouco claro e controles de risco inadequados, os dois modos de falha que durabilidade e evals foram criados para detectar cedo.
Tabela comparativa rápida
| Ferramenta | Ideal para | Preço inicial | Principal ponto forte | Principal limitação |
|---|---|---|---|---|
| LangGraph | Agentes de longa duração que precisam sobreviver a um reinício | Gratuito (MIT); LangSmith Plus $39/usuário/mês | Checkpointing nativo, pausa, retomada, depuração com viagem no tempo | Curva de aprendizado mais íngreme desta lista |
| OpenAI Agents SDK | Times padronizados nos modelos da OpenAI | SDK gratuito; tokens de modelo a partir de $5/$30 por M (nível flagship) | Busca na web, code interpreter e busca em arquivos nativos | Amarra a sua arquitetura ao roadmap de modelos da OpenAI |
| Claude Agent SDK | Times que querem o próprio loop de agente do Claude Code como biblioteca | SDK gratuito; tokens de modelo de $1 a $5 por M de entrada | Hooks, subagentes e sessões do mesmo harness que roda o Claude Code | Não é open source; só modelos Claude |
| Google ADK | Times com várias linguagens que precisam de evals embutidos | Gratuito (Apache 2.0); tokens do Gemini a partir de $0,75/M de entrada | Suporte a mais linguagens (5) mais um framework de avaliação de verdade | Sem tarifa fixa única publicada para implantação gerenciada |
| Microsoft Agent Framework | Times de engenharia padronizados em .NET e Azure | Gratuito (MIT); uso de tokens do Azure OpenAI | Type safety garantido pelo compilador em C#, sucessor atual do AutoGen e do Semantic Kernel | SDK unificado mais novo; suporte a Go ainda em preview |
| AWS Strands | Times que querem tracing e evals ativados por padrão | Gratuito (Apache 2.0); computação AWS mais tokens de modelo | Tracing e Strands Evals embutidos, realmente agnóstico de modelo | Sem preço fixo; exige uma estimativa de uso primeiro |
| Vercel AI SDK | Times de TypeScript que fazem streaming da saída do agente para uma UI | Gratuito (Apache 2.0); tokens de modelo | Streaming com type safety direto para React e Next.js | Só TypeScript, sem Python |
| Mastra | Times de TypeScript que querem evals e workflows embutidos | Core gratuito (Apache 2.0); Cloud Teams $250/mês | Agentes, workflows, memória e evals como um único conjunto de primitivas | Só TypeScript; ecossistema menor que o dos frameworks Python |
| CrewAI | A demo multiagente funcionando mais rápido | Gratuito (MIT); Enterprise sob medida | API baseada em papéis, legível sem conhecimento profundo do framework | Durabilidade e evals mais profundos ficam atrás do AMP pago |
| Pydantic AI | Times de Python que querem saídas validadas | Gratuito (MIT); Logfire a partir de $0 | Saídas estruturadas e validadas por construção | A coreografia multiagente é menos opinativa, mais artesanal |
| LlamaIndex Workflows | Agentes orientados a eventos e com muita recuperação de dados | Gratuito (MIT); LlamaCloud a partir de $50/mês | Etapas com eventos tipados, a maior herança em retrieval daqui | A maioria dos tutoriais ainda pressupõe um caso de uso de RAG |
| Agno | Frotas de agentes com alta concorrência | Gratuito (Apache 2.0); AgentOS Pro $150/mês | Runtime leve, benchmarks de desempenho publicados | As alegações de desempenho são publicadas pelo fornecedor, verifique você mesmo |
| Atomic Agents | Times que querem o core menor e mais auditável | Gratuito (MIT); não existe nível pago | Type safety baseado em Pydantic em cada entrada e saída | Sem plataforma hospedada nem evals embutidos, você monta os dois |
Linguagem, type safety e portabilidade de modelo
O suporte a linguagens decide quem no seu time consegue sequer mexer no código. O type safety decide se uma chamada de ferramenta malformada é um erro em tempo de compilação ou um alerta às 2 da manhã.

| Framework | Linguagens | Modelo de type safety | Portabilidade de modelo |
|---|---|---|---|
| LangGraph | Python, TypeScript | Esquemas de estado tipados (TypedDict ou Pydantic em Python, objetos tipados em TS) | Qualquer provedor pelas integrações de modelo da LangChain |
| OpenAI Agents SDK | Python, TypeScript | Saídas estruturadas com Pydantic (Python); interfaces tipadas (TS) | Nativo da OpenAI; 100+ provedores pela extensão oficial LiteLLM (best-effort) |
| Claude Agent SDK | Python, TypeScript | Interfaces tipadas, esquemas de ferramentas estruturados | Só modelos Claude |
| Google ADK | Python, Java, Kotlin, Go, TypeScript | Tipagem estática em quatro das cinco linguagens | Otimizado para o Gemini, explicitamente agnóstico de modelo |
| Microsoft Agent Framework | Python, .NET (C#), Go (preview) | Garantido pelo compilador em C#; type hints em Python | Microsoft Foundry, Azure OpenAI, OpenAI, Anthropic, Ollama e mais |
| AWS Strands | Python, TypeScript | Interfaces tipadas em todo o framework | Integração nativa com Bedrock/AgentCore; Anthropic, OpenAI, Gemini e mais |
| Vercel AI SDK | Só TypeScript | Inferência de tipos de ponta a ponta até a UI por InferAgentUIMessage |
Qualquer provedor com um adaptador do SDK |
| Mastra | Só TypeScript | TypeScript nativo de ponta a ponta, sem design portado do Python | Qualquer provedor |
| CrewAI | Só Python | Tipagem padrão do Python | Qualquer provedor pelo LiteLLM |
| Pydantic AI | Só Python | Saídas validadas por construção, a melhor história de type safety em Python puro daqui | Qualquer provedor, agnóstico de modelo por concepção |
| LlamaIndex Workflows | Python, TypeScript | Eventos tipados passados entre as etapas do workflow | Qualquer provedor |
| Agno | Só Python | Tipagem padrão do Python | Qualquer provedor |
| Atomic Agents | Só Python | Esquemas Pydantic em cada entrada e saída, construído sobre o Instructor | Qualquer provedor que o Instructor suporte, além de Ollama e LMStudio localmente |
Streaming, durabilidade e evals embutidos
Esta é a tabela que vale ler duas vezes. O streaming é requisito básico hoje, todo framework daqui o tem. Durabilidade e evals são onde as lacunas reais aparecem, e onde a página de marketing de um framework costuma dizer menos do que a documentação.
| Framework | Streaming | Durabilidade / capacidade de retomada | Ferramental de eval ou teste embutido |
|---|---|---|---|
| LangGraph | Sim | Checkpointing nativo, pausa, retomada, depuração com viagem no tempo | Via LangSmith, um produto pago à parte |
| OpenAI Agents SDK | Sim | A Sessions API cobre o histórico básico; estado durável entre reinícios fica por sua conta | Nenhum embutido |
| Claude Agent SDK | Sim | Sessões retomam ou se bifurcam; os Subagents delimitam o contexto em tarefas longas | Nenhum embutido |
| Google ADK | Sim, incluindo streaming bidirecional Live e Voice | Estado do workflow gerenciado pelo Agent Runtime | Criteria, User Simulation, Environment Simulation, Custom Metrics, Optimization |
| Microsoft Agent Framework | Sim | Estado baseado em sessão; o Harness Agent acrescenta compactação de contexto para tarefas longas | Serviços de avaliação listados como categoria de integração de primeira classe |
| AWS Strands | Sim | Rastreado por padrão; um sistema de hooks dispara a cada chamada de ferramenta | Strands Evals: defina casos, escolha avaliadores, rode experimentos antes de lançar |
| Vercel AI SDK | Sim, sua razão original de existir | DurableAgent pelo Workflow DevKit complementar (um add-on, não o core) |
Nenhum embutido |
| Mastra | Sim | Suspensão e retomada de workflow nativas | Evals são uma primitiva de primeira classe do framework, não um add-on |
| CrewAI | Sim | O estado do Flow persiste localmente; durabilidade mais profunda fica atrás do AMP pago | Observabilidade e evals ficam atrás do AMP, não no core open source |
| Pydantic AI | Sim | Você mesmo persiste os objetos de histórico de mensagens | Via Logfire, um produto pago à parte |
| LlamaIndex Workflows | Sim | O contexto do workflow pode ser serializado e retomado entre etapas | Ferramental de eval de retrieval herdado da sua origem em RAG |
| Agno | Sim | Armazenamento de sessão e estado embutido, projetado para concorrência | Monitoramento pelo AgentOS; sem suíte de evals dedicada |
| Atomic Agents | Sim | Nenhuma embutida, você mesmo conecta a persistência | pytest padrão; sem produto de eval dedicado |
1. LangGraph: o controle mais profundo sobre estado e durabilidade
O LangGraph modela um agente como um grafo de nós e arestas, em vez de um único loop de prompt, e é isso que faz de pausa, retomada e depuração com viagem no tempo primitivas nativas, e não algo acoplado depois. Esse modelo de checkpointing é a razão de ser o framework a que os times recorrem quando o modo de falha de um agente é "perdeu todo o progresso", e não apenas "deu uma resposta errada". Funciona de forma independente ou dentro do ecossistema LangChain mais amplo, tanto em Python quanto em TypeScript. Para um passo a passo prático dos padrões principais, veja como criar um AI agent com o LangGraph.
A contrapartida é o próprio modelo mental de grafo. Leva mais tempo para aprender do que uma equipe baseada em papéis, e a camada de observabilidade mais profunda, o LangSmith, é gratuita para um usuário, mas cobrada por usuário além disso.
| O que você leva | O que você não leva |
|---|---|
| Checkpointing nativo, pausa, retomada, depuração com viagem no tempo | Curva de aprendizado mais íngreme de qualquer framework daqui |
| Aprovação com human in the loop como primitiva de primeira classe | A observabilidade completa (LangSmith) é paga além de um usuário gratuito |
| Funciona com qualquer provedor de modelo pelas integrações da LangChain | Mais boilerplate do que o CrewAI para um único agente simples |
| Suporte a Python e TypeScript | O ferramental de implantação (LangGraph Platform) é uma camada paga separada |
Preço: Framework gratuito e open source (MIT). LangSmith/LangGraph Platform: Developer $0/usuário (5.000 traces gratuitos/mês, depois pay-as-you-go, máximo de 1 usuário), Plus $39/usuário/mês (10.000 traces gratuitos/mês, 1 implantação pequena gratuita incluída), Enterprise sob medida com opções auto-hospedadas e híbridas. Excedente: $1,50 por unidade de computação (LCU), $1,00 por unidade de armazenamento (LSU). Fonte: langchain.com/pricing.
Ideal para: times de engenharia que precisam que um agente pause, retome e recupere o estado sem perder o progresso, e não apenas gere uma boa resposta.
2. OpenAI Agents SDK: o SDK mais leve de um fornecedor de modelos de fronteira
A vantagem do OpenAI Agents SDK é a proximidade: ele foi criado pela mesma empresa que treina os modelos que executa, então busca na web, code interpreter e busca em arquivos são recursos nativos medidos, e não algo que você conecta por um terceiro. O conjunto de primitivas (Agents, Handoffs, Guardrails, Sessions) é deliberadamente pequeno, um dos frameworks mais rápidos daqui para aprender de ponta a ponta.
Apesar da marca, ele não está preso por definição aos modelos da OpenAI. Uma extensão oficial do LiteLLM dá acesso a mais de 100 provedores, incluindo Anthropic e Gemini, com o mesmo código de agente, embora esse suporte seja oficialmente best-effort, e não um contrato garantido.
| O que você leva | O que você não leva |
|---|---|
| Ferramentas nativas de busca na web, code interpreter e busca em arquivos | Os custos crescem direto com o uso de tokens, fáceis de subestimar |
| Conjunto mínimo de primitivas, rápido de aprender de ponta a ponta | Estado durável entre reinícios fica por sua conta; a Sessions API cobre só o histórico |
| Suporte multiprovedor de verdade pela extensão oficial LiteLLM | O suporte a provedores via LiteLLM é oficialmente best-effort, não core |
| Python e TypeScript, licença MIT | Nenhum ferramental de eval dedicado vem com o próprio SDK |
Preço: SDK gratuito e open source (MIT). O custo é o uso do modelo. O nível flagship (por exemplo, gpt-5.6-sol ou gpt-5.5) custa $5,00 por milhão de tokens de entrada e $30,00 por milhão de tokens de saída; um nível intermediário como gpt-5.6-terra custa $2,00 de entrada / $12,00 de saída, e um nível econômico como gpt-5.6-luna custa $0,20 de entrada / $1,20 de saída. As ferramentas embutidas são cobradas à parte: busca na web $10 por 1.000 chamadas mais tokens de conteúdo às tarifas do modelo, code interpreter de $0,03 a $1,92 por sessão de 20 minutos, conforme a memória do contêiner (1GB a 64GB), busca em arquivos $0,10 por GB por dia de armazenamento (1GB grátis) mais $2,50 por 1.000 chamadas de ferramenta. Fonte: developers.openai.com/api/docs/pricing.
Ideal para: times padronizados nos modelos da OpenAI que querem a menor pegada de dependências, com busca na web, code interpreter e busca em arquivos nativos, sem montá-los separadamente.
3. Claude Agent SDK: o próprio loop de agente do Claude Code como biblioteca
O Claude Agent SDK, renomeado a partir do Claude Code SDK no fim de 2025, entrega o mesmo loop de execução de ferramentas, a mesma gestão de contexto e as mesmas ferramentas embutidas (edição de arquivos, bash, busca na web, web fetch) que movem o próprio Claude Code, programáveis em Python e TypeScript. É um ponto de partida significativamente diferente de uma abstração de nível de pesquisa: o que você recebe é um harness que já rodou milhões de sessões reais de programação e de agentes, e não um design novo.
Três recursos se destacam no uso em produção. Os hooks executam código sob medida em pontos do ciclo de vida. Os subagentes criam agentes filhos especializados, com contexto próprio, a forma mais limpa desta lista de impedir que a janela de contexto de uma tarefa longa incha. As sessões mantêm o contexto entre trocas e podem ser retomadas ou bifurcadas depois. O que ele não tem é uma licença open source aprovada pela OSI: o uso segue os Commercial Terms of Service da Anthropic, uma diferença real em relação a todo framework MIT ou Apache 2.0 daqui, que vale ler antes de construir um produto revendido sobre ele.
| O que você leva | O que você não leva |
|---|---|
| O mesmo loop de agente e as mesmas ferramentas testados em produção que movem o Claude Code | Não é open source; regido por termos comerciais, não MIT nem Apache 2.0 |
| Hooks, Subagents e Sessions para controle do ciclo de vida e isolamento de contexto | Só modelos Claude, sem portabilidade multifornecedor |
| Suporte a cliente MCP e ferramentas embutidas de arquivos, bash e web prontas para uso | Nenhum framework de eval dedicado; você traz o seu |
| Python e TypeScript, sustentado pelo time que constrói os modelos | Desenvolvedores terceiros não podem oferecer login do claude.ai nem seus limites de taxa dentro de um produto construído sobre o SDK |
Preço: Sem taxa de licença separada para o SDK, mas o uso segue os Commercial Terms of Service da Anthropic, e não uma licença open source. O custo é o uso de tokens da API do Claude: o Claude Sonnet 5 custa $2 por milhão de tokens de entrada e $10 por milhão de tokens de saída (o preço promocional virou a tarifa padrão), o Claude Opus 5 custa $5 de entrada / $25 de saída, o Claude Haiku 4.5 custa $1 de entrada / $5 de saída. O prompt caching reduz um acerto de cache a cerca de 10% do preço-base de entrada. Busca na web (ferramenta de servidor): $10 por 1.000 buscas. Execução de código: 1.550 horas gratuitas por organização por mês, depois $0,05 por hora por contêiner. Fonte: platform.claude.com/docs (pricing) e code.claude.com/docs (SDK overview).
Ideal para: times que querem o loop de agente, os hooks e o modelo de subagentes do Claude Code, testados em produção, como biblioteca, em vez de montar um equivalente do zero.
4. Google ADK: o maior suporte a linguagens e os evals embutidos mais profundos
O Agent Development Kit do Google aplica a disciplina da engenharia de software comum à construção de agentes, orientado a código na própria definição, e a sustenta com a cobertura de linguagens mais ampla desta lista: Python, Java, Kotlin, Go e TypeScript, todas sob Apache 2.0. Uma opção Agent Config no-code e uma UI de desenvolvimento embutida convivem com o caminho orientado a código, então um time misto não precisa que todos escrevam na mesma linguagem.
O diferencial do ADK entre estes 13 é a história de avaliação: um framework embutido de verdade, com Criteria, User Simulation, Environment Simulation, Custom Metrics e um componente de Optimization, mais próximo de uma suíte de testes real do que do "traga o seu ferramental de eval" que a maioria dos frameworks exige. O streaming também vai além, com agentes Live e Voice bidirecionais de verdade pela Gemini Live API, e não apenas texto token a token. Se você prefere comprar uma suíte gerenciada a escrever código sobre um SDK, melhores plataformas enterprise de AI agents cobre essa alternativa.
| O que você leva | O que você não leva |
|---|---|
| Cinco linguagens suportadas, o maior número entre os frameworks daqui | O preço da implantação pelo Agent Runtime não é uma tarifa fixa única publicada |
| Um framework de avaliação embutido de verdade, não um acessório | Mais bem documentado e mais testado em campo em Python; as outras linguagens ficam atrás |
| Streaming bidirecional Live e Voice pela Gemini Live API | Otimizado para o Gemini, então implantações fora do Google dão mais trabalho de integração |
| Caminhos de implantação em Cloud Run, GKE ou Agent Runtime gerenciado | SDKs multilinguagem mais novos (Go, Kotlin) do que a versão Python principal |
Preço: Framework gratuito (Apache 2.0). Rodá-lo custa tokens da API do Gemini mais a computação em que você fizer a implantação. Gemini 3.7 Flash: nível gratuito disponível; nível pago a $0,75 por milhão de tokens de entrada e $3,75 por milhão de tokens de saída até 31 de dezembro de 2026, subindo para $1,50 de entrada / $7,50 de saída em 1º de janeiro de 2027. A implantação gerenciada pelo Agent Runtime da Gemini Enterprise Agent Platform é baseada em consumo; o Google não divulgou uma tarifa fixa única publicada na hora da redação, então reserve no orçamento uma estimativa de uso do Vertex AI, e não um preço de tabela, a mesma ressalva honesta que vale para o AWS Bedrock AgentCore. Fonte: github.com/google/adk-python, adk.dev, ai.google.dev/gemini-api/docs/pricing.
Ideal para: times de engenharia com várias linguagens que querem o ferramental de avaliação embutido mais completo de todos os frameworks desta lista.
5. Microsoft Agent Framework: type safety garantido pelo compilador para .NET e Azure
O Microsoft Agent Framework, em disponibilidade geral desde 3 de abril de 2026, é o sucessor direto do AutoGen e do Semantic Kernel, criado pelos mesmos times por trás de cada um. Ele combina as abstrações simples de agente único e multiagente do AutoGen com os recursos enterprise do Semantic Kernel, gestão de estado baseada em sessão, type safety, middleware e telemetria, e acrescenta Workflows baseados em grafo para caminhos de execução multiagente explícitos que nenhum dos dois antecessores tinha sozinho.
A história de type safety é realmente diferenciada para um time de C#: o compilador sustenta a promessa de um jeito que uma linguagem de tipagem dinâmica não consegue. O framework também traz um "Harness Agent", um agente completo, com tudo incluído, para tarefas longas em várias etapas, com planejamento, compactação de contexto, acesso a arquivos e memória, aprovação de ferramentas e observabilidade embutidos, uma combinação de durabilidade e evals que poucos frameworks daqui oferecem em um único pacote. O suporte hoje abrange Python, .NET e um SDK Go em public preview e, apesar do nome, conecta-se a Microsoft Foundry, Anthropic, Azure OpenAI, OpenAI e Ollama, e não apenas aos modelos da própria Microsoft.
| O que você leva | O que você não leva |
|---|---|
| Type safety garantido pelo compilador em C#, estado de sessão, middleware e telemetria | O suporte a Go é public preview; agentes declarativos e RAG ainda não existem |
| Um SDK unificado em vez de escolher entre AutoGen e Semantic Kernel | Produto unificado mais novo, ainda com arestas em relação aos originais maduros |
| O "Harness Agent" reúne planejamento, memória e aprovação de ferramentas de fábrica | Ecossistema e tutoriais da comunidade ainda alcançando o antigo AutoGen |
| Suporte multifornecedor de modelos (Foundry, Azure OpenAI, OpenAI, Anthropic, Ollama) | O melhor encaixe se estreita fora de um stack padronizado em Microsoft |
Preço: Gratuito e open source (MIT), sem taxa de licença. O custo é o uso da API de modelo a que você o conecta, normalmente o preço de tokens do Azure OpenAI Service. Fonte: learn.microsoft.com/en-us/agent-framework.
Ideal para: times de engenharia padronizados em .NET e Azure que querem type safety garantido pelo compilador e um sucessor atual e em desenvolvimento ativo do AutoGen e do Semantic Kernel, em vez de qualquer um dos projetos legados.
6. AWS Strands: tracing e evals ativados por padrão
O Strands é a aposta da própria AWS sobre como um SDK de agentes de produção deveria ser, construído a partir dos padrões que a AWS já executa dentro do Amazon Q Developer, do AWS Glue e do VPC Reachability Analyzer. Chegou à versão 1.0 em 21 de maio de 2026, o release que o levou de "bom para um único agente" a uma orquestração multiagente realmente pronta para produção, com padrões de agent-as-tool e swarm, além de suporte a MCP embutido.
O que diferencia o Strands aqui é que observabilidade e evals não são um adendo: cada decisão do agente recebe por padrão um atributo de trace, e não atrás de uma flag opcional, e um sistema de hooks (BeforeToolCallEvent, AfterToolCallEvent) permite interceptar o loop em qualquer ponto. O Strands Evals permite que um time defina casos de teste, escolha avaliadores e rode experimentos antes de lançar, uma resposta embutida de verdade, e não um produto pago à parte. Ele também é agnóstico de modelo por concepção: integração nativa com Bedrock e AgentCore, mas Anthropic, OpenAI, Gemini e outros funcionam sem reescrita. O pacote Python strands-agents somou 16,7 milhões de downloads por mês em junho de 2026.
| O que você leva | O que você não leva |
|---|---|
| Tracing ativado por padrão e um sistema de hooks em cada chamada de ferramenta | Framework mais novo que LangGraph ou CrewAI, com histórico de comunidade menor |
| Strands Evals: defina casos, escolha avaliadores, rode experimentos antes de lançar | A integração nativa mais profunda é com a AWS; outras nuvens exigem mais configuração |
| Realmente agnóstico de modelo: Bedrock, Anthropic, OpenAI, Gemini e mais | Sem hospedagem gerenciada pelo próprio Strands; você escolhe o destino de computação na AWS |
| Implantação em AgentCore, Lambda, Fargate, EKS, Docker ou Terraform | Os padrões multiagente de swarm são mais novos que o modelo de grafo do LangGraph |
Preço: Framework gratuito (Apache 2.0). Rodá-lo custa o destino de computação em que você fizer a implantação (Lambda, Fargate, EKS ou o preço baseado em consumo do próprio Bedrock AgentCore) mais os custos de tokens do provedor de modelo. Fonte: strandsagents.com, github.com/strands-agents.
Ideal para: times que querem tracing e evals ativados por padrão, e não acoplados depois, e querem trocar de provedor de modelo sem reescrever o código do agente.
7. Vercel AI SDK: streaming com type safety do modelo até a UI
O Vercel AI SDK é o framework que a maioria dos times de JavaScript full-stack já tem instalado para outra finalidade, fazer streaming de chat completions para um app Next.js ou React, então acrescentar um agente é um passo incremental, e não uma nova dependência. A interface Agent do AI SDK 6, implementada pelo ToolLoopAgent, codifica o padrão que a maioria dos times montava na mão com generateText e um contador de passos: chamar o modelo, executar as chamadas de ferramenta, anexar os resultados, repetir, até 20 passos por padrão via stopWhen: stepCountIs(20). Os hooks stopWhen e prepareStep dão controle fino sobre quando o loop termina e que contexto cada passo enxerga, e uma flag needsApproval adiciona aprovação com human in the loop a ferramentas individuais.

Onde ele realmente lidera esta lista é no type safety que chega até a interface: os tipos fluem automaticamente da definição do agente até os componentes de UI por InferAgentUIMessage, então uma mudança no formato de retorno de uma ferramenta é um erro de compilação no frontend, e não uma surpresa em tempo de execução. A durabilidade é uma história mais nova aqui: o DurableAgent, do Workflow DevKit complementar, transforma um agente em um workflow retomável em que cada execução de ferramenta vira uma etapa observável e com nova tentativa, embora seja um add-on e não parte do core do SDK.
| O que você leva | O que você não leva |
|---|---|
| Streaming com type safety direto para Next.js, React, Svelte ou Vue | Só TypeScript, sem Python, um limite real se algum ferramental de ML vive lá |
O ToolLoopAgent codifica o loop agêntico em vez de código maxSteps montado na mão |
Nenhum ferramental de eval no core do SDK |
needsApproval para controle com human in the loop em ferramentas individuais |
Workflows duráveis e retomáveis exigem o add-on separado Workflow DevKit |
| Funciona com qualquer provedor de modelo para o qual o SDK tenha um adaptador | Abstração Agent mais nova que o modelo de grafo do LangGraph |
Preço: Gratuito e open source (Apache 2.0). O custo é o uso da API de modelo para a qual você o aponta. Fonte: github.com/vercel/ai, vercel.com/blog/ai-sdk-6.
Ideal para: times de TypeScript que constroem um produto voltado ao usuário, em que a saída do agente precisa fazer streaming direto para uma interface web com type safety completo.
8. Mastra: agentes, workflows e evals como um único conjunto de primitivas em TypeScript
O Mastra foi construído com a API em primeiro lugar para TypeScript, e não portado de um design em Python, o que se nota em como ele se encaixa naturalmente em um serviço Next.js ou Node existente, sem exigir um microsserviço Python separado só para rodar agentes. O que o separa da maior parte desta lista é a amplitude em um único pacote: agentes, workflows, retrieval, evals e memória são primitivas de primeira classe no mesmo framework, e não a camada de orquestração mais três produtos de fornecedores acoplados depois, como a maioria dos frameworks acaba sendo.
A durabilidade também é nativa, com suspensão e retomada de workflow mais armazenamento de memória plugável, e não algo que você constrói por conta própria. O framework core continua Apache 2.0; um diretório ee/ separado traz uma licença comercial necessária só em produção para recursos enterprise específicos, uma estrutura open-core, e não totalmente fechada.
| O que você leva | O que você não leva |
|---|---|
| Agentes, workflows, memória e evals como um conjunto coerente de primitivas | Só TypeScript, sem Python |
| Suspensão e retomada de workflow nativas, não acopladas depois | Ecossistema de plugins menor que o das integrações da LangChain |
| Design em TypeScript com API em primeiro lugar, que se encaixa em um serviço Next.js ou Node existente | Licença open-core: o diretório ee/ exige uma licença paga em produção |
| Documentação ativa e cadência de releases rápida | Mais novo que os incumbentes Python-first, com menos casos reais de produção |
Preço: Framework auto-hospedado gratuito (core Apache 2.0). Mastra Cloud: Starter gratuito (100.000 eventos de observabilidade, 24 horas de CPU, retenção de 15 dias, depois $10 por 100.000 eventos e $0,35 por hora de CPU), Teams $250/mês (1.000.000 de eventos, 250 horas de CPU, retenção de 6 meses, depois $8 por 100.000 eventos e $0,25 por hora de CPU, mais SSO e documentação SOC 2), Enterprise sob medida com taxa anual fixa em vez de medição por trace. Fonte: mastra.ai/pricing.
Ideal para: times de TypeScript que querem evals e workflows duráveis embutidos no mesmo framework, em vez de montados a partir de três fornecedores separados.
9. CrewAI: a demo multiagente funcionando mais rápido
O CrewAI define agentes por papel, objetivo e backstory, agrupa-os em uma equipe (crew) e os executa de forma sequencial ou hierárquica sobre um conjunto de tarefas. Essa estrutura, mais um grande ecossistema de tutoriais e cursos, é a razão de ele costumar ser o caminho mais rápido do zero até uma demo multiagente funcionando entre tudo o que há nesta lista. Os Flows acrescentam uma camada de controle mais determinística e orientada a código, para times que superam as crews puramente autônomas. Para uma configuração prática, veja como criar um AI agent com o CrewAI.
A plataforma hospedada AMP, da CrewAI Inc, cuida de implantação, observabilidade e evals, e o preço foi simplificado em 2026 para um nível Basic gratuito e um nível Enterprise sob medida, depois que um plano Professional de autoatendimento foi descontinuado.
| O que você leva | O que você não leva |
|---|---|
| O caminho mais rápido até uma demo multiagente funcionando entre os frameworks daqui | Durabilidade e evals mais profundos ficam atrás do produto de nuvem pago AMP |
| Tanto crews autônomas quanto Flows determinísticos no mesmo framework | Não há mais nível pago de autoatendimento, só gratuito ou Enterprise sob medida |
| Grande comunidade, cursos e templates | A abstração de interpretação de papéis pode parecer excesso para um único agente simples |
| Licença MIT, totalmente permissiva | Controle de estado menos granular que o LangGraph em ramificações complexas |
Preço: Framework open source gratuito (MIT). AMP hospedado: Basic gratuito (50 execuções de workflow por mês, editor visual, copiloto de IA, integração com GitHub), Enterprise sob medida (acrescenta SSO, RBAC, workload identity, redação de PII e um programa de onboarding de 45 dias). Fonte: crewai.com/pricing.
Ideal para: times de engenharia que querem um protótipo multiagente funcionando em uma tarde e vão decidir sobre a durabilidade em produção quando souberem o que o agente precisa suportar.
10. Pydantic AI: saídas validadas por construção
O Pydantic AI vem do time por trás do próprio Pydantic, a biblioteca de validação de que a maioria das APIs web em Python já depende, e isso se nota: as saídas do agente são estruturadas e validadas por construção, em vez de extraídas na esperança de um blob de texto, e as dependências das ferramentas são injetadas do jeito que o FastAPI injeta as dependências de requisição. Isso faz de uma chamada de ferramenta malformada um erro de tipo pego nos testes, a melhor história de type safety em Python puro de toda esta lista, e não um incidente pego em produção.
O framework em si é totalmente aberto e gratuito, sempre. O Logfire, o produto opcional de observabilidade do time, é uma camada paga separada para times que querem tracing e acompanhamento de evals além da validação que o framework já oferece de graça.
| O que você leva | O que você não leva |
|---|---|
| Saídas estruturadas e validadas por construção, e não por esperança | Ecossistema mais novo que o do LangGraph ou do CrewAI, com menos templates da comunidade |
| A injeção de dependências no estilo FastAPI facilita os testes | A coreografia multiagente é menos opinativa, você desenha mais por conta própria |
| Sustentado por um time em quem a maioria dos times Python já confia para validação | Catálogo menor de integrações prontas que o do ecossistema LangChain |
| Agnóstico de modelo, licença MIT, sempre gratuito | A observabilidade opcional do Logfire é um produto pago separado |
Preço: Framework gratuito e open source (MIT), sempre. Logfire: nível gratuito com 10 milhões de spans, logs e métricas por mês; nível Team $49/mês (5 usuários incluídos, até 12 usuários no total a $25 por usuário adicional, $2 por milhão de registros além dos 10 milhões incluídos); nível Growth $249/mês (usuários ilimitados, retenção de até 90 dias, 5.000 requisições diárias à API de consulta). Fonte: pydantic.dev/pricing.
Ideal para: times de Python que querem um erro de tipo no CI em vez de uma chamada de ferramenta malformada em produção.
11. LlamaIndex Workflows: agentes tipados e orientados a eventos para trabalho com muita recuperação de dados
O LlamaIndex Workflows modela um agente como um conjunto de etapas assíncronas que emitem e consomem eventos tipados, de modo que um agente de várias etapas se lê como uma pequena máquina de estados, e não como uma DSL de grafo dedicada. Ele nasceu diretamente da herança de conectores de dados e retrieval do LlamaIndex, o que se nota em como lida com naturalidade com agentes cujo trabalho central é buscar em documentos e dados estruturados, e não conduzir uma conversa aberta.
O framework de orquestração continua gratuito e aberto, não importa o que você faça depois. O LlamaCloud hospedado, da LlamaIndex Inc, cuida de parsing e indexação a tarifas por uso, mantido como um produto realmente separado do código de orquestração.
| O que você leva | O que você não leva |
|---|---|
| Eventos tipados entre as etapas do workflow, fáceis de raciocinar | A maioria dos tutoriais e exemplos ainda pressupõe um caso de uso de RAG |
| Conectores de dados e primitivas de retrieval de primeira linha | Comunidade específica de multiagente menor que a do LangGraph ou do CrewAI |
| Funciona de forma independente ou em camadas sob o stack completo do LlamaIndex | O ferramental de eval para agentes gerais é mais fino que o do Google ADK |
| Python e TypeScript, licença MIT | O LlamaCloud hospedado é um produto separado, baseado em uso, não gratuito |
Preço: Framework de orquestração gratuito e open source (MIT). LlamaCloud: Free (10.000 créditos), Starter $50/mês (40.000 créditos, pay-as-you-go até 400.000), Pro $500/mês (400.000 créditos, mais um bônus por tempo limitado de 800.000 créditos por $1.000 únicos), Enterprise sob medida com descontos por volume. Taxa de créditos: 1.000 créditos equivalem a $1,25. Fonte: llamaindex.ai/pricing.
Ideal para: times cujo trabalho central do agente é retrieval sobre documentos ou dados estruturados, e não conversa de uso geral.
12. Agno: o runtime com desempenho em primeiro lugar para frotas de agentes
O Agno, renomeado a partir do Phidata em janeiro de 2025, posiciona-se menos como uma biblioteca e mais como um sistema operacional agêntico, construído em torno das abstrações Agents, Teams e Workflows, mais um runtime chamado AgentOS que é dono do estado durável e o expõe por HTTP. A proposta é velocidade: os benchmarks publicados pelo próprio Agno afirmam uma instanciação de agentes cerca de 5.000 vezes mais rápida e cerca de 50 vezes menos memória do que o LangGraph, uma alegação do fornecedor que vale testar com a sua própria carga antes de confiar, e não um número verificado de forma independente.
O preço do AgentOS tornou-se público em 2026, passando de um custo de plano de controle não listado para um nível de autoatendimento de verdade, o que importa se você avaliou o Agno no início do ano partindo da premissa de que era "só enterprise".
| O que você leva | O que você não leva |
|---|---|
| Runtime realmente leve, útil para frotas de agentes com alta concorrência | As alegações de desempenho são publicadas pelo fornecedor; verifique na sua própria carga |
| Suporte multimodal e armazenamento de sessão embutidos | Comunidade menor e menos tutoriais de terceiros que os dos principais frameworks |
| O AgentOS Pro agora tem preço publicado, de autoatendimento | Só Python, sem caminho para TypeScript |
| Apache 2.0, framework core totalmente permissivo | Sem suíte de evals dedicada; o AgentOS cobre monitoramento, não teste de cenários |
Preço: Framework core gratuito e open source (Apache 2.0). AgentOS Control Plane: Free (plano de controle local, suporte da comunidade), Pro $150/mês (plano de controle ativo com uma conexão, 4 usuários incluídos, monitoramento, retenção, conhecimento e chats ilimitados, usuários adicionais a $30/mês cada, conexões extras a $95/mês cada), Enterprise sob medida (canal dedicado no Slack, líder técnico, SLA de suporte, SSO/RBAC sob medida, opção de plano de controle auto-hospedado). Fonte: agno.com/pricing.
Ideal para: times que operam grandes números de agentes leves e concorrentes, em que a sobrecarga de instanciação é um gargalo medido, e não apenas suspeito.
13. Atomic Agents: o core menor e mais auditável
O Atomic Agents organiza tudo em torno da atomicidade: componentes pequenos, de propósito único, componíveis e previsíveis, evitando de propósito a sensação de "caixa-preta autônoma" dos frameworks maiores. Está mais perto de montar blocos de construção bem rotulados do que de adotar um runtime opinativo, e é construído sobre o Instructor e o Pydantic, então o type safety percorre todo o framework por concepção, e não como um acessório preso a um core mais frouxo.
Não há plataforma hospedada de nenhum tipo, nem produto de eval, nem nível enterprise. Se isso é uma limitação ou o ponto inteiro depende de quanto você quer o plano de controle de um fornecedor dentro do seu stack. O projeto continua de fato ativo: a versão 2.0 foi lançada com um guia de migração, o repositório tem 989 commits na branch principal e mantém o próprio Discord e subreddit.
| O que você leva | O que você não leva |
|---|---|
| Type safety baseado em Pydantic em cada entrada e saída, sem exceções | Sem plataforma hospedada de nenhum tipo, só auto-hospedado |
| Pequeno o bastante para ler o loop inteiro do agente em uma tarde | Sem produto de eval dedicado; o pytest padrão é o caminho documentado |
| Funciona com OpenAI, Anthropic, Gemini, Cohere e mais pelo Instructor | Sem durabilidade nem checkpointing embutidos, você mesmo conecta a persistência |
| Licença MIT, mantido ativamente (v2.0, 989 commits, comunidade viva) | Ecossistema menor que o de qualquer framework Python mais acima nesta lista |
Preço: Gratuito e totalmente open source (MIT), sem produto hospedado, sem nível pago, sem braço comercial. O custo é apenas o uso da API de modelo a que você o conecta. Fonte: github.com/BrainBlend-AI/atomic-agents.
Ideal para: times que querem ler e entender cada linha do loop do seu agente e não querem o plano de controle hospedado de um fornecedor em nenhum ponto do stack.
Como escolher: framework de decisão
Comece pela linguagem e pelo compromisso com um modelo, depois teste as necessidades de type safety, durabilidade, evals, streaming, retrieval e implantação.

| Se você precisa de... | Escolha... | Por quê |
|---|---|---|
| Controle máximo sobre estado ramificado que precisa sobreviver a um reinício | LangGraph | Checkpointing nativo, pausa, retomada, depuração com viagem no tempo |
| O SDK mais leve de um fornecedor de modelos de fronteira | OpenAI Agents SDK | Primitivas mínimas, busca na web, code interpreter e busca em arquivos nativos |
| O loop de agente do próprio Claude Code, testado em produção, como biblioteca | Claude Agent SDK | Hooks, subagentes, sessões, o mesmo harness que roda o Claude Code |
| A cobertura de linguagens mais ampla com evals embutidos de verdade | Google ADK | Cinco linguagens, mais ferramental de Criteria, Simulation e Custom Metrics |
| Type safety garantido pelo compilador para uma empresa .NET ou Azure | Microsoft Agent Framework | Sucessor unificado atual do AutoGen e do Semantic Kernel |
| Tracing e evals ativados por padrão, realmente agnóstico de modelo | AWS Strands | Tracing por padrão, Strands Evals, funciona com qualquer provedor |
| Streaming da saída do agente com type safety direto para uma UI web | Vercel AI SDK | InferAgentUIMessage leva os tipos do agente até a interface |
| Agentes, workflows, memória e evals em um único framework TypeScript | Mastra | Não são três produtos de fornecedores acoplados, e sim um conjunto coerente de primitivas |
| O caminho mais rápido até um protótipo multiagente | CrewAI | API baseada em papéis, legível sem experiência profunda com o framework |
| Saídas de agente que falham em uma checagem de tipos, e não em produção | Pydantic AI | Saídas estruturadas e validadas por construção |
| Agentes com muita recuperação de dados, construídos em torno de documentos e dados | LlamaIndex Workflows | A maior herança em RAG e conectores de dados desta lista |
| Milhares de agentes leves e concorrentes | Agno | Criado sob medida para baixa sobrecarga de instanciação, verifique as alegações você mesmo |
| O core menor e mais auditável, sem amarração a fornecedor | Atomic Agents | Tipado com Pydantic, mínimo, sem plataforma hospedada de que depender |
O que fazer em seguida
Não avalie os 13 de uma vez. Escolha os dois que combinam com a sua linguagem e com o seu compromisso de modelo (LangGraph mais o SDK do próprio fornecedor do modelo é um par inicial comum) e construa o mesmo agente pequeno nos dois: uma chamada de ferramenta, uma transferência em várias etapas e uma queda deliberada no meio da tarefa. O framework cuja história de durabilidade se sustentar quando você encerrar o processo à força é aquele sobre o qual construir. Se o seu time prefere não escrever o código de orquestração, o nosso levantamento de melhores plataformas de AI agents cobre alternativas gerenciadas e no-code, e como criar um AI agent percorre as etapas subjacentes, qualquer que seja o SDK em que você acabar.

On this page
- Como avaliamos: 8 critérios que realmente separam estes SDKs
- Fatos Principais
- Tabela comparativa rápida
- Linguagem, type safety e portabilidade de modelo
- Streaming, durabilidade e evals embutidos
- 1. LangGraph: o controle mais profundo sobre estado e durabilidade
- 2. OpenAI Agents SDK: o SDK mais leve de um fornecedor de modelos de fronteira
- 3. Claude Agent SDK: o próprio loop de agente do Claude Code como biblioteca
- 4. Google ADK: o maior suporte a linguagens e os evals embutidos mais profundos
- 5. Microsoft Agent Framework: type safety garantido pelo compilador para .NET e Azure
- 6. AWS Strands: tracing e evals ativados por padrão
- 7. Vercel AI SDK: streaming com type safety do modelo até a UI
- 8. Mastra: agentes, workflows e evals como um único conjunto de primitivas em TypeScript
- 9. CrewAI: a demo multiagente funcionando mais rápido
- 10. Pydantic AI: saídas validadas por construção
- 11. LlamaIndex Workflows: agentes tipados e orientados a eventos para trabalho com muita recuperação de dados
- 12. Agno: o runtime com desempenho em primeiro lugar para frotas de agentes
- 13. Atomic Agents: o core menor e mais auditável
- Como escolher: framework de decisão
- O que fazer em seguida