2026年版 開発者向けAIエージェントフレームワーク13選:開発者体験で順位付けしたSDK

ツール実行、保持されたチェックポイント、再起動後の復旧を、交換可能なSDKのクレードル越しに検証する、AIエージェントフレームワークのクラッシュテスト台のイメージ

Turn this article into takeaways for your work.

Each assistant summarizes the article only for you and suggests best practices for your work.

2026年8月更新。ビジュアルキャンバスを設定するビジネスチームではなく、コードを書くエンジニアとしてSDKを選ぶのであれば、次のように考えてください。タスクの途中でクラッシュしてもエージェントが生き延びる必要があるなら LangGraph から、すでに1つのモデルベンダーに標準化しているなら OpenAI Agents SDK か Claude Agent SDK から、チームが複数の言語にまたがるなら Google ADK から始めるのがお勧めです。本ガイドでは、open source と商用を問わず、コード中心の13のフレームワークとSDKを、純粋に開発者体験で順位付けしています。最初のエージェントが動くまでに必要なボイラープレートの量、不正なツール呼び出しがCIで失敗するのか本番で失敗するのか、ストリーミングの方式、再起動後もエージェントが生き延びるか、基盤となるモデルを入れ替えられるか、どうデプロイするか、そしてドキュメントが実際にどれだけ優れているか、という観点です。以下の価格はすべて、2026年8月に取得したベンダー自身の料金ページに基づいています。

これは、ライセンス条件とセルフホストへの適合度で15のフレームワークを順位付けしたopen sourceのAIエージェントフレームワーク比較とは、切り口が異なります。本ガイドはその視点を外し、より絞った問いを立てます。MITライセンスであれ、ベンダーの商用条件で販売されているものであれ、どのSDKがコードを書く相手として本当に最良なのか。そのため、OpenAI Agents SDK、Claude Agent SDK、Google ADK、Microsoft Agent Framework が、ここでは LangGraph や CrewAI と並んでいます。純粋な open source の比較記事にはできないことです。読み進める前に、対象範囲について1点だけ補足します。本ガイドで言うエージェントフレームワークとは、一連のステップを計画し、ツールを呼び出して実行するものです。人間がすべてのキー入力を操作しながら1行を補完するAIコーディングツールではなく、ビジネスチームがビジュアルキャンバスで設定するノーコードのエージェントビルダーでもありません。コードを書くか、ノードをドラッグするかでまだ迷っているなら、まずノーコードとコードのAIエージェント比較をお読みください。

評価方法:これらのSDKを分ける8つのポイント

どのフレームワークもツールとメモリに対応していると謳っているので、機能のチェックリストだけでは多くはわかりません。この8つの問いは、フレームワークが自社のチームに実際に合うかどうかを予測するもので、以下のすべてのセクションの背後にある視点です。

評価の観点 本当に問うべきこと
開発者体験 最初のエージェントが動くまでのボイラープレートの量と、半年後にコードがどれだけ読みやすいか
型安全性 不正なツール呼び出しが、CIの型チェックで失敗するのか、本番のインシデントになるのか
ストリーミングと非同期 トークンとツールのイベントを、UIやログにリアルタイムでストリーミングできるか
組み込みのevalとテスト シナリオに対してエージェントをテストする手段がフレームワークに付属しているか、自分で作る必要があるか
耐久性と再開可能性 タスクの途中でプロセスが再起動しても、エージェントは生き延びるか、最初からやり直しになるか
モデルの可搬性 エージェントを書き直さずに、基盤となるモデルを入れ替えられるか
デプロイの方法 ローカル、サーバーレス、セルフホスト、マネージドのどれか、そしてそれぞれに実際いくらかかるか
ドキュメントの品質 公式ドキュメント、移行ガイド、そしてプロジェクトが活発に保守されているのか、静かにメンテナンスモードに入っているのか

耐久性は、最初の本番インシデントが起きるまで、エンジニアが軽く見がちな観点です。個々のフレームワークの実装を超えた基本パターンについては、AIエージェントのメモリをご覧ください。evalも同じ理由で後回しにされます。エージェントが顧客の目の前で失敗するまで見えず、しかも賭け金は上がり続けています。実際のコンピュータ操作タスクのベンチマークである OSWorld で、エージェントのタスク成功率は、2026年に至る1年間でおよそ12%から66.3%に跳ね上がりました。これはStanford HAIのAI Indexによるもので、静かに失敗して復旧しないエージェントが、以前よりも高くつく間違いになっていることを意味します。どのSDKがネイティブに備えているかに関わらず、何を計測すべきかについては、AIエージェントのobservabilityで解説しています。

重要なポイント

  • 現在、110万を超える公開GitHubリポジトリがLLM SDKをインポートしており、前年比178%増で、そのうち693,867件は直近12か月で作成されたものです。これはGitHubのOctoverseレポートによるものです。
  • 57.3%の組織が、AIエージェントを本番稼働させていると回答しています。これは、実務者1,340人を対象としたLangChainのState of Agent Engineering調査(2025年11月18日から12月2日)によるものです。しかし、テストセットに対するオフライン評価を実施している回答者は52.4%にとどまり、これはまさに、フレームワークの組み込みevalツールが埋めるために存在するギャップです。
  • 自社で構築せず、既製のAIを購入するエンタープライズは、2024年の53%から2025年には76%に増えました。これはMenlo VenturesのState of Generative AI in the Enterpriseによるもので、商用ベンダーのSDKが、open sourceのフレームワークと同じ候補リストに載るようになった背景です。
  • エンタープライズのLLM利用に占めるオープンソースモデルのシェアは、2024年の19%から2025年には11%に低下しました。その間に、エンタープライズの生成AI支出の総額はおよそ3倍の$37 billionに膨らんでいます。これはMenlo Venturesによるものです。これはフレームワークの選択ではなくモデルの選択の話ですが、オーケストレーションのコード自体がopen sourceであっても、以下のいくつかのフレームワークが、クローズドなフロンティアモデルをデフォルトにしている理由です。
  • Gartner は、エージェント型AIプロジェクトの40%超が2027年末までに中止されると予測しており、事業価値が不明確であることとリスク統制が不十分であることを挙げています。これは、耐久性とevalが早期に捕捉するために作られている、2つの失敗パターンです。

比較表(早見)

ツール 最適な用途 開始価格 主な強み 主な制約
LangGraph 再起動後も生き延びる必要がある、長時間稼働のエージェント 無料(MIT)、LangSmith Plus は$39/seat/mo ネイティブのチェックポイント、一時停止、再開、タイムトラベルデバッグ このリストで最も習得が難しい
OpenAI Agents SDK OpenAIのモデルに標準化しているチーム SDKは無料、モデルのトークンは100万あたり$5/$30から(フラッグシップ) ネイティブのWeb検索、コードインタープリター、ファイル検索 アーキテクチャがOpenAIのモデルのロードマップに結びつく
Claude Agent SDK Claude Code自身のエージェントループをライブラリとして使いたいチーム SDKは無料、モデルのトークンは入力100万あたり$1から$5 Claude Codeを動かすのと同じハーネスの hooks、サブエージェント、セッション open sourceではなく、Claudeモデルのみ
Google ADK 組み込みのevalが必要な、複数言語のチーム 無料(Apache 2.0)、Gemini のトークンは入力100万あたり$0.75から 最も広い言語対応(5言語)と本格的な評価フレームワーク マネージドデプロイの定額の公開料金がない
Microsoft Agent Framework .NETとAzureで標準化しているエンジニアリングチーム 無料(MIT)、Azure OpenAIのトークン利用料 C#でのコンパイラに裏付けられた型安全性、AutoGenとSemantic Kernelの現行の後継 統合SDKとしては新しく、Goのサポートはまだプレビュー
AWS Strands トレーシングとevalをデフォルトで有効にしたいチーム 無料(Apache 2.0)、AWSのコンピュートとモデルのトークン トレーシングと Strands Evals を標準搭載、真にモデル非依存 定額ではなく、先に利用量の見積もりが必要
Vercel AI SDK エージェントの出力をUIにストリーミングするTypeScriptチーム 無料(Apache 2.0)、モデルのトークン ReactとNext.jsに直接つながる、型安全なストリーミング TypeScriptのみで、Pythonは非対応
Mastra evalとワークフローを組み込みで使いたいTypeScriptチーム コアは無料(Apache 2.0)、Cloud Teams は$250/mo エージェント、ワークフロー、メモリ、evalを1つのプリミティブセットに集約 TypeScriptのみで、Pythonのフレームワークよりエコシステムが小さい
CrewAI 最速で動くマルチエージェントのデモ 無料(MIT)、Enterprise はカスタム ロールベースのAPIで、フレームワークの深い知識がなくても読める より深い耐久性とevalは、有料のAMPの背後にある
Pydantic AI 検証済みの出力がほしいPythonチーム 無料(MIT)、Logfire は$0から 構造化され、構築段階で検証される出力 マルチエージェントの制御はこだわりが少なく、自作する部分が多い
LlamaIndex Workflows 検索中心の、イベント駆動のエージェント 無料(MIT)、LlamaCloud は$50/moから 型付きのイベントステップ、ここで最も強い検索の実績 ほとんどのチュートリアルが、いまだにRAGのユースケースを前提にしている
Agno 高い並行性が必要なエージェント群 無料(Apache 2.0)、AgentOS Pro は$150/mo 軽量なランタイム、公開されたパフォーマンスベンチマーク パフォーマンスの主張はベンダーが公開したもので、自分で検証が必要
Atomic Agents 最も小さく、最も監査しやすいコアを求めるチーム 無料(MIT)、有料プランは存在しない すべての入出力にPydanticベースの型安全性 ホスト型プラットフォームも組み込みevalもなく、両方を自分で組み立てる

言語、型安全性、モデルの可搬性

言語のサポートは、チームの誰がそもそもコードベースに触れられるかを決めます。型安全性は、不正なツール呼び出しがコンパイル時のエラーになるのか、午前2時の呼び出しになるのかを決めます。

型付きの言語ソケットが、アダプターを介して交換可能なモデルコアにつながる形で表した、エージェントフレームワークの言語の可搬性のイメージ

フレームワーク 対応言語 型安全性のモデル モデルの可搬性
LangGraph Python、TypeScript 型付きの状態スキーマ(PythonではTypedDictまたはPydantic、TSでは型付きオブジェクト) LangChainのモデル連携を通じて、任意のプロバイダー
OpenAI Agents SDK Python、TypeScript Pydanticベースの構造化出力(Python)、型付きインターフェース(TS) OpenAIがネイティブ、公式のLiteLLM拡張で100以上のプロバイダー(ベストエフォート)
Claude Agent SDK Python、TypeScript 型付きインターフェース、構造化されたツールスキーマ Claudeモデルのみ
Google ADK Python、Java、Kotlin、Go、TypeScript 5言語のうち4言語で静的型付け Gemini向けに最適化、明示的にモデル非依存
Microsoft Agent Framework Python、.NET(C#)、Go(プレビュー) C#ではコンパイラが強制、Pythonでは型ヒント Microsoft Foundry、Azure OpenAI、OpenAI、Anthropic、Ollama、その他
AWS Strands Python、TypeScript 全体を通じて型付きインターフェース Bedrock/AgentCoreとのネイティブ連携、Anthropic、OpenAI、Gemini、その他
Vercel AI SDK TypeScriptのみ InferAgentUIMessage によるUIまでのエンドツーエンドの型推論 SDKアダプターのある任意のプロバイダー
Mastra TypeScriptのみ 全体がネイティブのTypeScriptで、Pythonの設計の移植ではない 任意のプロバイダー
CrewAI Pythonのみ 標準のPythonの型付け LiteLLM経由で任意のプロバイダー
Pydantic AI Pythonのみ 構築段階で検証される出力、純粋なPythonとしてここで最も強い 任意のプロバイダー、設計上モデル非依存
LlamaIndex Workflows Python、TypeScript ワークフローのステップ間で受け渡される型付きイベント 任意のプロバイダー
Agno Pythonのみ 標準のPythonの型付け 任意のプロバイダー
Atomic Agents Pythonのみ すべての入出力にPydanticスキーマ、Instructorをベースに構築 Instructorが対応する任意のプロバイダー、加えてローカルのOllamaとLMStudio

ストリーミング、耐久性、組み込みのeval

これは2回読む価値のある表です。ストリーミングは今や最低条件で、ここにあるすべてのフレームワークが備えています。耐久性とevalにこそ本当の差が現れ、フレームワークのマーケティングページは、そのドキュメントよりも語らない傾向があります。

フレームワーク ストリーミング 耐久性・再開可能性 組み込みのevalまたはテストツール
LangGraph あり ネイティブのチェックポイント、一時停止、再開、タイムトラベルデバッグ 別の有料製品である LangSmith 経由
OpenAI Agents SDK あり Sessions APIは基本的な履歴を扱う。再起動をまたぐ永続的な状態は自分で用意する 組み込みなし
Claude Agent SDK あり セッションは再開またはフォーク可能、サブエージェントが長いタスクのコンテキストを分離 組み込みなし
Google ADK あり、双方向のLiveおよび音声ストリーミングを含む ワークフローの状態は Agent Runtime を通じて管理 Criteria、User Simulation、Environment Simulation、Custom Metrics、Optimization
Microsoft Agent Framework あり セッションベースの状態、Harness Agent が長いタスク向けにコンテキストの圧縮を追加 評価サービスが、ファーストクラスの連携カテゴリとして掲載されている
AWS Strands あり デフォルトでトレースされ、すべてのツール呼び出しでフックシステムが発火 Strands Evals:ケースを定義し、評価器を選び、出荷前に実験を実行
Vercel AI SDK あり、これが本来の存在理由 付属の Workflow DevKit 経由の DurableAgent(コアではなくアドオン) 組み込みなし
Mastra あり ネイティブのワークフローの一時停止と再開 evalはアドオンではなく、フレームワークのファーストクラスのプリミティブ
CrewAI あり Flowの状態はローカルに永続化、より深い耐久性は有料のAMPの背後にある observabilityとevalは、open sourceのコアではなくAMPの背後にある
Pydantic AI あり メッセージ履歴のオブジェクトは自分で永続化する 別の有料製品である Logfire 経由
LlamaIndex Workflows あり ワークフローのコンテキストをシリアライズして、ステップ間で再開できる RAGの実績から受け継いだ、検索評価のツール
Agno あり 並行性を想定して設計された、組み込みのセッションと状態のストレージ AgentOS経由のモニタリング、専用のevalスイートはなし
Atomic Agents あり 組み込みなし、永続化は自分で組み込む 標準のpytest、専用のeval製品はなし

1. LangGraph:状態と耐久性を最も深く制御できる

LangGraph は、エージェントを単一のプロンプトループではなく、ノードとエッジのグラフとしてモデル化します。これにより、一時停止、再開、タイムトラベルデバッグが、後から付け足したものではなく、ネイティブのプリミティブになります。このチェックポイントのモデルこそが、エージェントの失敗パターンが「間違った答えを出した」ではなく「進捗をすべて失った」になったとき、チームがこのフレームワークに手を伸ばす理由です。単体でも、より広いLangChainのエコシステムの中でも動作し、PythonとTypeScriptの両方に対応します。中核パターンの実践的な解説は、LangGraphでAIエージェントを構築するをご覧ください。

トレードオフは、グラフというメンタルモデルそのものです。ロールベースのクルーよりも習得に時間がかかり、最も深いobservability層である LangSmith は、1席は無料ですが、それを超えるとユーザー単位で課金されます。

得られるもの 得られないもの
ネイティブのチェックポイント、一時停止、再開、タイムトラベルデバッグ ここにあるどのフレームワークよりも、習得が最も難しい
ファーストクラスのプリミティブとしての human in the loop による承認 完全なobservability(LangSmith)は、無料の1席を超えると有料
LangChainの連携を通じて、任意のモデルプロバイダーで動作 単純なエージェント1つなら、CrewAIよりもボイラープレートが多い
PythonとTypeScriptに対応 デプロイ用のツール(LangGraph Platform)は、別の有料の層

料金: フレームワークは無料で open source(MIT)です。LangSmith/LangGraph Platform は、Developer が$0/seat(月5,000トレースまで無料、それ以降は従量課金、最大1席)、Plus が$39/seat/month(月10,000トレースまで無料、小規模なデプロイ1つが無料で付属)、Enterprise はセルフホストとハイブリッドの選択肢付きでカスタムです。超過料金は、コンピュートユニット(LCU)あたり$1.50、ストレージユニット(LSU)あたり$1.00です。出典:langchain.com/pricing。

最適な用途: 良い答えを生成するだけでなく、進捗を失わずに一時停止、再開、状態の復旧ができるエージェントが必要なエンジニアリングチーム。

2. OpenAI Agents SDK:フロンティアモデルのベンダーによる、最も軽量なSDK

OpenAI Agents SDK の強みは近さです。実行するモデルを学習させているのと同じ会社が作っているため、Web検索、コードインタープリター、ファイル検索は、サードパーティ経由で組み込むものではなく、ネイティブの従量課金機能です。プリミティブのセット(Agents、Handoffs、Guardrails、Sessions)は意図的に小さく、ここにあるフレームワークの中で、端から端まで学ぶのが最も速いものの1つです。

名前に反して、OpenAIのモデルに固く縛られているわけではありません。公式のLiteLLM拡張により、Anthropic や Gemini を含む100以上のプロバイダーを、同じエージェントコードで利用できますが、そのサポートは公式にはベストエフォートであり、保証された契約ではありません。

得られるもの 得られないもの
ネイティブのWeb検索、コードインタープリター、ファイル検索ツール コストはトークン使用量に直結し、過小評価しやすい
最小限のプリミティブのセットで、端から端まで素早く学べる 再起動をまたぐ永続的な状態は自分で用意する。Sessions APIが扱うのは履歴だけ
公式のLiteLLM拡張による、本物のマルチプロバイダー対応 LiteLLMのプロバイダー対応は、公式にはベストエフォートで、コアではない
PythonとTypeScript、MITライセンス SDK自体に、専用のevalツールは付属しない

料金: SDKは無料で open source(MIT)です。コストはモデルの利用料です。フラッグシップ(たとえば gpt-5.6-sol や gpt-5.5)は、入力トークン100万あたり$5.00、出力トークン100万あたり$30.00です。中位の gpt-5.6-terra は入力$2.00 / 出力$12.00、低価格帯の gpt-5.6-luna は入力$0.20 / 出力$1.20です。組み込みツールは別途課金されます。Web検索は1,000回の呼び出しあたり$10に加えて、コンテンツトークンがモデルの料金で課金され、コードインタープリターは、コンテナメモリ(1GBから64GB)に応じて、20分のセッションあたり$0.03から$1.92、ファイル検索はストレージが1GBあたり1日$0.10(1GBは無料)に加えて、1,000回のツール呼び出しあたり$2.50です。出典:developers.openai.com/api/docs/pricing。

最適な用途: OpenAIのモデルに標準化していて、依存の範囲を最小限に抑えたうえで、Web検索、コードインタープリター、ファイル検索を個別に組み立てることなくネイティブに使いたいチーム。

3. Claude Agent SDK:Claude Code自身のエージェントループを、ライブラリとして

Claude Agent SDK は、2025年後半に Claude Code SDK から名称が変わったもので、Claude Code自体を動かしているのと同じ、ツール実行ループ、コンテキスト管理、組み込みツール(ファイル編集、bash、Web検索、Web取得)を、PythonとTypeScriptでプログラムできる形で提供します。これは、研究レベルの抽象化とは意味のある違いのある出発点です。手に入るのは、新しい設計ではなく、すでに数百万回の実際のコーディングとエージェントのセッションを回してきたハーネスです。

本番利用では、3つの機能が際立ちます。Hooks は、ライフサイクルの各時点でカスタムコードを実行します。サブエージェントは、独自のコンテキストを持つ専門の子エージェントを生成し、長いタスクのコンテキストウィンドウの肥大化を防ぐ、このリストで最もすっきりした方法です。セッションは、やり取りをまたいでコンテキストを保持し、後で再開またはフォークできます。一方で、OSI承認のopen sourceライセンスはありません。利用は Anthropic の商用利用規約のもとで行われ、ここにあるMITやApache 2.0のすべてのフレームワークとは実質的に異なります。その上に再販する製品を構築する前に、読んでおく価値があります。

得られるもの 得られないもの
Claude Codeを動かしているのと同じ、本番で検証済みのエージェントループとツール open sourceではなく、MITやApache 2.0ではなく商用条件の下にある
ライフサイクル制御とコンテキスト分離のための Hooks、サブエージェント、セッション Claudeモデルのみで、マルチベンダーの可搬性はない
MCPクライアントのサポートと、組み込みのファイル、bash、Webツールがそのまま使える 専用のevalフレームワークは付属せず、自分で用意する
PythonとTypeScript、モデルを作っているチームが支えている サードパーティの開発者は、SDK上に構築した製品の中で、claude.aiのログインやそのレート制限を提供できない

料金: 別途のSDKライセンス料はありませんが、利用は open source ライセンスではなく、Anthropicの商用利用規約のもとで行われます。コストは Claude API のトークン使用量です。Claude Sonnet 5 は入力トークン100万あたり$2、出力トークン100万あたり$10(導入時の価格が標準レートになりました)、Claude Opus 5 は入力$5 / 出力$25、Claude Haiku 4.5 は入力$1 / 出力$5です。プロンプトキャッシュにより、キャッシュヒットは基本の入力価格のおよそ10%になります。Web検索(サーバーツール)は1,000回の検索あたり$10です。コード実行は、組織あたり月1,550時間が無料で、それ以降はコンテナあたり1時間$0.05です。出典:platform.claude.com/docs(料金)とcode.claude.com/docs(SDK概要)。

最適な用途: 同等のものをゼロから組み立てるのではなく、本番で検証済みの Claude Code 自身のエージェントループ、hooks、サブエージェントのモデルを、ライブラリとして使いたいチーム。

4. Google ADK:最も広い言語対応と、最も深い組み込みのeval

Google の Agent Development Kit は、エージェント構築に通常のソフトウェアエンジニアリングの規律を適用するもので、自らの説明どおりコード中心であり、このリストで最も広い言語対応で裏付けています。Python、Java、Kotlin、Go、TypeScript で、いずれも Apache 2.0 です。ノーコードの Agent Config オプションと組み込みの開発UIが、コード中心の道と並んで用意されているため、複数言語のチームでも、全員が同じ言語を書く必要はありません。

これら13製品の中での ADK の際立った特徴は、評価の仕組みです。Criteria、User Simulation、Environment Simulation、Custom Metrics、Optimization コンポーネントを備えた本格的な組み込みフレームワークで、ほとんどのフレームワークが求める「evalツールは自前で用意する」というやり方よりも、本物のテストスイートに近いものです。ストリーミングもさらに進んでおり、トークンごとのテキストだけでなく、Gemini Live API を通じた、真の双方向のLiveエージェントと音声エージェントに対応しています。SDKに対してコードを書くのではなく、マネージドスイートを購入したい場合は、エンタープライズ向けAIエージェントプラットフォーム比較がその代替案を扱っています。

得られるもの 得られないもの
5つの対応言語で、ここにあるどのフレームワークよりも広い Agent Runtime経由のデプロイ料金は、単一の公開された定額ではない
後付けではない、本格的な組み込みの評価フレームワーク ドキュメントが最も充実し、実績が最も多いのはPythonで、他の言語は遅れている
Gemini Live API を通じた、双方向のLiveおよび音声ストリーミング Gemini向けに最適化されており、Google以外のデプロイは統合作業が増える
Cloud Run、GKE、またはマネージドの Agent Runtime というデプロイ経路 中核のPythonリリースに比べ、複数言語のSDK(Go、Kotlin)は新しい

料金: フレームワークは無料(Apache 2.0)です。実行にかかるのは、Gemini API のトークンと、デプロイ先のコンピュート費用です。Gemini 3.7 Flash は無料プランがあり、有料プランは2026年12月31日まで入力トークン100万あたり$0.75、出力トークン100万あたり$3.75で、2027年1月1日には入力$1.50 / 出力$7.50に上がります。Gemini Enterprise Agent Platform の Agent Runtime によるマネージドデプロイは従量課金で、執筆時点で Google は単一の定額の公開料金を示していません。そのため、定価ではなく Vertex AI の利用量の見積もりで予算を組んでください。これは AWS Bedrock AgentCore にも当てはまる、同じ率直な注意点です。出典:github.com/google/adk-python、adk.dev、ai.google.dev/gemini-api/docs/pricing。

最適な用途: このリストの中で最も充実した組み込みの評価ツールがほしい、複数言語のエンジニアリングチーム。

5. Microsoft Agent Framework:.NETとAzure向けの、コンパイラに裏付けられた型安全性

Microsoft Agent Framework は、2026年4月3日に一般提供が始まり、AutoGen と Semantic Kernel の両方の直接の後継で、それぞれを手がけたのと同じチームが構築しています。AutoGen のシンプルな単一・マルチエージェントの抽象化と、Semantic Kernel のエンタープライズ機能(セッションベースの状態管理、型安全性、ミドルウェア、テレメトリ)を組み合わせ、どちらの前身にも単独ではなかった、明示的なマルチエージェントの実行経路のためのグラフベースの Workflows を加えています。

C#のチームにとって、型安全性の話は本当に差別化されています。動的型付けの言語にはできない形で、コンパイラがその主張を裏付けるからです。このフレームワークには「Harness Agent」も付属しています。計画、コンテキストの圧縮、ファイルアクセスとメモリ、ツールの承認ゲート、observabilityを組み込んだ、長い複数ステップのタスク向けの全部入りのエージェントで、耐久性とevalの組み合わせを1つのパッケージとして提供するフレームワークは、ここでは少数です。サポートは現在、Python、.NET、そして公開プレビューのGo SDKにまたがり、名前に反して、Microsoft自身のモデルだけでなく、Microsoft Foundry、Anthropic、Azure OpenAI、OpenAI、Ollama にも接続します。

得られるもの 得られないもの
C#でのコンパイラによる型安全性の強制、セッションの状態、ミドルウェア、テレメトリ Goのサポートは公開プレビューで、宣言型のエージェントとRAGはまだない
AutoGenとSemantic Kernelのどちらかを選ぶ必要がない、1つの統合SDK 統合製品としては新しく、成熟した前身に比べて粗い部分が残る
「Harness Agent」が、計画、メモリ、ツールの承認をそのままバンドル エコシステムとコミュニティのチュートリアルは、従来のAutoGenにまだ追いついていない
マルチベンダーのモデル対応(Foundry、Azure OpenAI、OpenAI、Anthropic、Ollama) Microsoftで標準化したスタックの外では、適合度が下がる

料金: 無料で open source(MIT)で、ライセンス料はありません。コストは、接続するモデルAPIの利用料で、一般的には Azure OpenAI Service のトークン料金です。出典:learn.microsoft.com/en-us/agent-framework。

最適な用途: 従来のどちらのプロジェクトでもなく、コンパイラに裏付けられた型安全性と、AutoGen と Semantic Kernel の現行で活発に開発されている後継を求める、.NETとAzureで標準化したエンジニアリングチーム。

6. AWS Strands:トレーシングとevalがデフォルトで有効

Strands は、本番のエージェントSDKはどうあるべきかについての、AWS自身の賭けで、Amazon Q Developer、AWS Glue、VPC Reachability Analyzer の内部ですでにAWSが運用しているパターンから構築されています。2026年5月21日に1.0に到達し、「単一のエージェントには良い」から、真に本番対応のマルチエージェントオーケストレーションへと移行したリリースで、agent-as-tool と swarm のパターン、そしてMCPのサポートが組み込まれています。

ここでの Strands を際立たせているのは、observabilityとevalが後付けではないことです。エージェントのすべての判断に、オプトインのフラグの背後ではなくデフォルトでトレース属性が付き、フックシステム(BeforeToolCallEvent、AfterToolCallEvent)により、ループのどこでも割り込めます。Strands Evals により、チームはテストケースを定義し、評価器を選び、出荷前に実験を実行できます。これは、別の有料製品ではなく、本物の組み込みの答えです。設計上、モデル非依存でもあります。Bedrock と AgentCore とのネイティブな連携がありつつ、Anthropic、OpenAI、Gemini などは、書き直しなしで動作します。strands-agents のPythonパッケージは、2026年6月時点で月間1,670万ダウンロードを記録しました。

得られるもの 得られないもの
デフォルトで有効なトレーシングと、すべてのツール呼び出しに対するフックシステム LangGraphやCrewAIより新しく、コミュニティの実績が小さい
Strands Evals:ケースを定義し、評価器を選び、出荷前に実験を実行 最も深いネイティブ連携はAWSとで、他のクラウドはセットアップが増える
真にモデル非依存:Bedrock、Anthropic、OpenAI、Gemini、その他 Strands自体にはマネージドホスティングがなく、AWSのコンピュートの実行先は自分で選ぶ
AgentCore、Lambda、Fargate、EKS、Docker、Terraform へのデプロイ マルチエージェントの swarm パターンは、LangGraphのグラフモデルより新しい

料金: フレームワークは無料(Apache 2.0)です。実行にかかるのは、デプロイ先のコンピュート(Lambda、Fargate、EKS、または Bedrock AgentCore 自体の従量課金)の費用と、モデルプロバイダーのトークン費用です。出典:strandsagents.com、github.com/strands-agents。

最適な用途: トレーシングとevalを後付けではなくデフォルトで有効にしたく、エージェントのコードを書き直さずにモデルプロバイダーを入れ替えたいチーム。

7. Vercel AI SDK:モデルからUIまで、型安全なストリーミング

Vercel AI SDK は、多くのフルスタックJavaScriptチームが、別の用途ですでに導入しているフレームワークです。チャット補完をNext.jsやReactのアプリにストリーミングするためのもので、エージェントの追加は新しい依存ではなく、段階的な一歩になります。AI SDK 6 の Agent インターフェース(ToolLoopAgent が実装)は、ほとんどのチームがこれまで generateText とステップカウンターで手作りしていたパターンを体系化しています。モデルを呼び出し、ツール呼び出しを実行し、結果を追加し、繰り返す。デフォルトでは stopWhen: stepCountIs(20) により、最大20ステップまでです。stopWhen と prepareStep のフックで、ループをいつ終えるか、各ステップがどのコンテキストを見るかを細かく制御でき、needsApproval フラグで、個々のツールに human in the loop のゲートを追加できます。

型付きのイベントパケットが、モデルからツールと承認を経て、Webインターフェースへと移動する形で表した、Vercel AI SDKの型安全なストリーミングのイメージ

このリストで本当に先頭を走っているのは、型安全性がインターフェースまで届いている点です。型は、エージェントの定義から InferAgentUIMessage を通じてUIコンポーネントへと自動的に流れるため、ツールの戻り値の形を変更すると、実行時の驚きではなく、フロントエンドのコンパイルエラーになります。耐久性は、ここでは新しい話です。付属の Workflow DevKit の DurableAgent は、エージェントを再開可能なワークフローに変え、各ツールの実行を、再試行可能で観測可能なステップにしますが、SDKのコアではなくアドオンです。

得られるもの 得られないもの
Next.js、React、Svelte、Vue に直接つながる、型安全なストリーミング TypeScriptのみでPythonは非対応。MLのツールがPythonにあるなら、現実的な制約
ToolLoopAgent が、手作りの maxSteps のコードに代わってエージェントのループを体系化 コアのSDKに組み込まれたevalツールはない
個々のツールに対する human in the loop の制御のための needsApproval 耐久的で再開可能なワークフローには、別途の Workflow DevKit のアドオンが必要
SDKにアダプターのある任意のモデルプロバイダーで動作 LangGraphのグラフモデルに比べ、Agent の抽象化は新しい

料金: 無料で open source(Apache 2.0)です。コストは、接続先のモデルAPIの利用料です。出典:github.com/vercel/ai、vercel.com/blog/ai-sdk-6。

最適な用途: エージェントの出力を、完全な型安全性とともにWebインターフェースへ直接ストリーミングする必要がある、ユーザー向けの製品を構築しているTypeScriptチーム。

8. Mastra:エージェント、ワークフロー、evalを1つのTypeScriptプリミティブセットに

Mastra は、Pythonの設計を移植したものではなく、TypeScript向けにAPIファーストで作られており、エージェントを動かすためだけに別のPythonマイクロサービスを要求するのではなく、既存のNext.jsやNodeのサービスの中に自然に収まる点にそれが表れています。このリストの大半と違う点は、1つのパッケージの中の幅広さです。エージェント、ワークフロー、検索、eval、メモリが、同じフレームワークの中でどれもファーストクラスのプリミティブであり、多くのフレームワークが行き着く、オーケストレーション層に3つの後付けのベンダー製品を足した形ではありません。

耐久性もネイティブです。ワークフローの一時停止と再開、そして差し替え可能なメモリのストレージがあり、自分で作るものではありません。コアのフレームワークは Apache 2.0 のままで、別の ee/ ディレクトリには、特定のエンタープライズ機能に限り、本番でのみ必要となる商用ライセンスが付いています。完全にクローズドではなく、オープンコア構造です。

得られるもの 得られないもの
エージェント、ワークフロー、メモリ、evalが、1つの一貫したプリミティブセットに TypeScriptのみでPythonは非対応
後付けではない、ネイティブのワークフローの一時停止と再開 LangChainの連携に比べて、プラグインのエコシステムが小さい
APIファーストのTypeScript設計で、既存のNext.jsやNodeのサービスに合う オープンコアのライセンス:ee/ ディレクトリは、本番で有料ライセンスが必要
活発なドキュメントと、速いリリースペース Pythonファーストの既存勢力より新しく、本番の実績談が少ない

料金: セルフホストのフレームワークは無料です(コアは Apache 2.0)。Mastra Cloud は、Starter が無料(100,000件のobservabilityイベント、24 CPU時間、15日間の保持。それ以降は100,000イベントあたり$10、CPU時間あたり$0.35)、Teams が$250/month(1,000,000イベント、250 CPU時間、6か月の保持。それ以降は100,000イベントあたり$8、CPU時間あたり$0.25。加えて SSO と SOC 2 のドキュメント)、Enterprise はトレース単位の従量課金ではなく年額固定のカスタムです。出典:mastra.ai/pricing。

最適な用途: evalと耐久的なワークフローを、3つの別々のベンダーから組み立てるのではなく、同じフレームワークに組み込みたいTypeScriptチーム。

9. CrewAI:最速で動く、マルチエージェントのデモ

CrewAI は、エージェントをロール、ゴール、バックストーリーで定義し、クルーにまとめて、一連のタスクに対して順次または階層的に実行します。この構造と、豊富なチュートリアルやコースのエコシステムのおかげで、このリストの中で、ゼロから動くマルチエージェントのデモまでの最速の道になるのが普通です。純粋な自律型のクルーでは足りなくなったチーム向けに、Flows が、より決定論的でコード中心の制御層を加えます。実践的なセットアップは、CrewAIでAIエージェントを構築するをご覧ください。

CrewAI Inc のホスト型AMPプラットフォームは、デプロイ、observability、evalを担い、料金は2026年に、セルフサービスの Professional プランが終了した後、無料の Basic プランとカスタムの Enterprise プランに簡素化されました。

得られるもの 得られないもの
ここにあるどのフレームワークよりも、動くマルチエージェントのデモまでの道が最速 より深い耐久性とevalは、有料のAMPクラウド製品の背後にある
同じフレームワークの中に、自律型のクルーと決定論的な Flows の両方がある セルフサービスの有料プランはなくなり、無料かカスタムの Enterprise のみ
大規模なコミュニティ、コース、テンプレート ロールプレイの抽象化は、単純なエージェント1つには余計な負担に感じられる
MITライセンスで、完全に寛容 複雑な分岐では、LangGraphより状態の制御が粗い

料金: open source のフレームワークは無料(MIT)です。ホスト型のAMPは、Basic が無料(月50回のワークフロー実行、ビジュアルエディター、AIコパイロット、GitHub連携)、Enterprise はカスタム(SSO、RBAC、ワークロードアイデンティティ、PIIのマスキング、45日間のオンボーディングプログラムを追加)です。出典:crewai.com/pricing。

最適な用途: 午後のうちに動くマルチエージェントのプロトタイプを動かし、エージェントが何に耐える必要があるかがわかってから、本番の耐久性を決めたいエンジニアリングチーム。

10. Pydantic AI:構築段階で検証される出力

Pydantic AI は、ほとんどのPython Web APIがすでに依存している検証ライブラリ、Pydantic 本体を手がけるチームが作っています。それが表れているのは、エージェントの出力が、テキストの塊から期待を込めて解析されるのではなく、構築段階で構造化され、検証される点と、FastAPI がリクエストの依存関係を注入するのと同じ方法で、ツールの依存関係が注入される点です。これにより、不正なツール呼び出しは、本番で捕捉されるインシデントではなく、テストで捕捉される型エラーになります。これは、このリスト全体で、純粋なPythonとして最も強い型安全性の話です。

フレームワーク自体は、常に完全に開かれていて無料です。チームのオプションのobservability製品である Logfire は、フレームワークがすでに無料で提供している検証の上に、トレーシングとevalの追跡がほしいチーム向けの、別の有料の層です。

得られるもの 得られないもの
期待ではなく構築段階で、構造化され検証された出力 LangGraphやCrewAIよりエコシステムが新しく、コミュニティのテンプレートが少ない
FastAPIスタイルの依存性注入により、テストが容易 マルチエージェントの制御はこだわりが少なく、自分で設計する部分が多い
ほとんどのPython開発現場が、検証ですでに信頼しているチームが支えている LangChainのエコシステムに比べ、ビルド済みの連携のカタログが小さい
モデル非依存、MITライセンス、常に無料 オプションの Logfire によるobservabilityは、別の有料製品

料金: フレームワークは無料で open source(MIT)、常に無料です。Logfire は、月1,000万のスパン、ログ、メトリクスまで無料の無料プラン、Team プランが$49/month(5席を含み、追加1席あたり$25で合計最大12席、含まれる1,000万を超える分は100万レコードあたり$2)、Growth プランが$249/month(席数無制限、最大90日の保持、1日5,000回のクエリAPIリクエスト)です。出典:pydantic.dev/pricing。

最適な用途: 本番での不正なツール呼び出しではなく、CIでの型エラーがほしいPythonチーム。

11. LlamaIndex Workflows:検索中心の業務向けの、型付きでイベント駆動のエージェント

LlamaIndex Workflows は、エージェントを、型付きのイベントを発行し、消費する非同期のステップの集まりとしてモデル化するため、複数ステップのエージェントは、専用のグラフDSLではなく、小さなステートマシンのように読めます。LlamaIndex のデータコネクタと検索の実績から直接生まれたもので、自由な会話ではなく、ドキュメントや構造化データからの取得が中心の仕事であるエージェントを、いかに自然に扱えるかにそれが表れています。

オーケストレーションのフレームワークは、この先どうするかに関わらず、無料で開かれたままです。LlamaIndex Inc のホスト型の LlamaCloud は、パースとインデックス作成を従量課金で担い、オーケストレーションのコードとは、本当に別の製品として維持されています。

得られるもの 得られないもの
ワークフローのステップ間の型付きイベントで、理解しやすい ほとんどのチュートリアルと例が、いまだにRAGのユースケースを前提にしている
最高水準のデータコネクタと検索のプリミティブ LangGraphやCrewAIより、マルチエージェント特化のコミュニティが小さい
単体でも、LlamaIndex のスタック全体の下にでも使える 汎用のエージェント向けevalツールは、Google ADKより薄い
PythonとTypeScript、MITライセンス ホスト型の LlamaCloud は、無料ではなく、別の従量課金製品

料金: オーケストレーションのフレームワークは無料で open source(MIT)です。LlamaCloud は、Free が10,000クレジット、Starter が$50/month(40,000クレジット、400,000まで従量課金)、Pro が$500/month(400,000クレジット、加えて1回限りの$1,000で期間限定の800,000クレジットのボーナス)、Enterprise はボリューム割引付きでカスタムです。クレジットのレートは、1,000クレジットが$1.25です。出典:llamaindex.ai/pricing。

最適な用途: エージェントの中核の仕事が、汎用の会話ではなく、ドキュメントや構造化データに対する検索であるチーム。

12. Agno:エージェント群向けの、パフォーマンス重視のランタイム

Agno は、2025年1月に Phidata から名称が変わったもので、ライブラリというより、エージェント型のオペレーティングシステムとして位置づけています。Agents、Teams、Workflows の抽象化と、耐久的な状態を持ち、それをHTTPで公開する AgentOS というランタイムを軸に構築されています。売りは速度です。Agno 自身が公開しているベンチマークでは、LangGraph に比べて、エージェントの生成がおよそ5,000倍速く、メモリが約50分の1と主張しています。これはベンダーの主張であり、頼る前に自社のワークロードでベンチマークする価値があり、独立して検証された数字ではありません。

AgentOS の料金は2026年に公開され、非公開だったコントロールプレーンのコストから、本物のセルフサービスのプランに変わりました。年初に「エンタープライズ限定」という前提で Agno を評価していたなら、これは重要です。

得られるもの 得られないもの
真に軽量なランタイムで、高い並行性が必要なエージェント群に役立つ パフォーマンスの主張はベンダーが公開したもので、自社のワークロードで検証が必要
組み込みのマルチモーダル対応とセッションのストレージ 上位のフレームワークより、コミュニティが小さく、サードパーティのチュートリアルが少ない
AgentOS Pro に、公開されたセルフサービスの料金が付いた Pythonのみで、TypeScriptの道はない
Apache 2.0、コアのフレームワークは完全に寛容 専用のevalスイートはなく、AgentOS が扱うのはモニタリングで、シナリオテストではない

料金: コアのフレームワークは無料で open source(Apache 2.0)です。AgentOS Control Plane は、Free(ローカルのコントロールプレーン、コミュニティサポート)、Pro が$150/month(接続1つのライブのコントロールプレーン、4席を含み、モニタリング、保持、ナレッジ、チャットは無制限。追加の席は1席あたり月額$30、追加の接続は1接続あたり月額$95)、Enterprise はカスタム(専用のSlackチャンネル、テクニカルリード、サポートSLA、カスタムのSSO/RBAC、セルフホストのコントロールプレーンのオプション)です。出典:agno.com/pricing。

最適な用途: 生成のオーバーヘッドが、疑われているだけでなく計測されたボトルネックになっている、大量の並行する軽量なエージェントを動かすチーム。

13. Atomic Agents:最も小さく、最も監査しやすいコア

Atomic Agents は、すべてをアトミック性、つまり小さく、単一の目的を持ち、組み合わせられ、予測可能なコンポーネントを軸に構成しており、大きなフレームワークの「自律的なブラックボックス」という感触を、意図的に避けています。こだわりの強いランタイムを採用するというより、きちんとラベルの付いた部品を組み立てるのに近く、Instructor と Pydantic の上に構築されているため、型安全性は、緩いコアに後付けしたアドオンではなく、設計上フレームワーク全体に行き渡っています。

どんな種類のホスト型プラットフォームも、eval製品も、エンタープライズプランもありません。それが制約なのか、それこそが狙いなのかは、ベンダーのコントロールプレーンが自社のスタックの中にあることを、どれだけ望むかによります。プロジェクトは、本当にいまも活発です。バージョン2.0が移行ガイド付きで公開され、リポジトリのメインブランチには989のコミットがあり、独自のDiscordとサブレディットを運営しています。

得られるもの 得られないもの
すべての入出力に、例外なくPydanticベースの型安全性 どんな種類のホスト型プラットフォームもなく、セルフホストのみ
エージェントのループ全体を、午後のうちに読み切れる小ささ 専用のeval製品はなく、標準のpytestが文書化された道
Instructor経由で、OpenAI、Anthropic、Gemini、Cohere などで動作 組み込みの耐久性やチェックポイントはなく、永続化は自分で組み込む
MITライセンス、活発に保守されている(v2.0、989コミット、活発なコミュニティ) このリストの上位にあるどのPythonフレームワークよりも、エコシステムが小さい

料金: 無料で完全に open source(MIT)で、ホスト型製品も、有料プランも、商用の事業部門もありません。コストは、接続するモデルAPIの利用料だけです。出典:github.com/BrainBlend-AI/atomic-agents。

最適な用途: エージェントのループのすべての行を読んで理解したく、ベンダーのホスト型コントロールプレーンをスタックのどこにも置きたくないチーム。

選び方:意思決定フレームワーク

まず言語とモデルへのコミットメントから始め、そのうえで、型安全性、耐久性、eval、ストリーミング、検索、デプロイの要件をテストしてください。

言語、安全性、耐久性、eval、デプロイについて試験される、SDKのクレードルとして表した、AIエージェントフレームワークの意思決定ガイドのイメージ

必要なもの 選ぶべき製品 理由
再起動後も生き延びなければならない、分岐する状態の最大限の制御 LangGraph ネイティブのチェックポイント、一時停止、再開、タイムトラベルデバッグ
フロンティアモデルのベンダーによる、最も軽量なSDK OpenAI Agents SDK 最小限のプリミティブ、ネイティブのWeb検索、コードインタープリター、ファイル検索
Claude Code自身の、本番で検証済みのエージェントループをライブラリとして Claude Agent SDK Hooks、サブエージェント、セッション、Claude Codeを動かすのと同じハーネス
本物の組み込みevalを備えた、最も広い言語対応 Google ADK 5つの言語に加え、Criteria、Simulation、Custom Metrics のツール
.NETまたはAzureの現場向けの、コンパイラに裏付けられた型安全性 Microsoft Agent Framework AutoGenとSemantic Kernelの、現行の統合された後継
デフォルトで有効なトレーシングとeval、真にモデル非依存 AWS Strands デフォルトのトレーシング、Strands Evals、任意のプロバイダーで動作
型安全なエージェントの出力を、Web UIに直接ストリーミング Vercel AI SDK InferAgentUIMessage が、エージェントからインターフェースまで型を運ぶ
1つのTypeScriptフレームワークの中の、エージェント、ワークフロー、メモリ、eval Mastra 3つの後付けのベンダー製品ではなく、1つの一貫したプリミティブセット
マルチエージェントのプロトタイプまでの最速の道 CrewAI ロールベースのAPIで、フレームワークの深い経験がなくても読める
本番ではなく型チェックで失敗するエージェントの出力 Pydantic AI 構築段階で、構造化され検証された出力
ドキュメントとデータを軸にした、検索中心のエージェント LlamaIndex Workflows このリストで最も強い、RAGとデータコネクタの実績
数千の並行する軽量なエージェント Agno 低い生成オーバーヘッドのために作られている。主張は自分で検証すること
ベンダーロックインのない、最も小さく最も監査しやすいコア Atomic Agents Pydanticで型付けされ、最小限で、依存すべきホスト型プラットフォームがない

次にやるべきこと

13製品すべてを一度に評価しないでください。自社の言語とモデルへのコミットメントに合う2つを選び(LangGraph と、利用するモデルベンダー自身のSDKの組み合わせが、よくある出発点です)、同じ小さなエージェントを両方で構築してください。ツール呼び出し1回、複数ステップの引き継ぎ1回、そしてタスクの途中での意図的なクラッシュ1回です。プロセスを強制終了したときに、耐久性が保たれたフレームワークが、土台にすべきものです。オーケストレーションのコードをそもそも書きたくないのであれば、AIエージェントプラットフォーム比較が、マネージドとノーコードの代替案を扱っており、AIエージェントの作り方が、どのSDKに落ち着くかに関わらず、基本となる手順を解説しています。

About the author

Camellia

Camellia

Principal Product Marketing Strategist

Camellia is Principal Product Marketing Strategist at Rework, helping B2B buyers pick the right software with confidence. With 6+ years in product marketing and 150+ SaaS tools evaluated across CRM, project management, and sales engagement, Camellia turns competitive intelligence into clear, honest comparisons. Readers get vendor evaluations they can trust to cut through marketing noise and decide faster.