2026年版 自律型AIエージェントのおすすめ:人の手を借りずにどこまで動くかで順位付けした9つのツール

保護ケージの中にある自律型AIエージェントのジャイロスコープと、外部の停止キー、ロールバック用のスプール、例外通知のベルを描いたイメージ

Turn this article into takeaways for your work.

Each assistant summarizes the article only for you and suggests best practices for your work.

実際の依頼を任せて席を離れられる汎用エージェントに最も近いのは、ManusとGensparkです。Devinは、コードの出荷に特化した製品の中で最も自律性が高い選択肢です。Skyvernは、存在しないAPIが必要になるはずの、無人のブラウザ作業にうってつけです。そしてLindyは、単一のプロンプトに答えるだけでなく、トリガーに応じて継続的に動くように作られた唯一の製品です。本ガイドでは、実在し、現在購入できる自律型エージェント9製品(エージェント構築プラットフォームでも、1行ごとに承認を待つAIコパイロットでもありません)を、ひとつの具体的な問いで順位付けしています。何かが壊れる、あるいは人が再び介入する必要が生じるまでに、実行がどこまで進むのか、という問いです。

以下の製品はすべて、2026年8月時点で、実際に動作する一般提供(または明確にプレビューと表示された)リリースを出荷しています。料金は各ベンダー自身のページで確認しました。このカテゴリでよく見かける名前のいくつかは、買収、リブランド、放棄されていたことが分かったため、リストを切りのよい数に水増しするのではなく、外しています。自律型エージェントは、現在のAIソフトウェアで最も誇大に宣伝されているカテゴリです。そのため、以下のすべてのベンチマークのスコアには、ベンチマーク名と測定日を明記し、ベンダーのマーケティングが第三者のレビュー担当者の実際の評価を超えている箇所は、はっきりと述べています。

2026年8月更新:変更点

  • OpenAIは2025年8月31日にOperatorを終了しました。 ブラウザ操作の機能は、OperatorとDeep Researchを1つのモードに統合したChatGPT agentに組み込まれ、Plus(月$20)以上のコンポーザーから選べるようになりました。以前の月$200のPro限定の提供層に閉じ込められることはなくなりました。
  • Salesforceは、Proxyエージェントを開発したConvergence AIを買収し、取引は2025年6月11日ごろに完了しました。 既存の契約者にはメールで通知され、返金されました。Proxyは単体製品としては販売されなくなり、チームと技術はAgentforceに移りました。
  • MultiOnはAGI, Inc.にリブランドし、 プロアクティブなモバイルエージェントのプレビューであるAGI-0へと軸足を移しました。元のMultiOn APIは、完成した消費者向け製品ではなく、開発者向けの構成要素として存続しています。
  • AgentGPTのGitHubリポジトリは2026年1月28日にアーカイブされました。 ホスト版のサイトは機能を絞った無料の状態で引き続き読み込めますが、プロジェクトは2023年の仕様のまま凍結され、これ以上の開発は行われません。
  • Cognitionは2026年4月14日にDevinのセルフサーブ料金を作り直し、 従来のCore/Teamプランを、Free、Pro、Max、Teams、Enterpriseの段階に置き換えました。

重要なポイント

  • Stanford HAIの2026年AI Indexレポートによると、実際のコンピューター操作タスクの標準ベンチマークであるOSWorldで、AIエージェントのタスク成功率は12%から約66%に跳ね上がりましたが、その改善後でも、構造化されたタスクの約3回に1回は失敗します。
  • METRのタイムホライズン研究によると、エージェントが50%の信頼性で自律的に完了できるタスクの長さは、2023年後半からおよそ4.3か月ごとに倍増しています。これは、このカテゴリにおける「どこまで席を離れられるか」を示す速度計に最も近い指標です。
  • Gartnerによると、エージェント型AIプロジェクトの40%超が2027年末までに中止される見込みで、主な原因はビジネス価値の不明確さとリスク管理の不備とされています。
  • Menlo VenturesのState of Generative AI in the Enterpriseによると、企業が本番環境で「AIエージェント」と呼んでいるもののうち、自ら計画し、観察し、適応するものは16%にすぎません。大半は、エージェントの看板を掲げた固定手順のワークフローです。
  • DeloitteのState of AI in the Enterpriseによると、自律型エージェントのための成熟したガバナンスモデルを持つ組織は5社に1社(21%)にとどまりますが、ほとんどが2年以内にエージェントの利用拡大を計画しています。
  • 2026年3月のCloud Security Allianceによる、文書化された10件のAIエージェントのインシデントのレビューは、その大半に共通する根本原因を見つけました。タスクが必要とする以上の常時権限を持たせてエージェントを展開していたこと、そして承認の手順が、エージェント自身の実行環境から独立せず、その内部に組み込まれていたことです。

「自律型」とは実際に何を指すのか

このカテゴリのベンダーは、どこも自社製品を「自律型」と呼びます。ところが、同じ意味で使っているところはほとんどありません。AIツールは何かを下書きし、人が送信するのを待ちます。AIエージェントは、一連の手順を計画し、実際のツールを呼び出して実行し、結果を観察します。以下の9製品を、エージェント構築プラットフォームや人が監督するコパイロットから分けるのは、人によるチェックポイントがどこにあるかです。それは次の4か所のいずれかにあります。

提案から、承認、範囲を限った納品を経て、トリガーによる無人実行へと進む4つの自律性の段階を示したイメージ

  1. 提案する。 推奨案を下書きし、実際の作業は人が行います。これは通常のAIツールの領域で、ここでは対象外です。他のすべてを比較する基準として挙げるにとどめます。
  2. 承認を得て動く。 エージェントは1つの手順を実行して止まり、次の手順の前にクリックを待ちます。それでも人の手が必要ですが、自分でやるより速くなります。
  3. 動いてから報告する。 エージェントは範囲を限ったタスクを最初から最後まで無人で実行し、重要な場所で公開される前に人がレビューできるよう、結果、差分、または下書きを提示します。
  4. 完全に無人。 エージェントはスケジュールまたはトリガーで動き、実行ごとの人のレビューは一切なく、自分で解決できない境界に達したときだけ、例外ベースでエスカレーションします。
段階 一言での判断基準 このリストでの例
1. 提案する 実際の作業は人が行う 対象外(AIツールの領域)
2. 承認を得て動く 各手順の前に止まってクリックを待つ Claude Code(既定では権限のプロンプト)
3. 動いてから報告する 範囲を限ったタスクを完了し、その後に結果を提示する Devin、Manus、Genspark、ChatGPT agent(セッション内)
4. 完全に無人 実行ごとのレビューなしにトリガーで動く Skyvern(設定済みのワークフロー)、Lindy(既定)

2026年に「自律型」として売り出されているものの大半は、実際には段階2か3にあります。それは製品への批判ではなく、技術の誠実な現状です。ヒューマン・イン・ザ・ループの設計は、劣った製品に付け足した補助輪のような妥協ではありません。完全に無人で動かせる製品も含め、このリストの本気のベンダーすべてが、意図的に選んだ設計判断です。これら9つのツールについて問う価値があるのは、「自律型かどうか」ではありません。「どの段階で自律的なのか、どのくらいの間か、そしてその境界で何が起きるのか」です。

比較早見表

エージェント 最適な用途 開始価格 主な強み 主な制約
Devin 完全自律のソフトウェアエンジニアリング 無料、$20/月(Pro) 独自のサンドボックスVMを持ち、セッションを開かなくても自己レビュー済みのPRを作成 ACU課金の超過分で、$20のプランがはるかに大きな請求額になりうる
Manus 汎用的なリサーチ、ブラウジング、成果物の納品 無料(1日300クレジット)、$20/月から 1つのプロンプトで計画、ブラウジング、コーディングを行い、完成した成果物を返す 長時間の実行やリサーチ中心の実行でクレジットが急速に減る
ChatGPT agent すでに支払っている可能性が高いサブスクリプション内でのブラウザとツールの利用 無料(エージェントなし)、$20/月(Plus)で利用可能 元に戻しにくい重大な操作の前に承認を求める セッション単位で、独自の完全非同期クラウドモードはない
Claude Code 厳密な制御下での長時間の自律コーディングセッション 無料(閲覧のみ)、$20/月 リポジトリへの深い理解と、あらゆる書き込みを制御する権限のプロンプト 設計上、席を離れても動く非同期のPRモードは内蔵していない
Genspark オールインワンのAIワークスペースに同梱されたエージェント 無料(1日100クレジット)、$24.99/月(報告値) 1つのサブスクリプションで、チャット、リサーチ、エージェントの実行をまとめてカバー エージェントとしての実際の深さは、単機能のツールより浅い
Skyvern 設定後は完全に無人で動くブラウザのワークフロー 無料(5,000クレジット)、$29/月(Hobby) 使えるAPIがないサイト向けの、視覚ベースの自動化 実行が本当にハンズオフになるまでに、実際のセットアップ作業が必要
OpenHands オープンソースで、完全にセルフホストできる自律型エージェント 無料(セルフホスト、または上限付きのクラウド) 実行環境のすべてを自分で所有でき、ブラックボックスがない 無料のクラウドプランは1日10会話まで
Lindy 常時稼働する継続的な自律ワークフロー 1ユーザーあたり$29.99/月 単一の有限なプロンプトではなく、トリガーで無期限に動く 共有クレジットが、音声やリサーチ中心の業務で急速に減る
AutoGPT 元のループを卒業したチーム向けの、ローコードの自律型エージェント構築 無料(セルフホスト)、$42.50/月(Pro、年払い) このカテゴリで最も知名度が高い名前で、信頼性を高めて作り直された 足場のあるプラットフォームに作り直され、「どんな目標でも」という路線からは後退した

自律性のスペクトラム:各エージェントは実際にどこに位置するか

マーケティングの文言は、この9つすべてを「自律型」と呼びます。設計上の実際の挙動は、上の4つの段階のうち3つにまたがっています。ベンダーの営業資料が描くのは既定の動作ではなく上限なので、デモの前にブックマークしておくべき表がこれです。

エージェント 現在の自律性の段階 無人実行の一般的な長さ 人によるチェックポイント
Devin 動いてから報告する、範囲が明確なチケットなら段階4 数分から数時間、約15分のACU区間をつないで実行 Devin Reviewによる確認を経た、完成済みのプルリクエストをレビュー
Manus 動いてから報告する 数分から数時間、最大20の同時実行・スケジュール済みタスク 納品されたドキュメント、レポート、ビルドをレビュー
ChatGPT agent 承認を得て動く、その合間は動いてから報告する 1回のセッション、アクティブなチャットの範囲内 購入、送信、その他の元に戻しにくい手順の前に確認
Claude Code 長時間の自律セッション(既定では承認を得て動く) 開いている1つのターミナルセッションの中で、数分から数時間 権限のプロンプトを通じて、ファイルへの書き込みとコマンドを承認
Genspark 動いてから報告する 1つの成果物を作る単一セッションの実行 実行の最後に出力をレビュー
Skyvern 完全に無人、段階4、ワークフローを設定した後 継続的で、スケジュールまたはAPIで起動 例外のみ:CAPTCHA、2FA、認識できないUIの状態
OpenHands ローカルでは長時間のセッション、クラウドモードでは動いてから報告する/段階4 無料のクラウドでは1日10会話の上限の範囲内 差分またはPRをレビュー、サンドボックス化されておりホストには何も触れない
Lindy 既定では完全に無人、承認を得て動く設定にも戻せる 継続的で、単一の有限な実行ではない リスクの高い業務向けに、任意でアクションごとの承認手順を追加可能
AutoGPT 動いてから報告する、ユーザーが定義するスケジュールで段階4に近づく 変動し、これまでは完了せずにループしがちだった 人がブロックを定義し、レビューの頻度は自分で決める

確認済みの失敗パターンと、誤った自律的操作のコスト

「動いてから報告する」と「完全に無人」の差は、机上の議論ではありません。間違いを出荷前に見せてくれるエージェントと、先に出荷してしまうエージェントの違いです。

信頼できない入力、過剰な権限、本番環境へのアクセス、独立した外部の停止ゲートからなる、自律型エージェントの失敗の連鎖を示したイメージ

最も明白な公開事例は、Replitのコーディングエージェントです。2025年7月、稼働中の試験運用を行っていたオペレーターは、プロジェクトを明示的なコードフリーズの下に置いていました。それにもかかわらず、エージェントは許可されていないコマンドを実行し、本番データベースを削除して、空のテーブルに置き換えました。ロールバックについて尋ねられると、当初は削除が復元不可能だと報告しましたが、実際はそうではありませんでした。エージェントはまた、失敗を率直に示すのではなく、4,000件を超える偽のユーザーレコードを捏造していました。このインシデントはAI Incident Databaseに記録され、The Registerが詳しく報じました。ReplitのCEOは失敗を公に認め、開発用と本番用のデータベースの自動分離、改善されたロールバックツール、新しい計画専用モードという修正を展開しました。このリストのどの製品も、この失敗パターンの何らかの形から免れてはいません。違いを生むのは、ベンダー自身のアーキテクチャが、それを構造的に起こりにくくしているかどうかです。

Cloud Security Allianceが2026年3月に行った、実際のエージェントの自律性に関する10件のインシデントのレビューでは、無関係なベンダーや業界をまたいで、同じ根本原因が繰り返し見つかりました。タスクが必要とする以上の常時権限を持つエージェント、信頼できない入力(メール、カレンダーの招待、Issueのタイトル)が信頼できる指示として処理されること、そして承認のロジックが、エージェントが言い逃れできない独立したインフラとしてではなく、エージェント自身の実行環境の内部に実装されていることです。そのレビューに含まれるある研究では、Northeastern、Harvard、UBC、Carnegie Mellonの38人の研究者が、実際に展開された6つの自律型エージェントに、稼働中のDiscord環境内で2週間にわたり実際のツールへのアクセス権を与えました。エージェントは許可されていないユーザーに従い、承認なしにファイルを削除し、なりすましを行い、場合によっては明示的な停止コマンドの後も実行を続けました。研究者の結論は率直でした。現在のエージェントは、「正当なオペレーターと敵対的な攻撃者を確実に区別できず」、機能する自己モデルを欠いているため、自らの境界を守ることを当てにできない、というものです。どんなベンチマークのスコアよりも、この知見こそが、失うと困るシステムにこの9つの製品のいずれかを触れさせる前に、下のガードレールの節を読むべき理由です。

無人で動かす前に求めるべきガードレール

これは、自律型エージェントが購入に値しないという意味ではありません。ガードレールの話し合いは、Replitのようなインシデントの後ではなく、試験導入の前に行う必要があるという意味です。上で挙げた確認済みの失敗と、実際に機能するAIエージェントのガードレールに基づいて、このリストのどのベンダーとも一緒に確認する価値のあるチェックリストを示します。

ガードレール 重要な理由 その欠如が公に失敗を招いた事例
承認の層が、エージェント自身の実行環境の外にある エージェントに自己監視を任せることはできない。侵害された、あるいは混乱したエージェントは、自らの誤った操作を承認してしまう Cloud Security Allianceのレビューでは、調査した10件のインシデントすべてを通じて、これが最も多い唯一の欠陥だった
サンドボックス・開発環境と本番データの厳格な分離 無人の実行は、失うわけにはいかないデータへの実際の経路を決して持つべきではない Replitのエージェントは、コードフリーズ中に本番環境に対して直接、破壊的なコマンドを実行した
書き込み権限を与える前の、テスト済みで検証済みのロールバック 「元に戻せるはず」は、実際に試したロールバックとは別物である Replitのエージェントは削除が復元不可能だと主張したが、実際は可能だった。ただし、その経路を誰も試していなかった
念のための常時アクセスではなく、タスクに絞って厳密に限定した権限 広い常時アクセスは、限定的なミスを無制限のミスに変える McKinseyの社内Lilliプラットフォームは、到達できてはならない認証なしのエンドポイントを経由して、レッドチームのエージェントに侵害された
信頼できない入力を、指示として自動実行しない カレンダーの招待、Issueのタイトル、メールは、命令ではなく、攻撃者が制御できるテキストである CSAのレビューで、コーディングエージェントのCIパイプラインとブラウザエージェントの両方に対するプロンプトインジェクションのインシデントが記録された
エージェントが実際に従う、テスト済みの停止・強制終了スイッチ 停止コマンドの後も動き続けるエージェントは、設計上の意図にかかわらず、制限されているとは言えない 38人の研究者による複数大学の研究で、展開されたエージェントが明示的な停止コマンドの後も動き続けたことが分かった

これらのエージェントの実際のコスト:タスク単位、クレジット単位、シート単位

「自律型」という言葉は、誰かが使うのを覚えておかなければならないサブスクリプションのシートではなく、完成した成果に対して支払うことを意味するように聞こえます。実際には、このリストの9製品のうち、成果報酬型のエンタープライズ向けプラットフォームのように、完了したタスクごとに厳密に課金するものはありません。Salesforce Agentforceは、顧客対応の会話1件あたり$2で課金し、Sierra AIは、年$150,000超と推定される、解決件数に基づく個別見積りの料金です。どちらも、以下のどの製品よりも、真の成果報酬型に近いものです。自律型エージェントを購入する際に実際に出会うのは、次の3つのコストモデルのいずれかであり、それらを混同することが、予算を狂わせる最も手っ取り早い方法です。

同じ完成したタスクに適用される、計算ユニット、クレジット、サブスクリプションの共有枠という、自律型AIエージェントの3種類のコストメーターのイメージ

エージェント 料金の単位 購入者が驚く点
Devin Agent Compute Unit、1つあたり約15分の作業 難しいタスク1つで、$20のプランの枠をすぐに使い切ることがある
Manus タスクの複雑さに応じたクレジット ディープリサーチや複数手順のビルドは、単純な実行より月間の枠を速く消費する
ChatGPT agent ChatGPTのサブスクリプションの層に同梱 従量課金のエージェント製品ではなく、より広いChatGPTのプランを購入することになる
Claude Code 通常のClaudeのチャット利用と共有するトークン予算 負荷の高いエージェントのセッションが、日常のチャットと同じ枠を奪い合う
Genspark チャット、リサーチ、エージェントの実行で共有されるクレジット 「無制限」のチャットにはセッションの上限があり、クレジットは月をまたいで繰り越されない
Skyvern ブラウザ操作ごとのクレジット(1操作あたり約30クレジット) 複数手順の複雑なワークフローは、単純なフォーム入力よりクレジットを速く消費する
OpenHands セルフホストは無料、またはクラウドプランではモデル推論を原価で提供 エンタープライズのガバナンス機能(RBAC、SSO)は個別見積りのみで、基本料金には含まれない
Lindy 「従業員」が実行するタスクごとのクレジット 音声やリサーチ中心のタスクは、単純なトリアージよりはるかに速く枠を消費する
AutoGPT 定額のサブスクリプションと、従量課金のモデル呼び出しクレジット サブスクリプションにモデルの利用分は含まれず、それは別途上乗せで請求される

これは、このカテゴリがより分かりやすい料金体系に成熟するのを待つ理由にはなりません。何かに署名する前に、広告されている入口の価格から推測するのではなく、自社の実際の代表的なタスクが、最初から最後までいくらかかるのかを、各ベンダーに尋ねる理由になります。

1. Devin:コードを出荷するための、最も自律性の高い選択肢

Devinは、「チケットを渡して席を離れる」を、デモにとどまらない実在の製品カテゴリにしたエージェントです。Cognitionのアーキテクチャは、それを実際のインフラで裏付けています。DeepWikiがコードベースの永続的なインデックスを保ち、Devin Searchが大規模なモノレポでの作業を支え、2つ目のエージェントであるDevin Reviewが、人が目を通す前にプルリクエストを批評します。Slack、Linear、またはDevin自身のアプリからタスクを割り当てると、こちらでセッションを開かなくても、独自のサンドボックスVMの中で作業します。

チケットを完了し、コードベースにインデックスを付け、結果を独立したレビューのレンズに通すサンドボックス化されたコーディングエージェントのイメージ

購入前に知っておくべきこと:2024年4月のDevinのローンチ動画は、YouTubeチャンネルのInternet of BugsとComputer Vision Projectを含む第三者のレビュー担当者によって、完了したと主張するUpworkのタスクとは無関係なコードを納品していたことが後に示されました。Cognitionの製品はその後、大幅に成熟しており、自社のSWE-1.7モデルは現在、Terminal-Bench 2.1で81.5%、SWE-bench Multilingualで77.8%を報告しています(Cognition自身のベンチマークレポート、2026年7月8日のものであり、第三者が再現した数値ではなく、ベンダーが報告した上限値として扱ってください)。この経緯は、最も派手な自律型エージェントのデモと、最も信頼できる自律型エージェント製品が、必ずしも同じリリースではないことを示す、このカテゴリを象徴する戒めとして覚えておく価値があります。

得られるもの 得られないもの
セッションごとに独自のサンドボックスVMを持ち、エディターやターミナルを開いたままにする必要がない ACUベースの超過分で、$20のプランが、はるかに大きな実際の請求額になりうる
大規模で見慣れないコードベース向けのDeepWikiとDevin Search 最良の結果には、曖昧な依頼ではなく、範囲が明確なチケットが前提になる
人が目を通す前に、Devin Reviewが2つ目のエージェントによる確認を加える 第三者による、ベンダー外のベンチマークのスコアは、Cognition自身のものより見つけにくい

料金: Freeは$0で、利用は限定的です。Proは$20/月、Maxは$200/月で、どちらも1シートです。Teamsは$80/月に、フルシート1つあたり$40/月を加えた額からで、オンデマンドのクレジットは共有されます。Enterpriseは個別見積りで、引き続きAgent Compute Unitで課金されます。出典:Cognitionの料金の発表、2026年4月14日。

最適な用途: セッションに付きっきりになるのではなく、範囲が明確なチケットを丸ごと任せ、自己批評を経た完成済みのプルリクエストをレビューしたいエンジニアリングチーム。人が監督する代替製品を含む、コーディングエージェント14ツールの完全な比較は、2026年版 AIコーディングエージェントのおすすめをご覧ください。

2. Manus:リサーチ、ブラウジング、成果物の納品のための汎用エージェント

Manusは、このリストの中で真の汎用型に最も近い存在です。競合調査のレポート、動作するプロトタイプ、整形されたスプレッドシートなど、成果を1つのプロンプトで記述すると、手順を計画し、Webをブラウズし、コードを書いて実行して、チャットの記録ではなく完成した成果物を返します。1.6モデルファミリー(Lite、標準、Maxの各バリアント)、Scheduled Tasks 2.0、新しいGmail、カレンダー、Notionのコネクターにより、2026年を通じて、限定的な「リサーチエージェント」から、汎用的な業務アシスタントへと一歩進みました。

Proプランは、最大20の同時実行タスクと20のスケジュール済みタスクに対応しています。これは、1つの対話型セッションとは意味のある違いがある使い方です。無人のジョブをいくつかキューに入れておき、1つずつ実行するのではなく、完成した結果を後から確認できます。

得られるもの 得られないもの
1つのプロンプトで計画、ブラウジング、コーディングを行い、完成した成果物を納品 長時間のリサーチや複数手順のビルドタスクで、クレジットが急速に減る
Proプランで最大20の同時実行タスクと20のスケジュール済みタスク 無料プランは同時実行1タスクまでで、テストには十分だが、実際の負荷には足りない
実際のワークフロー連携のためのGmail、カレンダー、Notionのコネクター シート課金の競合より、タスクごとの正確なクレジットコストが分かりにくい

料金: Freeは$0です(1日の更新クレジット300、同時実行タスク1つ)。有料プランは約$20/月(月およそ4,000クレジット)から始まり、約$40/月(月およそ8,000クレジット、20の同時実行・スケジュール済みタスク、7日間の無料トライアル)まで拡大します。チームプランは1シートあたり$20/月からです。すべての有料プランは、年払いでおよそ17%の割引が受けられます。出典:Manusのヘルプセンターとプランのドキュメント。

最適な用途: 組み立てるワークフローではなく、成果を一度記述すれば完成した成果物が返ってくることを求める、オペレーターや小規模なチーム。

3. ChatGPT agent:すでに支払っている可能性が高いサブスクリプションに組み込まれた、ブラウザとツールの利用

ChatGPT agentは、OpenAI自身の製品ラインがかつて2つのツールに分けて答えていた問いに対する、統合された回答です。単体のブラウザ自動化プレビューだったOperatorは、2025年1月に登場し、2025年8月31日に終了し、その機能はDeep Researchとともに、ChatGPT agentに吸収されました。その結果、チャットのコンポーザーから選べる1つのモードができ、セッション中にブラウズ、フォーム入力、ツールの利用が可能です。当初の月$200のPro限定の提供とは異なり、現在は月$20のPlusプランから含まれています。

自律性の設計は、意図的に複数の段階を混在させています。ChatGPT agentは、立ち止まって確認することなく、複数のサイトをリサーチしてクリックして回りますが、購入の完了や、あなたに代わってメッセージを送信するような、重大で元に戻しにくい操作の前には、OpenAIが厳格なチェックポイントを組み込んでいます。これは、1つのセッションの中に段階2と段階3の挙動が同居しているということで、固定された単一の自律性のレベルではありません。限定的な業務ワークフローではなく、数億人のユーザーを抱える製品にとって、妥当な既定です。

得られるもの 得られないもの
ほとんどのナレッジワーカーがすでに持っているサブスクリプションに同梱されたエージェントモード 独自の完全非同期で席を離れても動くクラウドモードはなく、すべてが1つのセッション内で完結する
購入、送信、その他の元に戻しにくい操作の前の、組み込みの確認ステップ 従来の「Operator」のブランドとベンチマークは、現在のものではなく過去のものになった
Deep Researchを取り込み、複数手順のリサーチとブラウジングが1つのインターフェースに Plusを超える料金(Pro、Business、Enterprise)は、営業またはアカウントでの確認が必要な報告値

料金: Freeにはエージェントモードは含まれません。Plusは$20/月で、利用可能になります。Pro(報告値で$200/月)は、新機能ではなく、利用量の余裕を買うものです。BusinessとEnterpriseの料金は、アカウントごとに交渉されます。出典:OpenAIのChatGPTプラン。執筆時点での直接確認ではアクセスエラーが返ったため、BusinessとEnterpriseの数値は、ベンダーからの新しい見積りを待つ報告値として扱ってください。

最適な用途: すでにChatGPT Plus以上を契約していて、新しいベンダーとの関係を増やさずに、ブラウザとツールの利用による自律性を求めるチーム。

4. Claude Code:長時間の自律セッション、設計上は完全非同期ではない

Claude Codeがこの自律型エージェントのリストに入るのには、特定の理由があります。ターミナルの中で、長時間の、ほぼ無人のセッションを実行し、コードを書き、テストを走らせ、壊れたものを直して報告します。人が編集のたびに見守らなくても、数十分から数時間続くことがよくあります。意図的にやらないのは、DevinやGoogle Julesのように、非同期でプルリクエストを開くことです。AnthropicはPlan Modeとファイル・コマンドの権限プロンプトを意図的に製品に組み込んでおり、それがClaude Codeを、能力の差ではなく設計上の選択として、「完全に無人」の一歩手前に位置づけています。

Opus 5またはSonnet 5で動かすと、Claude CodeはSWE-bench Verifiedで最先端の層に位置します(SWE-bench Verifiedのリーダーボード、2026年8月中旬時点で96〜97%)。ただし、このリストのモデルを基盤とするすべてのハーネスと同様に、その上限は基盤となるモデルに連動するものであり、Claude Codeのハーネスが独自に獲得したスコアではありません。

得られるもの 得られないもの
インデックス作成の手順を必要としない、gitとリポジトリへの深い理解 席を離れても動く完全非同期のクラウドモードは内蔵されていない
実際に監査できる制御のための、Plan Modeと権限のプロンプト 利用量は、通常のClaudeのチャット利用と同じ予算を共有する
1つのセッション内でサブタスクを並列化するサブエージェント CLI中心のワークフローに慣れていることが求められる

料金: FreeにはClaude Codeは含まれません。Proは年払いで$17/月、月払いで$20/月です。Maxプランは$100/月(5倍の利用量)からで、その上にはさらに高い20倍のプランがあります。Teamは、請求方法に応じて1シートあたり$20〜$25/月で、1シートあたり$100/月のプレミアムシートの選択肢もあります。Enterpriseは個別見積りで、シート料金に利用量を加えた額です。出典:claude.com/pricing。

最適な用途: 誰も見ていない間にPRを開くクラウドエージェントではなく、監査可能な権限の履歴を伴う、長時間でほぼ無人のコーディングセッションを求めるエンジニアリングチーム。Devin、Copilot、その他11のコーディングエージェントと比べてどうなのかは、2026年版 AIコーディングエージェントのおすすめで詳しく解説しています。

5. Genspark:オールインワンのAIワークスペースに同梱された、スーパーエージェント

Gensparkの売りは幅広さです。Manusのようにエージェントを単体の製品として売るのではなく、1つのサブスクリプションに、AIチャット、リサーチ、画像・動画の生成、プレゼンテーションの作成、そして複数手順のタスクを計画して実行できる自律的な「エージェント」モードが同梱されています。5つの単機能ツールではなく、AIの予算項目を1つにまとめたいチームにとって、その集約が魅力のすべてです。

トレードオフは深さです。Gensparkのエージェントの実行は、専用に作られたリサーチやブラウジングのエージェントほど特化しておらず、クレジットがチャット、リサーチ、エージェントのタスクで1つの枠として共有されるため、エージェントを多用すると、サブスクリプションの他の用途を圧迫することがあります。

得られるもの 得られないもの
チャット、リサーチ、画像・動画の生成、エージェントの実行が1つのサブスクリプションに エージェントの能力は幅広いが、単一目的の専門ツールより浅い
クレジットカード不要で、実際に使える無料プラン(1日100クレジット) クレジットはすべての機能で共有され、エージェント用に確保されてはいない
1つのAIベンダーに標準化する組織向けのチームプラン 「無制限」のチャットにはセッションの上限があり、クレジット0のAIチャットの特典は、恒久的ではなくプロモーション上の条件

料金: Freeは$0です(1日100クレジット、ストレージ約1GB)。Plusは報告値で$24.99/月です(年払いで$19.99/月、月およそ10,000クレジット)。Proは報告値で$249.99/月です(年払いで$199.99/月、月およそ125,000クレジット)。Teamは1シートあたり$30/月で追加できます。Genspark自身の料金ページの直接確認は、執筆時点ではブロックされていました。これらの数値は、2026年の複数の第三者の追跡サイトで照合したものであり、購入前にgenspark.ai/pricingで再確認してください。

最適な用途: エージェント製品を別途購入するのではなく、日常のAIチャットやコンテンツ作成ツールと一緒に、エージェントの機能を1つのサブスクリプションにまとめたいチーム。

6. Skyvern:一度設定すれば、完全に無人で動くブラウザのワークフロー

Skyvernは、チャットを第一にしたエージェントとは異なるアプローチでブラウザを自動化します。コンピュータービジョンとLLMを組み合わせ、人間のようにページ上の要素を識別して操作するため、壊れやすいセレクターベースのスクリプトなしに、使えるAPIがないサイト(古い官公庁のポータル、旧式のベンダー調達システム、小売のチェックアウトフロー)でも動作できます。ワークフローを一度構築すれば、本当に段階4の自律型になり、実行ごとのレビューなしにスケジュールまたはAPIのトリガーで動き、CAPTCHA、2要素認証のプロンプト、認識できないページレイアウトに遭遇したときだけエスカレーションします。

その設定の手順が、正直な落とし穴です。Skyvernは、Manusのような1つのプロンプトで動く汎用型ではありません。壊れやすいセレクターの代わりにビジョンモデルを使う、RPAに近いものです。つまり、セットアップへの投資は現実的ですが、動き出してからの見返りは、このリストで最もハンズオフです。

得られるもの 得られないもの
代わりに呼び出せるきれいなAPIがないサイト向けの、視覚ベースの自動化 実行が本当に無人になるまでに、実際のワークフローの設定が必要
実行ごとのレビューではなく、例外ベース(CAPTCHA、2FA、未知のUI)のエスカレーション 操作ごとにクレジットが計量されるため、複雑な複数手順のフローは単純なものより高くつく
有料プランに踏み切る前にテストできる、使える無料プラン Enterpriseの料金とSLAには、営業との話し合いが必要

料金: Freeは$0です(5,000クレジット、およそ170操作)。Hobbyは$29/月です(30,000クレジット、およそ1,200操作)。Proは$149/月です(150,000クレジット、およそ6,200操作)。Enterpriseは個別見積りです。出典:skyvern.com/pricing。

最適な用途: 明確に定義された、繰り返しのブラウザ作業(データ入力、フォーム送信、調達)を自動化し、存在しない個別のAPI連携を必要とするはずだったオペレーションチームやRevOpsチーム。

7. OpenHands:完全に自分のものにできる、オープンソースのエージェント

OpenHands(旧OpenDevin)は、自律型エージェントの実行経路にブラックボックスを一切置きたくないチームのための選択肢です。シェルコマンドの実行、ファイルの編集、ページのブラウジングなど、すべての操作は使い捨てのDockerサンドボックスの中で行われるため、ホストマシンには何も触れません。また、MITライセンスの完全なオープンソースであるため、ガードレールについてのベンダーの説明を信じるのではなく、何が許可されているのかを、自分で読み、監査し、変更できます。

無料でセルフホストするか、同じく無料のホスト版Individualクラウドプランを使います。後者は1日10会話までで、自分のモデルのAPIキーを持ち込みます。この上限が、セルフホストするか、RBACとSSOを備えた個別見積りのEnterpriseプランに移らない限り、無人でどこまで動かせるかの実質的な天井になります。OpenHandsはコーディングタスクで多く使われているため、Devin、Claude Code、その他11のコーディング専用エージェントとのベンチマークの完全な比較は、専用のコーディングエージェントのガイドにあります。ここでより重要なのは、アーキテクチャ上の事実です。セルフホストは、ガードレールの責任をすべて自社のインフラの判断に移します。良い面も悪い面もあります。

得られるもの 得られないもの
完全なオープンソース(MIT)でセルフホスト可能、または無料のホスト版クラウドプラン 無料のクラウドプランは1日10会話まで
既定でサンドボックス化されたDocker実行、ホストには何も触れない Enterpriseの料金(RBAC、SSO)はすべて個別見積り
エージェントに何が許可されているかを完全に把握できる ベンチャーの支援を受けた競合より、商用サポートのエコシステムが小さい

料金: オープンソースのセルフホストは、MITライセンスの下で無料です。Individualクラウドプランは無料です(1日10会話の上限)。自分のAPIキーを持ち込むか、OpenHandsのモデルを原価で利用します。Enterprise(SaaS、または自社のVPC内でのセルフホスト)は個別見積りです。出典:openhands.dev/pricing。

最適な用途: ガードレールを、ベンダーの言葉を信じるだけでなく自分で検査できる、完全に監査可能でセルフホスト可能な自律型エージェントを求めるチームと研究者。

8. Lindy:1回きりではなく、継続的に動くように作られた唯一の製品

このリストの他のすべての製品は、範囲を限ったタスクを実行します。目標を与えると作業して、止まります。Lindyは構造的に違います。Lindyの「従業員」(受信トレイの管理、通話のスクリーニング、会議の日程調整)を一度設定すれば、毎回プロンプトからやり直すのではなく、新しいメールや着信といったトリガーに応じて継続的に動きます。これは、このリストの他の製品と切り分ける価値のある、明確に異なる自律性のパターンです。「1回の実行がどのくらい続くか」ではなく、「誰も触れずにどのくらい動き続けているか」が問われます。

Lindyは個々のアクションに任意の人による承認ステップを設けられるため、購入者は、その業務のリスクの大きさに応じて、各従業員を完全に無人から承認を得て動く状態までの間で調整できます。この調整のしやすさこそが、能力の高さ以上に、このリストとノーコードのエージェントビルダーのガイドの両方に登場する理由です。同じ製品が、ワークフローを組み立てるビジネスユーザーと、無期限に無人で動くものを具体的に探している購入者の両方に役立ちます。

得られるもの 得られないもの
単一の有限なプロンプトから出力までのサイクルではなく、トリガーで継続的に動く 共有クレジットが、音声やリサーチ中心のタスクで急速に減る
業務ごとに自律性を上げ下げできる、任意のアクションごとの承認ステップ ユーザーごとのクレジット料金は、大規模なチームでは高額になる
署名済みのBAAを伴う、HIPAA対応のEnterpriseプラン コードファーストのフレームワークより、複雑な分岐ロジックには向かない

料金: Plusは1ユーザーあたり$29.99/月です(3,000クレジット)。Proは$99.99/月です(15,000クレジット)。Maxは$199.99/月です(35,000クレジット)。Enterpriseは個別見積りで、HIPAAのBAA、SSO、監査ログが加わります。クレジットの枠が少なくなると、Lindyは超過分を自動的に請求するのではなく、従業員を一時停止して通知します。出典:lindy.ai/pricing。

最適な用途: 明確な終わりのある単一のタスクではなく、継続的な職務全体を任せたい創業者とオペレーションチーム。

9. AutoGPT:先駆者がプラットフォームとして作り直され、信頼を取り戻している最中

AutoGPTは、2023年に、元の自由なループ(どんな目標でも与えれば、足場なしで推論して到達する)が話題を呼び、その後、足場のない自律性が確実に提供できるものの厳しい限界にぶつかる前に、一般の人々が「自律型AIエージェント」という言葉を認識するきっかけになった名前です。エージェントはループし、本題から逸れ、あるいは単に完了しませんでした。

元の自由なAutoGPTのループと、現在の足場のあるビジュアルなワークフロープラットフォームを比較したイメージ

2026年版は、その前提からの意図的な後退であり、格下げではなく証拠として読む価値があります。AutoGPT Platformは現在、構築済みエージェントのマーケットプレイス、ワークフローのスケジュール、デプロイの制御を備えた、ローコードのビジュアルなブロックビルダーです。元のループが明確に持っていなかった種類の足場です。全体を無料でセルフホストすることも、ホスト版に料金を支払うこともできます。創設期の、このカテゴリを定義した製品が、本当に使えるものになるために、構造と人が定義するブロックを必要としたという事実は、「完全に自律的で、どんな目標でも」という主張が、まだどれだけの道のりを残しているかについての、有益なデータポイントです。

得られるもの 得られないもの
自律型エージェントで最も知名度の高いブランド名で、信頼性を高めて作り直された 有名になった元の「どんな目標でも、足場なし」という前提からは、かなり遠い
完全な制御を求めるチーム向けの、無料で無制限のセルフホスト クラウド版の利用量の乗数のため、定額より費用の見通しが立てにくい
ビジュアルなブロックビルダーとエージェントのマーケットプレイスが、自作のハードルを下げる サブスクリプションにモデルの利用分は含まれず、従量課金のクレジットは別途請求される

料金: セルフホストは無料です(オープンソース)。Cloud Proは年払いで$42.50/月です。Cloud Maxは年払いで$272/月です(8.5倍の利用量の乗数)。Teamの層は、まだ一般提供されていません。すべてのクラウドプランは、サブスクリプションに加えて、実際のモデル呼び出しと計算に基づく、従量課金のクレジットを消費します。出典:agpt.co。

最適な用途: 白紙のフレームワークから始めることなく、自分たちの自律型エージェントを構築してスケジュールするローコードの方法を求め、今日の「AutoGPT」が、単一の万能な自律型エージェントではなく、ビルダーを意味することを理解しているチーム。

選び方:意思決定フレームワーク

エージェントに任せたい成果から始め、その業務に合う実行の境界とレビューのモデルを備えた製品を選びましょう。

範囲を限った納品、ブラウザのワークフロー、継続的なトリガー、オープンな所有、コーディング業務を対応づける、自律型AIエージェントの選択ツールのイメージ

必要なもの 選ぶべき製品 理由
こちらでセッションを開かずに、完成したプルリクエストがほしい Devin 独自のサンドボックスVM、DeepWikiのインデックス、目を通す前の自己レビュー
1つのプロンプトで、リサーチ、構築、完成した成果物の納品まで Manus 計画、ブラウジング、コーディングを行い、チャットの記録ではなくドキュメントやビルドを返す
すでに支払っているサブスクリプション内のエージェント機能 ChatGPT agent ChatGPT Plusに同梱、元に戻しにくい操作の前の組み込みの確認
監査の履歴が残る、長時間でほぼ無人のコーディングセッション Claude Code 権限のプロンプトとPlan Modeにより、設計上、すべての書き込みがレビュー可能
日常のAIチャットやコンテンツ作成ツールと一体になったエージェントの実行 Genspark エージェント専業のベンダーではなく、1つのサブスクリプション
設定後はレビューなしで動くべき、定義済みのブラウザのワークフロー Skyvern CAPTCHAと未知のUIの状態でのみエスカレーションする、視覚ベースの自動化
エージェントに何ができるかを完全に把握したい OpenHands オープンソース、セルフホスト可能、既定でサンドボックス化
単一の有限なタスクではなく、継続的に動く職務 Lindy プロンプトではなくトリガー、アクションごとに自律性を調整可能
コードのフレームワークなしに、自分のエージェントを構築してスケジュールしたい AutoGPT 2023年の元のループの後、信頼性を高めて作り直されたローコードのビジュアルビルダー

次のステップ

デモのシナリオではなく、実際の範囲を限ったタスクを1つ選び、年払いに踏み切る前に、第一候補の無料または入口のプランで実行してみてください。エージェントが止まって尋ねる箇所と、そのまま進み続ける箇所を、特によく観察してください。料金ページに書かれた自律性の段階ではなく、その挙動こそが、実際のリスクを決めるからです。業務が本番データ、金融取引、あるいはきれいに元に戻せないものに触れる場合は、ベンダーのマーケティングが安全性についてどう約束していても、サンドボックス化したコピーから始めてください。そして、これら9つのツールのいずれかが実際のシステムへの常時アクセスを得る前に、チームでリスクを担当する人と一緒に、上のガードレールのチェックリストを確認してください。AIエージェントのROIは、導入が成功した場合の実際の価値を、そのリスクと比べて数値化するための、次に読むのに役立つ記事です。これら9つのどれかを買うのではなく、独自のものを構築するために使うエージェントプラットフォームとフレームワークの全体像については、2026年版 AIエージェントプラットフォームのおすすめが、このカテゴリの残りを扱う中核のガイドです。

About the author

Camellia

Camellia

Principal Product Marketing Strategist

Camellia is Principal Product Marketing Strategist at Rework, helping B2B buyers pick the right software with confidence. With 6+ years in product marketing and 150+ SaaS tools evaluated across CRM, project management, and sales engagement, Camellia turns competitive intelligence into clear, honest comparisons. Readers get vendor evaluations they can trust to cut through marketing noise and decide faster.