2026年版AIブラウザエージェント比較:APIのないサイトを自動化する11ツール

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
2026年8月更新。APIが使えない実在のウェブサイトにログインして複数ステップの作業をやり遂げる必要があるエンジニアリングチームには、Browser UseとSkyvernが最適なAIブラウザエージェントです。すでに支払っているサブスクリプションに、同じ機能の軽量版をまとめて使いたい場合は、Claude in ChromeとGoogleのAuto Browseのほうが向いています。本ガイドでは、実在する11のエージェントとその下のインフラ層を、各製品がページを実際にどう認識するか(DOM要素かスクリーンショットか)、作業中に誰がログイン認証情報を保持するか、対象サイト自身のボット対策が導入にとって何を意味するかという観点でランク付けしています。料金は2026年8月に、ベンダーのページで直接確認しました。
これは「AIエージェントプラットフォーム」よりも対象の狭いカテゴリーです。AIエージェントプラットフォームのおすすめで扱ったようなプラットフォームは、CRMのAPIを呼び出したりwebhookを起動したりしますが、ブラウザエージェントは、対象サイトにAPIがまったくないために、人が使うのと同じChromiumのウィンドウを実際に操作します。この制約があるため、このカテゴリーは過去18か月間、AIの他のどの領域よりも激しく入れ替わりました。OpenAIは2025年1月以降、2つの異なるブラウザ製品を投入して終了させ、Googleは2026年5月に自社の研究プロトタイプを終了して、その機能をChromeに直接組み込みました。残っているのは、まさにこの用途のために作られたスタートアップと、薄いバージョンをサブスクリプションにまとめて提供する基盤モデルのベンダーの混在です。両者が土台にしている定義についてはAIエージェントとはを、自律的に動くのではなく人を支援する単機能のAIソフトウェアについては2026年版AIエージェントのおすすめをご覧ください。
重要なポイント
- Akamaiのグローバルネットワークでは、2025年7月から12月のAIボットトラフィックの47.9%がコマースサイトに向かい、単独で最大の標的カテゴリーとなりました。アジア太平洋地域だけでも、同じ期間にボット活動が63%急増しています(Akamaiの2026年のエージェント型不正に関する調査による)。
- 調査対象の組織の57.3%が、すでにAIエージェントを本番環境で運用していますが、エージェントを増やすうえで最も多く挙げられた障壁は、タスクを正しく完了する正確さと一貫性を指す「品質」で、レイテンシーやセキュリティを上回っています。出典は、1,340人以上の実務者を対象にしたLangChainのState of Agent Engineering調査です。
- 大企業の4社に1社近く(24.9%)が、セキュリティ上の懸念をエージェント導入の最大の障害に挙げており、全規模の平均を大きく上回っています(同じLangChainの調査による)。ログインセッションを握るのはブラウザエージェントであるため、この差は、他のほとんどの種類のエージェントより重要です。
- Gartnerは、エージェント型AIプロジェクトの40%超が2027年末までに中止されると予測しており、事業価値の不明確さとリスク管理の不備を理由に挙げています。無人で動くブラウザエージェントがチャットボットより売り込みにくい理由も、この2つの要因です。
- 自社開発ではなく、既製のAIソリューションを購入する企業は、2024年の53%から2025年には76%に増えました(Menlo VenturesのState of Generative AI in the Enterpriseによる)。目的に特化したエージェントが自作スクリプトに勝つ、このようなカテゴリーを直接貫く変化です。
- WebArenaベンチマークでは、人間のテスターが固定されたテストサイトでウェブタスクを正しく完了する割合は78.24%です。2023年の初期のGPT-4ベースのエージェントのベースラインは14.41%で、2026年に公表された最良の研究システムでも71.2%にとどまります(WebArenaをもとにした、より新しい研究による)。これは、各ステップの信頼性が長いタスクの中で積み重なって生じる差です。
比較早見表
| ツール | 最適な用途 | 開始価格 | 主な強み | 主な制約 |
|---|---|---|---|---|
| Browser Use | オープンソースでモデルに依存しない基盤を求めるエンジニアリングチーム | 無料のオープンソース。Devは$29/月 | 無料でセルフホストでき、マネージドクラウドで拡張でき、どのLLMでも動作する | 洗練されたノーコードのインターフェースはない |
| Skyvern | 組み込みの認証情報の保管庫、2FA、CAPTCHA処理を必要とするチーム | 無料(5,000クレジット/月)。Hobbyは$29/月 | 画像ベースで、DOMセレクターに頼らずに動作する | 本格的な認証機能には、$149/月のProプランが必要 |
| Browserbase + Stagehand | マネージドインフラ上で、Playwrightの精度とAI推論の両方を求める開発者 | 無料。Developerは$20/月 | マネージドのセッションインフラ上で使える、無料のオープンソースSDK(Stagehand) | プロキシとブラウザ時間の超過分が、規模が大きくなると急速に膨らむ |
| Steel.dev | CAPTCHA解決の枠が充実した、オープンソースに親和的なインフラ | 無料($30の一回限りのクレジット)。Scaleは$250/月 | 無料プランでも、CAPTCHA解決の枠が大きく含まれる | CAPTCHA解決とプロキシを使うには、$10のデポジットが必要 |
| Hyperbrowser | 料金でインフラ事業者を比較する、予算重視のチーム | 約$30/月(報告ベース、未検証) | クレジット単位の料金モデルが公開され、透明性が高い | ベンダーの料金ページが表示されず、直接の確認ができなかった |
| Axiom.ai | コードを書く代わりにフローを記録したい、非技術系のチーム | 無料トライアル。Starterは$15/月 | ノーコードのレコーダー、2FAのサポート、デスクトップの同時実行数が無制限 | 固定シーケンスのレコーダーであり、適応的に推論するエージェントではない |
| Claude in Chrome | すでにClaudeを使っていて、慎重なブラウザアシスタントを求めるナレッジワーカー | Claude Proに含まれる(年払いで$17/月) | 購入や元に戻せない操作の前に、一時停止して確認する | ログイン済みのブラウザ拡張機能のみで、ヘッドレスのAPI製品ではない |
| Amazon Nova Act | 本番のUIワークフローを大規模に自動化する、AWSネイティブなチーム | エージェント1時間あたり$4.75 | UIの信頼性のために特化して作られた、垂直統合のモデル | 時間単位の課金のみで、提供開始時点では1つのAWSリージョンのみ |
| Google(Gemini Auto Browse) | Chrome内でタスクを任せたい個人とWorkspaceユーザー | Google AI Pro/Ultraに含まれる | 実際にログイン済みのブラウザで動作し、承認を求める | 個人向け機能のみで、APIアクセスはなく、米国でのプレビュー |
| OpenAI(ChatGPT、Atlas以後) | すでに契約しているプランにブラウザタスクが含まれてほしいChatGPTユーザー | ChatGPT Plusに含まれる($20/月) | 現在はChatGPTのメインの画面に統合されている | 18か月で3つの製品名。まず現在の機能を確認すること |
| DIY:Playwright + 自作ループ | どのパッケージ型エージェントにも合わないワークフローを持つエンジニアリングチーム | 無料のフレームワーク。モデル呼び出しとホスティングの費用がかかる | 信頼性、セキュリティ、コストを完全に制御できる | リトライのロジックとガードレールを、自分で構築し保守する |
2026年にAIブラウザエージェントを選ぶには
この分野を検討するチームの多くは、何を買おうとしているのかを理解する前に、デモを見て選んでしまいます。ベンダーを比較する前に、ブラウザエージェントに固有の4つの問いに取り組んでください。チャットボットや社内ツール向けのエージェントを買う場合とは、同じようには出てこない問いです。

1. DOMを見ているのか、スクリーンショットを見ているのか
DOMベースのエージェントは、ページの内部構造、つまりHTML要素やアクセシビリティツリーを読み取って、何をクリックするかを判断します。構造のしっかりしたサイトでは高速かつ正確で、Browser UseとStagehandがこれを標準にしているのもそのためです。ただし、予測できる2つの形で破綻します。canvasや重いクライアントサイドレンダリングの背後に実際のコンテンツを隠しているサイトと、自動化を難しくするために意図的にマークアップを難読化しているサイトです。
画像ベースのエージェントは、人と同じように、描画されたスクリーンショットを見て、見えたものに基づいてどこをクリックするかを決めます。Skyvernの訴求はすべてここにあります。セレクターを解析しないため、見たことのないサイトでも、クラス名が変わっても壊れずに動作できます。トレードオフは速度と精度です。見た目が似た2つのボタンを、画像モデルが押し間違えることがあり、実際の要素を読むDOMベースのエージェントなら起こりえない失敗です。
現在では、本格的なエージェントの多くが両方を使っています。Stagehandのact、observe、extractというプリミティブは、標準ではDOMで動作し、構造だけでは判断がつかないときに画像モデルへフォールバックします。Amazon Nova Actは、自社のアプローチを、単一の技術ではなく、オーケストレーターとブラウザアクチュエーターをまたいでエンドツーエンドで訓練された、垂直統合のモデルと説明しています。どのベンダーにも、どちらが標準でどちらがフォールバックかを尋ねてください。その答えが、自社で起きる失敗の姿を予測するからです。
2. 誰が実際にログイン認証情報を保持しているのか
ほとんどのチームが、問題が起きるまで見落としている問いです。実際のアカウントにログインするブラウザエージェントは、自らそう謳っているかどうかにかかわらず、認証情報を扱う製品であり、このリストのベンダーは、大きく異なるアプローチを取っています。
| ツール | ログインの仕組み | 注目点 |
|---|---|---|
| Browser Use | セッションCookieはBrowser Use Cloudのプロジェクト内に保持される。オープンソースのライブラリをセルフホストすれば、すべてをローカルに保てる | ベンダー側の認証情報の保管庫はなく、シークレットは自分のコードで管理する |
| Skyvern | 2FA/TOTPに対応した保存済み認証情報。Proで1Password連携、EnterpriseでBitwardenとAzure Key Vaultに対応 | このリストで最も明確な認証情報管理の機能セット |
| Browserbase | 永続的な認証状態(「Contexts」)をセッション間で再利用し、実行のたびに再認証しなくて済む | セッションデータの保持期間は、FreeとDeveloperで7日、Startupで30日 |
| Axiom.ai | 2FA/TOTPのサポートが、Starterを含むすべてのプランに含まれる | 人が一度ログインを記録し、それを再生するように作られている |
| Claude in Chrome | 「購入、金融取引、その他の元に戻せない操作」の前に一時停止する。Permissions Modeでは、サイトを1つずつアクセス許可する | Anthropic自身のガイダンスは、銀行、健康記録、認証情報を伴うものには使わないこと |
| Amazon Nova Act | ベンダー側の認証情報ストアではなく、AWSアカウントのIAM権限とコンソールアクセスのもとで動作する | 個人のログインではなく、本番ワークフローでの限定的なサービスアカウントの利用を想定している |
| Google Auto Browse | 個人のGoogleアカウントでChromeにサインインする必要がある。タスクを完了する前に承認を求める | 18歳以上に限定、オプトイン、執筆時点では米国のみ |
注目すべきパターンがあります。無人の本番利用向けに作られたツール(Skyvern、Nova Act)は、認証情報を、保管庫に入れて範囲を絞るインフラとして扱います。一方、個人自身のブラウジングセッション向けに作られたツール(Claude in Chrome、Auto Browse)は、人の承認のために一時停止する方式に頼っています。どちらのアプローチも間違いではありませんが、後者の種類を前者の種類の仕事に使うと、つまり、誰かの個人のSSOセッションの上で、無人の夜間ジョブを動かすと、ブラウザエージェントがセキュリティインシデントになります。AIエージェントのセキュリティでは、エージェントの脅威モデリングと最小権限のアクセスをより詳しく扱い、AIエージェントのガードレールでは、エージェントに何を指示しても守られるべき厳格な制限を扱っています。
3. 対象サイト自身の防御は、自社にとって何を意味するのか
CAPTCHAとボット検知のシステムは、サイトが標準では自動化されたくないために存在します。このリストの複数のベンダーは、それらの仕組みを突破することを有料の機能として販売しています。SkyvernのAdvancedのCAPTCHAソルバーはProプランの背後にあり、SteelとHyperbrowserは、どちらもCAPTCHAの解決をクレジットで計測します。その機能が存在することは、それを使うことが許容されるかどうかを決めるものではありません。ほとんどの商用サイトの利用規約は、何らかの形で自動アクセスを制限しており、技術的に成功したワークフローであっても、対象サイトの規約に違反するなら、それは自社のチームが負う事業上、法務上の判断であり、エージェントの能力が代わりに下してくれるものではありません。自社で管理するアカウント以外を自動化する前に、対象サイトの規約を読み、CAPTCHA解決の費目は、ベンダーの表示する開始価格にほとんど含まれていないため、別枠で予算化してください。
4. 信頼性95%のエージェントが、なぜ半分は失敗するのか
失敗が積み重なるからです。エージェントが個々のステップ(入力欄を見つける、値を読み取る、ボタンをクリックする)を95%の確率で成功させるとして、20ステップのタスクを最初から最後まで正しく完了できる確率は、およそ0.95の20乗、約36%です。これは特定のベンダーの欠陥ではなく、算数です。ベンチマークと本番の差が実際にこれほど大きい理由でもあります。WebArena自身が公表した2026年の数字では、最も強い研究システムが71.2%で、それはページが動かず、セッションも切れない、固定されたセルフホストのテスト環境での結果です。実際の対象サイトには、レート制限、レイアウトの変更、ポップアップ、セッションのタイムアウトがあり、ベンチマークが扱わなくてよいものです。これに備えるには、1回の長い無人の実行が自力で正しく完了することを信頼するのではなく、長いワークフローを、各ステップの間に人が確認する短い段階に区切ってください。
個別の解説に入る前にもう1点あります。上の表の価格のほとんどは、請求額の全体ではありません。ブラウザ時間、プロキシの帯域、CAPTCHAの解決は、ここにあるほぼすべてのインフラベンダーで、基本サブスクリプションとは別に計測され、請求されます。表示価格だけでなく、各解説の従量料金に照らして、実際のタスク量で試算してください。
規模とペルソナの表
| ツール | 最適な規模 | 主な購入者 |
|---|---|---|
| Browser Use | セルフホストするか、段階的に拡張したい、あらゆる規模のエンジニアリングチーム | バックエンドエンジニア、AI/MLエンジニア |
| Skyvern | 多数のサードパーティのアカウントにまたがってログインを自動化するチーム | 自動化リード、RevOpsエンジニア |
| Browserbase + Stagehand | エージェント機能をリリースするプロダクト・エンジニアリングチーム | フルスタック開発者、創業エンジニア |
| Steel.dev | オープンなインフラの代替を求めるエンジニアリングチーム | プラットフォームエンジニア、DevOpsリード |
| Hyperbrowser | 大量のセッションを実行する、コストに敏感なチーム | グロースエンジニア、データエンジニア |
| Axiom.ai | エンジニアリングのリソースがない、小規模チームとソロの運営者 | 運用マネージャー、マーケター、創業者 |
| Claude in Chrome | すでにClaudeに支払っている、個人のナレッジワーカー | アナリスト、リサーチャー、運用ジェネラリスト |
| Amazon Nova Act | AWSネイティブなプラットフォーム・自動化チーム | クラウドエンジニア、自動化アーキテクト |
| Google Auto Browse | Google AI Pro/Ultraを使う個人とWorkspaceユーザー | 個人の消費者、Workspaceのパワーユーザー |
| OpenAI(ChatGPT) | ブラウザタスクが含まれてほしいChatGPT Plus/Proのユーザー | 個人のナレッジワーカー |
| DIY:Playwright + 自作ループ | 標準的でない、あるいは重要度の高いワークフローを持つエンジニアリングチーム | シニアエンジニア、プラットフォームチーム |
1. Browser Use:エンジニアリングチームのオープンソースの定番
Browser Useの訴求はひとえに、エージェント層が特定のベンダーのモデルや、特定のベンダーのインフラに縛られるべきではないという点にあります。オープンソースのPythonライブラリは、ページのインタラクティブな要素を簡略化した表現(主にDOMベース)で読み取り、その構造だけでは次のアクションが決まらないときに、画像モデルへフォールバックします。指定したどのLLMでも動作し、OpenAI、Anthropic、Gemini、あるいはセルフホストのモデルが使えます。
この柔軟性こそ、多くのエンジニアリングチームの評価で、出発点の標準として登場する理由です。コアのライブラリは、サブスクリプションなしで、自社のインフラ上で無料で実行でき、同時実行数や、自分で運用したくないセッションインフラが必要になってから、マネージドクラウドに移ればよいのです。
| 得られるもの | 得られないもの |
|---|---|
| 無料のオープンソースのコアライブラリで、任意のLLMを使ってセルフホストできる | 非エンジニア向けの、洗練されたノーコードのインターフェースはない |
| セルフホストの限界を超えたら、$29/月からのマネージドクラウドのプラン | プロキシとセッションの費用は、プラン価格とは別に請求される |
| モデルに依存せず、特定のAIベンダーのロードマップに縛られない | 画像へのフォールバックは補助的で、主たる操作方法ではない |
料金: 無料(エージェントタスク10件/月、同時セッション3つ)、Pay As You Go($5からのクレジット、サブスクリプションなし)、Devは$29/月($290/年)、Businessは$299/月($2,990/年、同時セッション200)、Scaleupは$999/月($9,990/年、同時セッション500)、Enterpriseは個別見積り。従量料金:クラウドブラウザセッションは$0.02/時間、マネージドのレジデンシャルプロキシは$5/GB(Scaleupでは$4/GB)。出典:browser-use.com/pricing。
最適な用途: ベンダーロックインなしに、無料で実行することも、マネージドクラウドで拡張することもできる、オープンソースでモデルに依存しない基盤を求めるエンジニアリングチーム。
2. Skyvern:本格的な認証情報の保管庫を備えた、画像ベースの操作
Skyvernは、DOMベースのエージェントが苦手とする問題を解決するために、画像ベースの操作を前面に出しています。見たことのないサイトで、ベンダーがページを再設計した途端に壊れる脆いセレクターに頼らずに動作するというものです。それに加えて、このリストで最も充実した認証情報の処理機能を備えています。保存済みの認証情報、2FAとTOTPのサポート、1PasswordとBitwardenとの直接連携で、自社のプロダクトを自動化するのではなく、十数のベンダーのポータルにログインするのが実際のユースケースなら重要です。
コアのエンジンはAGPL-3.0のオープンソースで、マネージドプラットフォームのサポートやCAPTCHA解決が不要なら、セルフホストして、自社のインフラとLLMの利用料だけを支払うことができます。
| 得られるもの | 得られないもの |
|---|---|
| レイアウトの変更や未知のサイトに強い、画像ベースの操作 | 高度なCAPTCHA解決と本格的な認証連携には、$149/月のProが必要 |
| 2FA/TOTP、1Password、Bitwardenに対応した保存済み認証情報 | 無料プランは、同時実行1つに制限されている |
| セルフホストできるオープンソースのコア(AGPL-3.0) | HIPAAとSOC-2の機能はEnterprise限定で、個別価格 |
料金: Freeは$0/月(5,000クレジット、同時実行1つ)、Hobbyは$29/月(30,000クレジット、同時実行10、基本のCAPTCHAソルバー、保存済み認証情報)、Proは$149/月(150,000クレジット、同時実行25、高度なCAPTCHAソルバー、2FA/TOTP、1Password連携、レジデンシャルプロキシ)、Enterpriseは個別見積り(同時実行100、HIPAA、SOC-2、Azure Key Vault、Bitwarden、human in the loop)。出典:skyvern.com/pricing。
最適な用途: 認証情報の保管庫、2FAのサポート、CAPTCHAの処理が組み込まれていることを求めるチーム。特に、自社のプロダクトではなく、サードパーティのベンダーや顧客のアカウントにログインする場合。
3. BrowserbaseとStagehand:Playwrightの精度とAI推論層の組み合わせ
Browserbaseはインフラを販売しています。マネージドのヘッドレスChromiumセッション、実行をまたぐ永続的な認証状態(「Contexts」機能)、プロキシ管理、CAPTCHA解決です。Browserbaseが構築し保守する、無料のオープンソースSDKのStagehandは、その上の制御層を提供し、固定のセレクターではなく判断を要するステップのためのAIプリミティブとともに、Playwrightレベルの決定論的なコマンド(act、observe、extract)を開発者に提供します。
この組み合わせは、このリストの中で、「本物のコードを書き、推論は本当に必要なところだけに任せる」という考え方に最も近いものです。Stagehand自体はインフラに依存せず、LangChainやCrewAIなどのフレームワークに組み込めますが、Browserbaseのマネージドセッション上で動かすのが、ゼロから動くエージェントにたどり着く最短の道です。
| 得られるもの | 得られないもの |
|---|---|
| Playwrightレベルの精度を持つ、無料のオープンソースのStagehand SDK | 非技術系のチームには、組み込みのノーコードのインターフェースがない |
| 実行のたびに再認証しなくて済む、永続的なセッションContexts | ブラウザ時間とプロキシの超過分($0.10〜0.12/時間、$10〜12/GB)が、規模が大きくなると膨らむ |
| 自前のブラウザファームを運用しなくて済むマネージドインフラ | データ保持期間の7日は、FreeとDeveloperのみ |
料金: Freeは$0(同時ブラウザ3つ、ブラウザ1時間、エージェント実行3回、プロキシなし)、Developerは$20/月(同時25、ブラウザ100時間、超過分は$0.12/時間、プロキシ1GB、超過分は$12/GB)、Startupは$99/月(同時100、ブラウザ500時間、超過分は$0.10/時間、プロキシ5GB、超過分は$10/GB、データ保持30日)、Scaleは個別見積り(同時250以上、HIPAA/DPA、SSO)。出典:browserbase.com/pricing。
最適な用途: 欲しいときは決定論的でPlaywrightレベルの制御を、そうでないときはAI推論を使いたい、自ら運用しなくてよいマネージドインフラ上で動かしたい開発チーム。
4. Steel.dev:CAPTCHAが組み込まれた、オープンソースに親和的なインフラ
Steelは、Browserbaseと同じインフラの役割を担います。マネージドのヘッドレスブラウザセッション、プロキシ、CAPTCHA解決を提供しますが、オープンソースに親和的な無料プランにより重点を置いています。Launchプランの一回限りの$30のクレジットで、約300ブラウザ時間、3GBのプロキシ帯域、約10,000回のCAPTCHA解決をまかなえます。CAPTCHAを多用するワークフロー向けとしては、料金を支払う前に使える無料枠が、ほとんどの競合より大幅に大きくなっています。
注意点は、$10のデポジットの条件です。CAPTCHA解決とSteel提供のプロキシは、それを追加するまで無料プランでは有効にならず、表示価格を比較するときに見落としやすい点です。
| 得られるもの | 得られないもの |
|---|---|
| 一回限りの無料クレジットに、約10,000回のCAPTCHA解決が含まれる | CAPTCHA解決やプロキシが有効になる前に、$10のデポジットが必要 |
| Enterpriseプランでは、ステルスブラウザと専用のセッションプール | Launchではセッションの制限が短く、同時10、各15分まで |
| Scaleでは、Launchより時間あたり・GBあたりの超過料金が低い | Scaleでも、超過分の前に$250/月かかる |
料金: Launchは$0+従量課金(一回限りの$30のクレジット、約300ブラウザ時間、同時セッション10、各最大15分)、Scaleは$250/月($100/月のクレジット、約1,250ブラウザ時間、同時セッション100、各最大1時間、専用Slack、SSO、HIPAA対応のBAA)、Enterpriseは個別見積り(同時セッション1,000以上、最大24時間のセッション、ステルスブラウザ)。超過分:ブラウザ時間は$0.10/時間(Launch)または$0.08/時間(Scale)、プロキシは$10/GBまたは$6/GB。出典:steel.dev/pricingとdocs.steel.dev。
最適な用途: 料金を支払い始める前から、実用的なCAPTCHA解決の枠が使える、Browserbaseに代わる、オープンソースに親和的なインフラを求めるチーム。
5. Hyperbrowser:予算重視のインフラの選択肢
Hyperbrowserは、BrowserbaseやSteelと同じインフラのカテゴリーで、価格で勝負しています。ブラウザセッション、スクレイピング、プロキシデータ、そして自社のHyperAgentやBrowser Useとの連携といったAI機能を対象とした、クレジット制のモデルです。サードパーティのレビューサイトの報告では、Startupプランは同時ブラウザ25、月30,000クレジットで月額約$30とされ、契約前に試せる無料トライアル(同時セッション1つ、カード不要)があります。
執筆時点では、Hyperbrowser自身の料金ページを、自動で直接検証するために読み込むことができませんでした。JavaScriptを多用する料金ページでは、ますますよくある問題です。以下の数字をもとに予算を組む前に、hyperbrowser.ai/pricingで、現在のプランと料金を直接確認してください。
| 得られるもの | 得られないもの |
|---|---|
| セッション、スクレイピング、プロキシにまたがる、透明なクレジット単位の料金 | ここの料金は報告ベースで、ベンダーのページで確認されたものではない |
| クレジットカード不要の無料トライアル | Startupプランの同時実行数(25ブラウザ)は、BrowserbaseのDeveloperプランに及ばない |
| 自社のエージェントだけでなく、Browser Useとの連携にも対応する | Browserbaseに比べ、公表されている実績が少ない |
料金(報告ベース、各自で要確認): Startupは約$30/月(同時ブラウザ25、月30,000クレジット、データ保持30日)。クレジットの消費は、ブラウザセッションで100クレジット/時間、AI機能で20クレジット/ステップ、プロキシデータで10,000クレジット/GBと報告されており、1クレジットは$0.001に相当します。出典:hyperbrowser.ai/pricingのベンダーページ(自動検証では表示されませんでした)。tooltrim.comとagenticindex.ioのサードパーティの追跡情報と照合。
最適な用途: インフラ事業者を価格で比較していて、透明なクレジット単位のモデルを求め、契約前に現在の料金を自分で直接確認する意思のあるチーム。
6. Axiom.ai:非技術系のチーム向けのノーコードの記録
Axiomは、このリストの中で、他のツールと同じ意味での自律的な推論エージェントではない唯一のツールであり、その点は率直に述べる価値があります。ノーコードのブラウザボットのレコーダーで、ワークフローを一度クリックして進めると、Axiomがその手順を記録し、あとで再生します。途中で、データの解析や抽出などのステップには、GPTを搭載したブロックを使えます。そのため、ページが変わったときに計画を立て直すエージェントというより、AIの支援が後付けされたRPAに近いものです。より詳しい違いは、AIエージェントとチャットボット、RPAの違いで扱っています。
それでもここに載るのは、コードなしで実際のブラウザを動かす本物の手段だからです。固定された繰り返しのワークフロー(ページの変化に適応する必要のないもの)では、レコーダーのほうが、推論エージェントより信頼できることも多く、劣るわけではありません。ワークフローが、適応的な推論というより固定シーケンスの自動化に近いなら、AI自動化ツールのおすすめで、その広いカテゴリーを扱っています。
| 得られるもの | 得られないもの |
|---|---|
| ノーコードのレコーダーで、非エンジニアでも午後のうちに動くボットを作れる | 固定シーケンスの再生であり、ページが変わっても適応的に推論はしない |
| 2FA/TOTPのサポートが、Starterを含むすべての有料プランに含まれる | 同時実行数は、StarterとProではボット1つに制限されている |
| 最安のプランでも、デスクトップランナーの同時実行数が無制限 | クラウドでのスケジュール実行の頻度は、Pro MaxとUltimateまで制限される |
料金: Starterは$15/月(実行時間5時間、ボット1つ)、Proは$50/月(30時間、ボット1つ)、Pro Maxは$150/月(100時間、同時ボット2つ)、Ultimateは$250/月(250時間、同時ボット20)。無料トライアル:実行時間2時間、1回の実行は30分まで、カード不要。出典:axiom.ai/pricing。
最適な用途: コードを書いたり保守したりせずに、ブラウザのワークフローを一度記録して再生したい、非技術系の運用、マーケティング、サポートのチーム。
7. Claude in Chrome:すでに支払っているサブスクリプションに含まれる、慎重なアシスタント
Claude in Chromeはブラウザ拡張機能であり、ヘッドレスのインフラ製品ではなく、Anthropicはあえてそのように設計しました。実際にログイン済みのChrome(またはChromiumベースのEdge、Brave、Opera)のセッション内で、ページを読み、クリックし、入力し、フォームに記入します。安全面の動作は、このカテゴリー全体が管理しなければならない認証情報の取り扱いのリスクを軸に作られています。「購入、金融取引、その他の元に戻せない操作」の前に一時停止し、一括承認ではなく、サイトを1つずつアクセス許可するPermissions Modeを提供し、Anthropic自身のガイダンスは、銀行、健康記録、保存された認証情報を必要とするものには近づけないことです。
TeamとEnterpriseの管理者は、組織全体の制御として、拡張機能のオン・オフの切り替えや、サイトの許可リストとブロックリストの設定ができます。1人の個人のブラウザを超えて展開する場合に重要です。
| 得られるもの | 得られないもの |
|---|---|
| 元に戻せない操作の前に、明示的に一時停止して確認する | ログイン済みの拡張機能のみで、APIやヘッドレスのインフラ製品ではない |
| きめ細かいサイトごとのアクセス制御ができるPermissions Mode | 高性能なモデル(Sonnet、Opus)には、Proだけでなく、Maxプランが必要 |
| TeamとEnterpriseでの、組織全体の許可リストとブロックリスト | 無人、スケジュール、サーバー側の自動化向けには作られていない |
料金: すべての有料Claudeプランに含まれます。Proは年払いで$17/月、月払いで$20/月、Maxは$100/月(5倍の利用量)または$200/月(20倍の利用量)から。無料プランでは利用できません。出典:claude.com/claude-in-chromeとclaude.com/pricing。
最適な用途: すでにClaudeに支払っていて、本番の自動化パイプラインではなく、社内ツールやリサーチのために、慎重なアシスタントを求める個人のナレッジワーカー。
8. Amazon Nova Act:AWSネイティブなチーム向けの、エージェント1時間単位の自動化
Nova Actは、ブラウザエージェントの信頼性は、汎用のLLMをブラウザにつなぎ合わせることではなく、垂直統合から生まれるというAWSの賭けです。独自の基盤モデル、オーケストレーター、ブラウザアクチュエーターが一緒に訓練されており、CRMやERPのポータルにまたがるデータ入力、チェックアウトフローのテスト、エクスポート機能のないサイトからの構造化データの抽出といったタスクのために作られています。
課金はエージェント1時間単位で、実際に経過した作業時間に対して行われ、並列のエージェントはそれぞれ独立して課金され、human in the loopの待ち時間はメーターから除外されます。このリストの他のどこにあるクレジット型やシート型とも異なる料金体系で、安定した本番ワークロードには考えやすく、変動の大きい試行的な利用には見積もりにくいものです。
| 得られるもの | 得られないもの |
|---|---|
| 汎用ではなく、ブラウザのUIタスクのためにエンドツーエンドで作られたモデル | Webのプレイグラウンド以外に、本番利用向けの無料プランは公開されていない |
| 実際の利用量でも、シンプルで予測しやすいエージェント1時間単位の課金 | 提供開始時点では、1つのAWSリージョン(米国東部、バージニア北部)のみ |
| AWS IAM、Bedrock AgentCore、コンソールとのネイティブな統合 | 時間単位の課金は、突発的で試行的な作業の予算化が難しいことがある |
料金: エージェント1時間あたり$4.75(実際に経過した作業時間、並列のエージェントは独立して課金、human in the loopの待ち時間は除外)。出典:docs.aws.amazon.com/nova-actとaws.amazon.com/nova/pricing。
最適な用途: サードパーティのSaaSベンダーではなく、AWSの課金とインフラを使いたい、本番規模の繰り返しのUIワークフローを動かす、AWSネイティブなプラットフォーム・自動化チーム。評価の本題が、AWS Bedrock AgentCoreも競合する、より広いマネージドスイートのカテゴリーなら、エンタープライズ向けAIエージェントプラットフォームのおすすめで、その比較を扱っています。
9. Google(Gemini in Chrome、Auto Browse):Project Marinerに代わったもの
このカテゴリーに向けたGoogleの専用の研究プロトタイプ、Project Marinerはなくなりました。Googleは2026年5月4日にこれを終了し、その基盤技術をGeminiと、Gemini in Chromeの中の、一般消費者向けの機能であるAuto Browseに組み込みました。Auto Browseは、サンドボックス化されたコピーではなく、実際にログイン済みのChromeセッションの中で、日常的なタスク(買い物、スケジュール調整、デジタルの事務手続き)を任せられるもので、完了前に確認を取るよう明示的に設計されています。Googleの発表では、「利用者を巻き込み、承認を求めるように設計されています」とされています。
GoogleのAI ProまたはAI Ultraのサブスクリプションにまとめて提供され、単独では販売されていないため、引用できる単独の価格はなく、執筆時点では、Windows、macOS、Chromebook Plus、Androidの、米国の契約者向けにプレビューとして展開中で、18歳以上の個人のGoogleアカウントに限られます。
| 得られるもの | 得られないもの |
|---|---|
| サンドボックス化されたコピーではなく、実際にログイン済みのブラウザで動作する | 個人向け機能のみで、APIやプログラムからのアクセスはない |
| 任せたタスクを完了する前に、承認を求める | 執筆時点では米国限定のプレビューで、世界中では利用できない |
| すでに契約しているかもしれないサブスクリプションにまとめられている | 単独の研究版であるProject Mariner自体は、終了した |
料金: GoogleのAI ProとAI Ultraのサブスクリプションにまとめられており、別途の料金はありません。これらのプランの米国での標準的な公開価格は、$19.99/月(Pro)と$249.99/月(Ultra)です。Googleのサブスクリプションページは地域ごとにローカライズされるため、現在の料金は直接確認してください。出典:support.google.com/chromeとgemini.google/subscriptions。
最適な用途: すでにGoogleのエコシステムの中にいて、別のツールをインストールしたり設定したりせずに、タスクを任せたい個人とGoogle Workspaceユーザー。
10. OpenAIとChatGPT:18か月で3つの名前
このカテゴリーにおけるOpenAIの歩みは、この分野がいまだにどれほど落ち着いていないかを示す、最も分かりやすい例です。スクリーンショットで動く単独のブラウザエージェントであるOperatorは、2025年1月に始まりました。2025年7月にChatGPT Agentに統合されました。その後、OpenAIは2025年10月に、Plus、Pro、Businessの契約者に限定されたオプトインのエージェントモードを備えた、本格的なChromiumベースのブラウザであるChatGPT Atlasを投入しました。2026年3月には、Atlas、ChatGPTのデスクトップアプリ、Codexを1つのアプリケーションに統合すると発表し、Atlas自体は2026年8月9日に終了しました。アカウントへのログイン対応を含む、ブラウザベースのエージェント機能は、いまはChatGPTの中に直接あります(OpenAI自身のヘルプセンターの変更に関する記載による)。

この変化の速さを考えると、責任ある伝え方は、自信を持った機能の断言ではなく、本番のプロセスを組む前に、ChatGPTのブラウザエージェントが、ログイン済みのワークフローで何ができて何ができないかを、直接確認することです。2年足らずの間に、名前と提供形態を3回変えた製品は、1年分の自動化を計画する安定した土台にはまだなっていません。
| 得られるもの | 得られないもの |
|---|---|
| すでに支払っているかもしれないプランにまとめられたブラウザタスク機能 | 2025年1月以降、製品の位置づけが3回変わった |
| 運用・保守すべき別のインフラがない | ログイン済みの無人ワークフローに対応できるかは、直接の確認が必要 |
| ここにあるどのベンダーより、最大の一般消費者向けAI契約者基盤に支えられている | 本番の自動化向けに作られた、専用のAPI/インフラ製品ではない |
料金: ChatGPT Plusは$20/月、Proは$200/月。BusinessとEnterpriseのシート価格は、要望に応じて提示されます。ブラウザベースのエージェント機能は、これまでPlus以上が必要でした。出典:WikipediaのChatGPT項目。OpenAI自身のAtlasからChatGPTへの移行に関するお知らせと照合。
最適な用途: すでに契約しているサブスクリプションに、ブラウザベースのタスク自動化がまとめられていてほしいChatGPTユーザー。このリストで最も製品の位置づけが安定していないことを理解したうえで。
11. DIY:Playwrightと自作のエージェントループ
MicrosoftのMITライセンスの無料のブラウザ自動化フレームワークであるPlaywrightは、このリストの複数のベンダーが、自らその上に構築している決定論的なエンジンです。StagehandはこれをそのままラップしておりBrowser UseのDOM抽出も、概念的には同じ層です。パッケージ型エージェントの前提に合わないワークフローを持つチームや、信頼性とセキュリティのトレードオフを自ら握りたいほど重要度の高いチームは、自分でループを書きます。正確でDOMに忠実なアクションにはPlaywrightを使い、その上の計画層には、LLMのツール呼び出しループを使います(LangGraphや、オープンソースのAIエージェントフレームワークのおすすめにある他のフレームワークが一般的な選択肢です)。
ここでは、モデルのAPI利用料と、セルフホストや上記のインフラベンダーのいずれかを含め、選んだヘッドレスのホスティング以外に、製品のコストはありません。代わりに買うのは制御です。自分のリトライのロジック、自分のガードレール、そして、どのステップで人のチェックポイントが必要かという自分の判断です。
| 得られるもの | 得られないもの |
|---|---|
| 信頼性、セキュリティ、コストのトレードオフを完全に制御できる | リトライのロジック、セレクター、ガードレールを、自分で設計し保守する |
| ベンダーロックインがなく、モデルやホスティングを独立して入れ替えられる | 何かがリリースされる前に、実際のエンジニアリングの時間投資が必要 |
| 複数のパッケージ型ベンダーが土台にしているのと同じエンジン | 本番で何かが壊れたときに頼れる、ベンダーのサポート窓口がない |
料金: Playwright自体は無料のオープンソースです。コストは、モデルのAPI利用料と、選んだホスティングの選択肢(セルフホスト、またはこのリストの従量課金のベンダー)です。出典:PlaywrightはMicrosoftがMITライセンスのもとで保守しています。
最適な用途: パッケージ型エージェントの前提に合わない、標準的でない、重要度の高い、あるいは特殊な形のワークフローを持ち、それを直接担えるエンジニアリング体制のあるチーム。
ブラウザエージェント導入でよくある失敗
| 失敗 | 具体的な状況 | 代わりにすべきこと |
|---|---|---|
| 「ブラウザエージェント」は無人で動かしてよいものと思い込む | 人のチェックポイントなしに、エージェントを決済やアカウント設定のフローに向ける | 元に戻せない操作には、確定前の確認ステップを必須にする |
| 対象サイトの利用規約を無視する | エージェントが技術的にできるからという理由で、パートナーや競合のサイトを自動化する | ワークフローを作る前に、サイトの規約とrobots.txtを確認するか、問い合わせる |
| 表示価格を、コストの全体として扱う | $29/月のプランで予算を組み、プロキシとCAPTCHAの超過分に驚く | まず実際のタスク量で、ブラウザ時間、プロキシのGB、CAPTCHAの解決回数を試算する |
| 限定的な認証情報ではなく、個人のログインをエージェントに渡す | 実在の従業員のSSOセッションの上で、無人の夜間ジョブを動かす | 人のセッションではなく、専用の最小権限のサービスアカウントを使う |
| DOMベースと画像ベースのエージェントは、同じように失敗すると思い込む | 画像ベースのエージェントの押し間違いを、壊れたCSSセレクターのようにデバッグする | デバッグの方法とフォールバックの計画を、エージェントの実際の操作方法に合わせる |
| ベンチマークのスコアで購入する | WebArenaやMind2Webで高い結果を出したと主張しているからという理由で、ベンダーを選ぶ | 自社の対象サイトでパイロットを行う。ベンチマークは、実際に動くページではほとんど通用しない |
| 1回の長い無人の実行を信頼する | すべてのステップでリスクが積み重なるタスクで、40ステップ以上をエージェントに走らせる | 長いワークフローを、人が間に確認する短い段階に区切る |
選び方:意思決定フレームワーク
最初に運用モデルを選んでください。セルフホストのエージェント、マネージドのブラウザインフラ、ノーコードのレコーダー、まとめて提供されるアシスタント、あるいは自作のループです。

| 必要なもの | 選ぶべき製品 | 理由 |
|---|---|---|
| 無料でセルフホストできるオープンソースの基盤 | Browser Use | 無料のコアライブラリ、モデルに依存せず、セルフホストの限界を超えたらマネージドクラウド |
| 組み込みの認証情報の保管庫、2FA、CAPTCHAの処理 | Skyvern | 保存済み認証情報、1Password/Bitwarden連携、Proでの高度なCAPTCHAソルバー |
| 欲しいときは決定論的な制御、そうでないときはAI推論 | Browserbase + Stagehand | マネージドインフラ上の、Playwrightレベルの精度とAIプリミティブ |
| 料金を支払う前から、実際のCAPTCHA対応の枠があるオープンなインフラ層 | Steel.dev | 無料の一回限りのクレジットに、約10,000回のCAPTCHA解決が含まれる |
| インフラで最も低い表示価格 | Hyperbrowser | 透明なクレジット単位の料金。まず現在の条件を直接確認する |
| エンジニアを雇わずにブラウザを自動化する、ノーコードの方法 | Axiom.ai | ポイント&クリックのレコーダー、2FAのサポート、コード不要 |
| すでに運用しているAWSインフラ上での、本番規模のUI自動化 | Amazon Nova Act | エージェント1時間単位の課金、垂直統合のモデル、ネイティブのIAMとコンソール |
| すでに支払っているサブスクリプションにまとめられた、慎重なアシスタント | Claude in ChromeまたはGoogle Auto Browse | 機能は軽量だが、一時停止して確認する仕組みが組み込まれ、追加でホストするものがない |
| どのパッケージ型エージェントにも合わないワークフローの完全な制御 | Playwright + 自作のエージェントループ | 信頼性、セキュリティ、コストのトレードオフを、自分で直接担う |
次のステップ
実際のワークフローを1つ選んでください。対象サイトにAPIがないために、誰かが1時間かけてコピー&ペーストしているような作業です。そして、どちらかに決める前に、2つのエージェントで試してください。DOMベース(Browser UseまたはStagehand)と画像ベース(Skyvern)を1つずつ、自社の量に合ったインフラのプランで動かします。エージェントが技術的に終えたかどうかだけでなく、人が出力を検証するのにかかる時間を測ってください。その検証のステップで、エージェントの信頼性が99%ではなく80%だと、チームが気づくことが多いためです。すでにClaudeやGoogle AIのサブスクリプションに支払っているなら、同じタスクで、まずClaude in ChromeかAuto Browseを試してください。バンドルされた選択肢には、追加費用がかからず、専用のベンダーを加える前に、それで十分かもしれません。そして、自社で所有していないサイトにこれらを向ける前に、ログインページだけでなく、そのサイトの利用規約を読んでください。

On this page
- 重要なポイント
- 比較早見表
- 2026年にAIブラウザエージェントを選ぶには
- 1. DOMを見ているのか、スクリーンショットを見ているのか
- 2. 誰が実際にログイン認証情報を保持しているのか
- 3. 対象サイト自身の防御は、自社にとって何を意味するのか
- 4. 信頼性95%のエージェントが、なぜ半分は失敗するのか
- 規模とペルソナの表
- 1. Browser Use:エンジニアリングチームのオープンソースの定番
- 2. Skyvern:本格的な認証情報の保管庫を備えた、画像ベースの操作
- 3. BrowserbaseとStagehand:Playwrightの精度とAI推論層の組み合わせ
- 4. Steel.dev:CAPTCHAが組み込まれた、オープンソースに親和的なインフラ
- 5. Hyperbrowser:予算重視のインフラの選択肢
- 6. Axiom.ai:非技術系のチーム向けのノーコードの記録
- 7. Claude in Chrome:すでに支払っているサブスクリプションに含まれる、慎重なアシスタント
- 8. Amazon Nova Act:AWSネイティブなチーム向けの、エージェント1時間単位の自動化
- 9. Google(Gemini in Chrome、Auto Browse):Project Marinerに代わったもの
- 10. OpenAIとChatGPT:18か月で3つの名前
- 11. DIY:Playwrightと自作のエージェントループ
- ブラウザエージェント導入でよくある失敗
- 選び方:意思決定フレームワーク
- 次のステップ