2026年版 QA・テスト向けAIエージェント14選:セルフヒーリングの透明性で順位付け

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
現時点で、エージェント型のQAカバレッジに最も近いものを求めるチームには、QA WolfとMablがこのリストの先頭に来ます。アナリストがすでに評価した名前を選びたいなら、Testim(Tricentis)とApplitools Autonomousのほうが安全です。専任の自動化エンジニアがいない小規模なチームは、MomenticかFunctionizeから始めるのがよいでしょう。本ガイドでは、ソフトウェアQA専用に作られたAIエージェント14製品を順位付けします。仕様書やアプリのクロールからテストケースを生成し、エンドツーエンドとUIのテストを実行し、セレクターが変わったときに自己修復し、ビジュアルのリグレッションを検出し、APIをテストし、失敗した実行をトリアージするツールです。料金は2026年8月にベンダー自身の料金ページで確認し、価格を公開していないベンダーにはその旨を記しています。
対象範囲は、見た目よりも絞られています。真のエージェントは、複数のステップを計画し、ブラウザやテストランナーなどの実際のツールを呼び出し、次に何をするかを自ら判断します。人がチェックリストを順にクリックするのを支援するだけの製品は、代わりに2026年のアシスタント型AIエージェントに属します。また本ガイドは、これらのエージェントがテストする対象のアプリケーションコードを書くAIコーディングエージェント、コードのリリース後に本番のインシデント対応を担うAIエージェント、AIエージェント自身の挙動をトレースするAIエージェントのオブザーバビリティツールも扱いません。扱うのは、リリース前のソフトウェア品質、つまり、機能が出荷前に動作するかどうかです。以下のすべての製品は、マーケティングページがとかく省略しがちな1つの問いで評価しました。それは、壊れたテストを「自己修復」したとき、何を変更したかを伝えてくれるのか、そしてその変更が合格したビルドとして出荷される前に、人が「ノー」と言えるのか、という問いです。
2026年8月更新:変更点
- Gartnerは2025年に、AI-Augmented Software Testing ToolsのMagic Quadrantを初めて公表し、Tricentisを、実行能力で最高位に位置付けられたLeaderに選びました。この分野が、個々のベンダーの主張から、アナリストが追跡する市場へと成熟したことを示す、これまでで最も明確なシグナルです。
- Forresterは2025年第4四半期に、Autonomous Testing PlatformsのWaveを初めて実施しました。 テストの作成、実行、保守を従来のスクリプト型の自動化の先へどこまで進めているかについて、15のベンダーを評価しました。TricentisはLeader、ApplitoolsはStrong Performerとされました。
- SmartBearは2026年3月31日に、Reflectの中に新たなエージェント機能を投入しました。 開発者が、別のダッシュボードではなく、接続したコーディングエージェントからMCPサーバー経由で、直接テストを生成できます。このリストの他の製品とは、連携のモデルが大きく異なります。
- Katalonは、AI AssistantとMCP Serverを、すべての料金ティアに追加料金なしで組み込みました。 AIによるテスト支援が、プレミアムなアドオンではなく、基本的な期待になるという見方に賭けた動きです。
重要なポイント
- 米国における低品質なソフトウェアのコストは、少なくとも2.41兆ドルに上り、そのうち累積した技術的負債、つまり未テストまたはテスト不足の近道のバックログが、約1.52兆ドルを占めています(Consortium for IT Software Quality の2022年のレポートによる)。
- 組織全体のテスト自動化カバレッジの平均は、わずか33%で、自動化戦略を完全に確立していると答えたのは8%だけです。Capgemini、Sogeti、OpenTextのWorld Quality Report 2025-26による、23か国の経営幹部2,000人を対象とした調査の結果です。
- クオリティエンジニアリング全体で生成AIを全社的に展開している組織は15%にとどまり、43%はまだ試行段階です(同じWorld Quality Report 2025-26による)。
- テストチームの76.8%が何らかの形でAIを導入していますが、導入は保守よりも作成に偏っています。テストケースの生成にAIを使うのが69.6%、テストの保守に使うのが59.6%です(PractiTestの2026年State of Testingレポートによる。第13版を迎えました)。
- テストの不安定さ(フレーキネス)を経験しているチームの割合は、2022年から2025年半ばにかけて10%から26%に増えました。1,000万件を超えるビルドの分析に基づいています(Bitriseの2025年Mobile Insightsレポートによる)。
- エンタープライズアプリケーションの40%が、2026年末までにタスク特化型のAIエージェントを搭載し、2025年の5%未満から増加します(Gartnerによる)。
比較早見表
| ツール | 最適な用途 | 開始価格 | 主な強み | 主な制約 |
|---|---|---|---|---|
| QA Wolf | QAの業務をすべて手放したいチーム | 従量課金(AIクレジット$0.01、ランナー1分あたり$0.15)、Coverage as a Serviceはカスタム | すべての失敗を、人が24時間以内に調査する | カスタムのマネージドティアは、実際の価格を営業対応の裏に隠している |
| Mabl | Web、モバイル、API、アクセシビリティにまたがるエージェント型のカバレッジを1つの製品で | カスタム、見積もりベース(月500クレジットから) | 「自ら構築し、自ら実行し、自ら復旧する」という位置付け | 開始価格すら含め、公開価格が一切ない |
| Testim (Tricentis) | アナリストに評価された自律テストを求める大企業のチーム | 無料のCommunityプラン、有料ティアはカスタム | GartnerとForresterの両方がLeaderに選出 | 限定的な無料ティアより上は、公開価格がない |
| Applitools Autonomous | 自律的なエンドツーエンドの生成と一体になったビジュアルリグレッション | 無料トライアル(50 Test Units)、有料ティアはカスタム | URLのリストをスキャンして完全なスイートにし、変更をまとめてワンクリックで承認できる | トライアルより上は、公開されたセルフサーブの価格がない |
| Katalon AI | 手動テストと自動テストを1つのプラットフォームで | $70/シート/月(True Platform)、年払い割引で$59まで | AI AssistantとMCP Serverが、すべてのティアに無料で含まれる | ライフサイクル全体をカバーするには、$200/シート/月のバンドルが必要 |
| testRigor | 実際の本番トラフィックから生成する、セレクター不要のテスト | $300/月(Private Linux Chrome) | セレクターではなく、人と同じようにページを理解して自己修復する | クロスプラットフォームを完全にカバーするには、$900/月が必要 |
| Momentic | シート料金なしの従量課金 | 無料(月2,000クレジット)、$125/月の従量課金 | 超過料金が公開されており、ユーザー単位の課金がない | エンタープライズ機能(SSO、SLA)には、カスタムの見積もりが必要 |
| Functionize | エージェント型テストへの、最も安価なセルフサーブの入り口 | 無料($0、月200クレジット)、Pro $20/月 | このリストで最も低い有料の入り口 | GrowthとScaleのティアは、クレジットを共有ではなくユーザーごとに課金する |
| Reflect (SmartBear) | コーディングエージェントから直接呼び出せるエージェント | クレジット単位のティア(月5,000〜40,000)、価格はカスタム | ダッシュボードだけでなく、MCPサーバーによる連携 | どのティアにも、ドル建ての公開価格がない |
| Autify | 自律テスト(Aximo)またはPlaywrightベースのハイブリッド(Nexus) | $120/月(Aximo Core)、年払いで$99/月 | 2つの製品で、ノーコードのチームとコードベースのチームの両方をカバー | Nexusは、ユーザー単位や並列単位のアドオンが重なる |
| Rainforest QA | 人間のクラウドレビュアーが支える、AIによるテスト計画 | 非公開、報道ベースの平均は月約$5,200 | セルフヒーリング層の背後に、人間のレビュアーがいる | 公開価格はなく、実際の契約は年間で5桁の金額に及ぶ |
| CoTester (TestGrid) | 27以上の組み込みエージェントを備えた、バンドル型のAIテストチームメイト | $199/シート/月、最低4シート | 27以上のテストエージェントに、エージェント単位の料金がない | 最低4シートのため、実際の価格の下限は月$800近くになる |
| Meticulous | テストの作成が不要な、メンテナンスゼロのリグレッションカバレッジ | 非公開、オープンソースは無料 | 実際のセッションを決定論的に再生し、壊れるロケーターがない | 意図的に作り込んだスクリプト型のテストケースが必要な場合には適さない |
| Ranger | 最も自律的で、AIコーディングエージェント向けに作られた選択肢 | 非公開、カスタムの年間契約 | 修正と再テストのループに、設計上、人がまったく関与しない | セルフサーブのティアはなく、すべてのチームが営業相談から始まる |
セルフヒーリング:バグを隠してしまうこともある機能
このリストのすべてのベンダーは、セルフヒーリングを乗り換える理由として打ち出しています。しかし、それが作動したときに実際に何をするのかを説明しているベンダーは、それほど多くありません。見つけるはずの要素が移動または変更されている場合に、最も近いものを探し、テストをそちらに向け直して更新するのです。うまくいけば、QAエンジニアが毎スプリント、ロケーターを録画し直す手間が省けます。雑に行われれば、壊れた要素の隣にある、見た目の似た要素に黙って向け直してしまい、テストが合格し、本物のリグレッションが出荷されることがあります。これこそ、セルフヒーリングに関するベンダーのベストプラクティスのガイドが警告している失敗のパターンです。直すのはロケーターであり、アサーションではないこと、黙って修復する前に信頼度のしきい値を求めること、すべての修復をレビュー用に記録すること、修復率が想定外に急増したらビルドを失敗させることです。誰にも知らせずに自己修復するテストスイートは、証拠ではなくなり、見せかけの演出になります。

この14製品の本当の違いは、セルフヒーリングをするかどうかではありません。ほぼすべてが行います。違いは、その修復が見えてレビューできるのか、それとも見えず自動的に行われるのかです。この種のガードレールをゼロから設計する構築側のチームは、AI QA testing agent blueprintで、その範囲がどう定められているかを参照してください。この設計図は、「失敗しているテストを合格にしてはならない」を、設定項目ではなく、絶対のルールとして扱っています。
| ツール | 修復対象 | 出荷前の人による承認 | 変更の表示方法 |
|---|---|---|---|
| QA Wolf | ロケーターとワークフローのステップ | あり。マネージドティアでは、人がすべての失敗を24時間以内に調査する | 動画、トレース、ログが付いた、人が検証したバグレポート |
| Mabl | 「intelligent test failure analysis」によるロケーター | 必須のゲートとしては文書化されていない | 失敗の分析が、実行ごとに考えられる原因を示す |
| Testim (Tricentis) | AI搭載のエージェント型テスト自動化によるロケーター | 実行を信頼する前に、テストエディターでレビューできる | 生成されたステップが、エディターに表示されて確認できる |
| Applitools Autonomous | ロケーターとビジュアルのチェックポイント | あり。変更はグループ化され、ワンクリックで承認する | 影響を受けるすべてのテストにまたがる、グループ化された差分ビュー |
| Katalon AI | ロケーターに加え、Insightsで根本原因を提示 | 必須のゲートとしては文書化されていない | Insightsが、根本原因と不安定なテストのパターンにフラグを立てる |
| testRigor | セレクターではなく、ページの理解そのもの | あり。グループ化されたケースを、編集ツールでその場で修正する | 同じ問題の影響を受けるケースが、レビュー用にグループ化される |
| Momentic | 自然言語の記述によるロケーター | 必須のゲートとしては文書化されていない | エージェントのリトライと回避策が、実行ごとに記録される |
| Functionize | 「不安定なテストの問題」として扱われるロケーター | 必須のゲートとしては文書化されていない | クレジット従量制の実行が、ステップごとの合否を報告する |
| Reflect (SmartBear) | ビジュアルのオブジェクト検出によるロケーター | 文書化されていない。修復は手動の介入なしに適用される | テストのステップとスクリーンショットが、実行ごとに記録される |
| Autify | AximoとNexusの両方にまたがるロケーター | 必須のゲートとしては文書化されていない | セルフヒーリングが発生した後に、スクリプトの差分が表示される |
| Rainforest QA | ロケーターに加え、人間のレビュアー層 | あり。AI層と並んで、人間のクラウドレビュアーが担う | 自動の合格だけでなく、人がレビューした結果 |
| CoTester (TestGrid) | バグの要約とセットになったロケーター | 必須のゲートとしては文書化されていない | バグの要約が、何がなぜ失敗したかを示す |
| Meticulous | 修復するものがない。設計上、ロケーターが存在しない | 該当なし。修復の代わりに、決定論的な再生を使う | 意味のない変更を除外した、ビジュアルの差分 |
| Ranger | なし。失敗した場合は、テストではなく、コードを直すようコーディングエージェントに渡す | なし。設計上、修正と再テストのサイクルは「人が介在しない」 | スクリーンショット、録画、トレースがPRに添付される |
自分でテストを書くのか、与えられたものを実行するだけか
これらの製品を実際に分けるもう1つの軸は、テストがどこから来るかです。アプリを自ら探索し、何をテストする価値があるかを自分で決めるエージェントもあれば、仕様書、平易な言葉による説明、録画されたセッションを待ち、人が指し示したものだけを実行するエージェントもあります。どちらの方法も間違いではありませんが、リスクは異なります。自ら探索するエージェントは、気づいていなかったカバレッジのギャップを見つけられます。一方、指定されたものしか実行しないエージェントは、誰も説明しようとしなかった機能については、警告できません。

| ツール | テストの生成元 | アプリを自律的に探索するか |
|---|---|---|
| QA Wolf | プロダクトの探索とワークフローのマッピング | はい、明示的に。セルフサーブのPlatformティアで |
| Mabl | 録画したフローとAIによるテスト計画 | 部分的。カバレッジは、ゼロからのクロールではなく、利用を通じて広がる |
| Testim (Tricentis) | Testim Copilotによる平易な言葉の説明と、録画 | いいえ。仕様と録画が起点 |
| Applitools Autonomous | スキャンしたURL、またはアップロードしたURLのリスト | はい。サイトをクロールしてスイートを構築する |
| Katalon AI | 録画とAIによるスクリプト生成、アドオン経由で本番トラフィックも | 任意。True Production Insightsアドオン経由 |
| testRigor | 本番のユーザーの行動を再現したもの | はい。実際のユーザーがアプリ内をどう動くかから学習する |
| Momentic | 自然言語によるステップの記述 | いいえ。仕様が起点 |
| Functionize | 記述されたテスト要件 | いいえ。仕様が起点 |
| Reflect (SmartBear) | エージェントに与えられた自然言語の目的 | 部分的。自由なクロールではなく、ゴールに向けてステップごとに動く |
| Autify | ノーコードの録画とAI生成(Aximoは「Autonomous」とブランド化) | 詳細は文書化されていない。主に録画が起点 |
| Rainforest QA | アプリをマッピングするAI Test Planner | はい。アプリをマッピングし、何をテストすべきかを提案する |
| CoTester (TestGrid) | 要件からの手動・自動のテストケース生成 | いいえ。主に要件が起点 |
| Meticulous | 自動的に取得される、実際のユーザーセッション | 探索したり、何をテストするか指示されたりするのではなく、実際の利用を記録する |
| Ranger | ライブのサイトを自らナビゲートした結果 | はい。サイトを自らナビゲートして、テストを生成する |
CI/CD連携と失敗のトリアージ
ダッシュボードからしか動かないエージェントは、確認すべき2つ目のワークフローになってしまいます。このリストの大半は、すでに使っているパイプラインの中で動き、実行が失敗したときに開発者に対応可能な情報を渡すように作られています。何の文脈もない赤い×印ではなく、再現手順が付いたバグレポートを、JiraやLinearに直接起票します。
| ツール | CI/CD連携 | 失敗のトリアージ方法 |
|---|---|---|
| QA Wolf | APIとWebhookによるトリガー、オープンソースのPlaywrightへのエクスポート | 動画、トレース、ログ付きの、24時間の人による調査 |
| Mabl | クラウドの同時実行数は無制限、ローカル実行は無料 | intelligent test failure analysisが、考えられる原因にフラグを立てる |
| Testim (Tricentis) | Tricentisの継続的テストスイート内でのクラウド実行 | Testim Copilotによる、AI支援の根本原因分析 |
| Applitools Autonomous | クロスブラウザ、クロスデバイスのクラウド実行、30以上のSDK | 影響を受けるすべてのテストにまたがる、グループ化された変更レビュー |
| Katalon AI | クラウド実行に加え、ローカルIDEでの実行 | Insightsモジュール:根本原因の分析と、不安定なテストの検出 |
| testRigor | Linux、Windows、Mac、Android、iOSにまたがる並列実行 | 関連する失敗を、修正可能な1つの問題にまとめる |
| Momentic | GitHub ActionsとGitLab CIにネイティブ対応 | エージェントのリトライと回避策の試行が、実行ごとに記録される |
| Functionize | ティアに応じて最大10の並列実行 | クレジット従量制の実行レポートで、ステップ単位の合否を報告 |
| Reflect (SmartBear) | APIベース、接続したコーディングエージェントからツールとして呼び出すことも可能 | テストの実行ごとのスクリーンショットとステップログ |
| Autify | AximoとNexusの両方でCI連携(Aximoはクラウド、Nexusはローカルとクラウド) | セルフヒーリングが発生したときに、スクリプトの差分を表示 |
| Rainforest QA | 素早い出荷のために作られ、既存のリリースサイクルに適合する | AIが結果にフラグを立て、人間のレビュアーがエッジケースを確認する |
| CoTester (TestGrid) | 実機とブラウザのクラウドでの実行 | 組み込みのバグ要約が、何がなぜ失敗したかを示す |
| Meticulous | 設計上、すべてのプルリクエストに対して実行される | 意味のないビジュアルの変更を除外するよう、差分をフィルタリングする |
| Ranger | コーディングエージェント自身のループから、CLIコマンドでトリガーされる | デフォルトでは、人によるトリアージのステップはなく、エージェントが自分で再テストする |
料金モデル:シート、クレジット、予算が想定外になる場面
このリストには3つの料金の考え方があり、予算の見通しの中でそれらを混同すると、更新時に驚くことになります。シート単位の料金は、1人あたりのコストに上限を設けますが、人数に比例して増えます。クレジットや従量課金は、エージェントがどれだけ働くかに応じて増えます。1つの大規模なリグレッションスイートが、1か月分の許容量を1週間で使い切ってしまうまでは、問題ありません。そして、このリストの最も高機能な製品のいくつかは、そもそも価格をまったく公開していません。

| ツール | 料金モデル | チームが驚く点 |
|---|---|---|
| QA Wolf | 従量制のクレジットとランナーの分数(セルフサーブ)、完全カスタム(マネージド) | 1つのブランドの下に、大きく異なる2つの料金モデルがある |
| Mabl | カスタム見積もり、月500クレジットから | 下限すら含め、公開されたドル建ての金額がどこにもない |
| Testim (Tricentis) | 無料のCommunityプラン、有料ティアはすべてカスタム | 公開された料金の詳細があるのは、限定的な無料ティアだけ |
| Applitools Autonomous | 「Test Unit」の従量制、無料トライアルの後はカスタム | Test UnitはApplitools独自の指標で、単純なテスト件数ではない |
| Katalon AI | シート単位、3つの別々の製品が組み合わさって4つ目のバンドルになる | ライフサイクル全体をカバーするには、StudioとPlatformを重ねる必要がある |
| testRigor | 固定のインフラティアで、シート単位でもテスト単位でもない | ユーザーとテストが無制限で定額、価格は並列実行数で決まる |
| Momentic | 純粋な従量制のクレジット、超過料金は公開 | モバイルのテストも、Webと同じクレジットプールから消費される |
| Functionize | 定額に加えクレジット(個人)、ユーザー単位に加えクレジット(チーム) | チームのクレジットはユーザー単位のため、シートが増えると請求額が非線形に変わる |
| Reflect (SmartBear) | クレジット単位のティア、ドル建ての価格はティアごとに非公開 | モバイルのテストは、Webのテストの5倍のクレジットを消費する |
| Autify | 2つの別々の料金体系(AximoとNexus)に、重なるアドオン | 製品ラインを間違えると、後でアカウントの料金を見直すことになる |
| Rainforest QA | 非公開、報道によれば契約額はテスト量に応じて増える | 人が支援するテストは、AI層の上に載る別のアドオン |
| CoTester (TestGrid) | シート単位、最低4シート | 実際の開始価格を決めるのは、シート単価ではなく、最低シート数 |
| Meticulous | 非公開、オープンソースは無料 | 営業との対話が行われるまで、予算を立てる材料が何もない |
| Ranger | カスタム、年間契約、相談ベース | どのチーム規模でも、セルフサーブのティアは存在しない |
規模とペルソナの表
| ツール | 最適なチーム規模 | 主な購入者ペルソナ |
|---|---|---|
| QA Wolf | 従業員20〜500人 | Head of QA、チームのQA業務を手放したいVP Engineering |
| Mabl | 従業員20〜1,000人 | QA Director、Head of Quality Engineering |
| Testim (Tricentis) | 従業員100〜5,000人以上 | エンタープライズのQA Director、Test Automation Lead |
| Applitools Autonomous | 従業員50〜5,000人以上 | QA Automation Lead、Visual QA Engineer |
| Katalon AI | 従業員10〜1,000人 | 手動テストと自動テストを一体で運用するQA Manager |
| testRigor | 従業員10〜500人 | 専任の自動化エンジニアリングチームを持たないQA Lead |
| Momentic | 従業員5〜200人 | QAを兼任するスタートアップのEngineering Lead |
| Functionize | 従業員5〜300人 | QA Engineer、Engineering Manager |
| Reflect (SmartBear) | 従業員5〜200人 | すでにAIコーディングエージェントに標準化しているQA Engineer |
| Autify | 従業員10〜300人 | QA Manager(Aximo)またはAutomation Engineer(Nexus) |
| Rainforest QA | 従業員10〜500人 | AIと人間のクラウドテストを求めるEngineering Director |
| CoTester (TestGrid) | 従業員10〜200人 | バンドル型のエージェントスイートを1つ求めるQA Manager |
| Meticulous | 従業員5〜500人 | メンテナンスゼロのリグレッションカバレッジを求めるFrontend Engineering Lead |
| Ranger | 従業員5〜100人 | テストの判定基準を必要とするAIコーディングエージェントを運用する創業者またはEng Lead |
1. QA Wolf:すべての失敗を人がレビューする体制に支えられた、AIによるテスト作成
QA Wolfは、自社を、チームのQAの負担を「完全に」取り除く、ハイブリッドのプラットフォーム兼サービスと位置付けています。Coverage as a Serviceのティアは、その約束を、このリストで最も文字どおりに実現したものです。QA Wolf自身のチームが、エンドツーエンドのカバレッジを構築・保守し、「フレークゼロ」を保証し、すべての失敗を24時間以内に調査して、人が検証したバグレポートを添付します。セルフサーブのPlatformティアは、同じAIによる探索とワークフローのマッピングを、自社のチームに任せる形で提供します。オープンソースのPlaywrightにエクスポートするため、基盤となるテストにベンダーロックインはありません。
その幅こそ、購入前に理解しておくべきことでもあります。PlatformとCoverage as a Serviceは、1つのブランドを共有する、ほぼ別の2つの製品です。一方は従量制で料金が明確に示され、もう一方は完全に営業対応の裏に価格があります。
| 得られるもの | 得られないもの |
|---|---|
| 人がすべての失敗を24時間で調査するマネージドティア | マネージドティアの実際の価格は、公開されていない |
| クレジット単位、分単位で料金が明確なセルフサーブのPlatformティア | セルフサーブでは、自動化を引き続き自社のチームが担う必要がある |
| オープンソースのPlaywrightへのエクスポート、ロックインなし | 並列実行の無制限は、セルフサーブのティアにのみ適用される |
| PlatformにAIによる探索とワークフローのマッピングが含まれる | 「フレークゼロの保証」はマネージドティアの主張で、セルフサーブには当てはまらない |
料金: Platformは従量制です。AIクレジットが1つあたり$0.01、ランナーの分数が1分あたり$0.15で、シート単位やテスト単位の課金はなく、お試し用の無料ティアがあります。Coverage as a Serviceはカスタムで、見積もりは営業担当に問い合わせてください。出典:qawolf.com/pricing。
最適な用途: 人がレビューするマネージドサービスにエンドツーエンドのQAを任せたいチーム。また、自動化を自社で担うつもりのチーム向けには、より安価なセルフサーブの選択肢もあります。
2. Mabl:自ら構築し、実行し、修復するカバレッジ
Mabl自身の位置付けである「自ら構築し、自ら実行し、自ら復旧するカバレッジ」は、この分野で最も直接的なエージェント型の売り文句であり、その範囲も他より広くなっています。Web、モバイル、API、アクセシビリティ、パフォーマンスのテストが、別々のSKUではなく、1つのサブスクリプションの下で1つのクレジットプールを共有します。ローカルでのテスト実行が無制限であること、クラウドの同時実行数が無制限であることは、すべてのプランに含まれており、クラウド実行用に500クレジットの初期割り当てがあります。
問題は、これらに公開された金額が付いていないことです。すべてのプランがカスタムの見積もりのため、チームは、まず営業担当と話さなければ、おおまかな予算も立てられません。これだけ広く採用されている製品としては、珍しいことです。
| 得られるもの | 得られないもの |
|---|---|
| Web、モバイル、API、アクセシビリティ、パフォーマンスのテストを1つの製品で | 公開された料金ティアも開始価格も、どこにもない |
| ローカル実行の無制限と、クラウドの同時実行数の無制限 | クラウドクレジットが実際の使用量の単位であり、その換算レートは公開されていない |
| 担当のCustomer Success Managerが付く、24時間5日間のライブサポート | モバイルアプリのテストは、別の有料アドオン |
| 営業との対話の前に評価できる、14日間の無料トライアル | セルフヒーリングの透明性(何が変わり、誰が承認するか)が文書化されていない |
料金: カスタム、見積もりベース。月500クレジットの初期割り当てで、各機能にまたがるクラウドのテスト実行をカバーし、ローカル実行は無料です。出典:mabl.com/pricing。
最適な用途: 個別のツールをつなぎ合わせる代わりに、Web、モバイル、API、アクセシビリティのテストにまたがる、1つのエージェント型プラットフォームを求めるチーム。
3. Testim (Tricentis):エンタープライズの自律テストにおけるGartnerとForresterのLeader
TestimがTricentisに買収されたことで、この分野で最大の専門テストベンダーの傘下に入りました。そして2025〜26年に、それが第三者による評価という形で表れました。Tricentisは、GartnerのAI-Augmented Software Testing Toolsの初のMagic QuadrantでLeaderに、ForresterのAutonomous Testing Platformsの初のWaveでもLeaderに選ばれ、「機能テストと非機能テストのための、最も包括的なエンタープライズ級のプラットフォームの1つ」を提供していると評価されました。Testim Copilotは、エディターの中で、平易な言葉の説明からテストのステップを生成します。Tricentisは現在、その上にエージェント層を売り出しています。テストすべきことを説明すれば、自動的に実行されるというものです。
すでにWebに加えてSalesforceやモバイルも運用しているチームにとって、これは実際の利点です。Testimは、3つの別々のベンダー契約ではなく、Tricentisとの1つの関係の下で、この3つをカバーします。
| 得られるもの | 得られないもの |
|---|---|
| GartnerとForresterの両方から、独立してLeaderとして評価されている | どの有料ティアにも、公開価格がない |
| Testim Copilotが、平易な言葉の説明からテストのステップを生成する | 無料のCommunityプランは、1組織につき1つに限られる |
| Web、Salesforce、モバイルを1つのベンダーでカバー | 24時間5日間のサポートには、有料のEssentials、Pro、Mobileのティアが必要 |
| Tricentisの、より広い継続的テストスイートの一部 | エンタープライズのパッケージは、セルフサーブの課金ではなく、小切手または電信送金で支払う |
料金: トライアルの後、無料のCommunityプランが利用できます(セルフサービスのみ、1組織につき1つ)。Testim Web、Testim Salesforce、Testim Mobileは、いずれも料金について営業担当への問い合わせが必要です。出典:testim.io/pricing。
最適な用途: Web、Salesforce、モバイルのテストを、1つの関係の下でカバーする、アナリストに評価されたベンダーを求める、エンタープライズのQAチーム。
4. Applitools Autonomous:URLのリストを、完全なテストスイートに変える
Applitoolsは、Visual AIで評価を築き、Autonomousは、その専門性を、テストそのものの生成と保守に広げたものです。URLまたはURLのリストを指定すると、サイトをスキャンして、ビジュアルのチェックポイントを組み込んだテストスイートを、コードなしで自動生成します。ForresterはApplitoolsを、初のAutonomous Testing Platforms WaveでStrong Performerに選びました。Tricentisより一段下ですが、まったく新しいカテゴリでの、本物の第三者評価です。
ここでのセルフヒーリングは、このリストの中でも透明性が高い部類です。AIがサイト全体の変更を検出すると、それらをグループ化し、チームが1つずつ探し回る代わりに、「ワンクリックで数百のテスト」をレビューして更新できます。黙って行うのではなく、まとめてレビューするモデルです。
| 得られるもの | 得られないもの |
|---|---|
| URLのリストをスキャンして、完全なテストスイートを自動生成する | 無料トライアルより上は、公開されたセルフサーブの価格がない |
| ビジュアル、機能、APIのテストを1つのワークフローで | 「Test Unit」はApplitools独自の指標で、単純なテスト件数ではない |
| 検出した変更をグループ化し、ワンクリックでまとめて承認する | 本番での完全な利用には、カスタム価格のPublic CloudまたはDedicated Cloudのティアが必要 |
| 2025年第4四半期のAutonomous Testing Platformsで、ForresterからStrong Performerとして評価 | コードを書かない人にとっては最も入りやすいが、高度なカスタムロジックには、やはりコードが役立つ |
料金: Starterには、50 Test Units、ユーザーと実行数が無制限の無料トライアルが含まれます。Public CloudとDedicated Cloudのプラン(50 Test Units以上、SSO、オンプレミスのオプション)はカスタムで、営業担当に問い合わせてください。出典:applitools.com/pricing。
最適な用途: Applitoolsの確立されたビジュアルリグレッションエンジンとセットで、自律的なエンドツーエンドのテスト生成を求めるチーム。
5. Katalon AI:手動テストと自動テストを1つのプラットフォームで、AIは無料で含まれる
Katalonの賭けは、幅広さです。ローコードとフルコードのテスト作成、手動のテストケース管理、クラウド実行、レポートを1つのプラットフォームでカバーし、AI AssistantとMCP Serverを、追加料金なしで、すべてのティアに組み込みました。多くの競合がAIをプレミアムなティアやカスタムの見積もりの裏に置いているこの分野では、この最後の点が重要です。KatalonのAIは、セルフヒーリング付きのスクリプト生成と、まだ完全には自動化する準備ができていないチーム向けの、AI支援による手動テストケースの生成の両方を担います。
オプションのTrue Production Insightsアドオンは、より自律的な領域に踏み込みます。実際のユーザーの動線を既存のテストカバレッジと突き合わせ、不足しているテストを自動生成します。録画を基本とするKatalon自身の標準よりも、ApplitoolsやRainforestの探索型のモデルに近いものです。
| 得られるもの | 得られないもの |
|---|---|
| AI AssistantとMCP Serverが、すべてのティアに無料で含まれる | ライフサイクル全体をカバーするには、3つの製品のうち2つを重ねる必要がある |
| 年払いで大幅に割引される、実際に公開されたシート単位の料金 | 年払いの割引には契約が必要で、月払いは大幅に高い |
| 失敗の根本原因と不安定なテストを検出するInsightsモジュール | セルフヒーリングの透明性(承認ゲート)が、明示的に文書化されていない |
| True Production Insightsアドオンが、不足しているテストカバレッジを自動生成する | その本番モニタリングのアドオンは、別途価格が設定され、販売されている |
料金: Katalon Studio Enterpriseは$180/シート/月(年払いで$84/シート/月)。True Platformは$70/シート/月(年払いで$59/シート/月)。True Automation(両方を組み合わせたもの)は$200/シート/月(年払いで$167/シート/月)。Enterpriseはカスタムです。出典:katalon.com/pricing。
最適な用途: 追加のAIの費用項目なしに、手動テストと自動テスト、そしてAIの支援を、1つのプラットフォームで求めるチーム。
6. testRigor:ユーザーの実際の行動から生成されるテスト
testRigorの中核にある考えは、そもそもセレクターは、壊れにくいテストの土台として間違っている、というものです。XPathやCSSのロケーターの代わりに、そのAIは、人と同じようにWebアプリやモバイルアプリを読み取るよう学習されており、本番で実際のユーザーがアプリケーション内をどう動くかを再現することで、テストを自動的に生成・保守できます。そのプロセスで、デフォルトで最大1,000件のテストケースをカバーします。何かが壊れると、testRigorは、同じ根本原因の影響を受けるすべてのケースをグループ化するため、チームは、壊れたロケーターを1つずつ追いかける代わりに、1回で直せます。
料金も、他とは違うという同じパターンに従っています。ユーザー単位もテスト単位も課金がなく、SSOは全社で含まれ、請求額全体は、必要な並列実行のインフラの量だけに応じて増えます。
| 得られるもの | 得られないもの |
|---|---|
| セレクターを推測し直すのではなく、ページを理解して自己修復する | クロスプラットフォームを完全にカバーする(Mac、Android、iOS、Windows Native)には、月$900かかる |
| 定額で、ユーザーとテストケースが無制限 | エントリーのティアはLinux Chromeのみで、モバイル中心のスイートには実質的な制約になる |
| 実際の本番のユーザーの行動から、テストを自動生成する | 自律的なカバレッジは、デフォルトで1,000件のテストケースが上限 |
| 関連する失敗を、修正可能な1つの問題にまとめる | エンタープライズ向けの公開価格はなく、カスタムプランには営業との対話が必要 |
料金: Private Linux Chromeは$300/月から。Private Complete(Ubuntu、Windows、Mac、Android、iOS、Windows Native、すべてのAI機能)は$900/月からです。公開評価用の、完全にパブリックな無料ティアもあります。Enterpriseはカスタムです。出典:testrigor.comの料金とFAQのページ。
最適な用途: シート単位の課金なしで、書かれた仕様ではなく、実際のユーザーの行動からテストを生成したいチーム。
7. Momentic:シート課金のない従量課金
Momenticは、そのAIが実際にいくらかかるかについて、このリストの中でも透明性の高い製品の1つです。すべてのプランがクレジットで計測され、超過料金(1クレジットあたり$0.01875)が公開されており、どのティアにもシート単位の課金がありません。無料プラン(月2,000クレジット、テスト実行およそ200回)は、小規模なチームが、何も支払う前に、じっくり評価するのに十分です。自然言語のロケーターが壊れやすいセレクターに取って代わり、自動修復するテストが軽微なUIの変更を吸収し、エージェントのリトライが一時的な失敗に対処します。実際のiOSとAndroidのエミュレーターでのモバイルテストも、無料ティアから含まれています。
そのシンプルな定額制のトレードオフは、とりわけモバイルなど、使用量が増えると、他のすべてと同じ共有クレジットプールから消費されることです。そのため、モバイル中心のスイートは、表示価格が示すよりも速く、許容量を使い切ることがあります。
| 得られるもの | 得られないもの |
|---|---|
| シート単位の料金がゼロ、料金は純粋に従量制 | エンタープライズ機能(SAML SSO、SCIM、監査ログ)には、カスタムの見積もりが必要 |
| 公開された、透明な超過料金 | セルフヒーリングの承認ゲートは文書化されておらず、修復は自動で適用される |
| GitHub ActionsとGitLab CIへのネイティブ対応 | モバイルのテストも、Webと同じクレジットプールから消費される |
| テキスト、ビジュアル、DOMにまたがるマルチモーダルなアサーション | 無料プランは2,000クレジットで強制的に止まり、超過のオプションがない |
料金: Freeは$0(月2,000クレジット)。従量課金は$125/月(月10,000クレジット)に、超過分が1クレジットあたり$0.01875です。Enterpriseはカスタムで、テスト量に応じて価格が決まります。出典:momentic.ai/pricing。
最適な用途: 人数が増えてもシート単位の上乗せがない、透明なクレジットベースの料金を求めるチーム。
8. Functionize:エージェント型テストへの、最も安価なセルフサーブの入り口
Functionizeは自社の製品を、率直に「Webの全UIワークフローのための、独立したテストエージェント」とブランド化しており、料金は、このリストの中で群を抜いて手が届きやすい水準です。月200クレジットの、実際に使える無料ティアと、月$20のProティアがあり、実際の利用が始まる前の、この分野の大半の料金のほんの一部です。Functionize自身の技術記事は、この分野全体が解決するために存在する、不安定なテストの問題に特に焦点を当てています。また、Maxティアには、より単純な自動化ツールではつまずくワークフロー向けに、SMSとMFA/OTPのテストが加わります。
チーム向けの料金は、モデルが変わります。GrowthとScaleのティアはユーザー単位で課金され、各ユーザーが、共有のチームプールではなく、それぞれのクレジットの許容量を持ちます。数シートを超えて拡大する前に、試算しておく価値があります。
| 得られるもの | 得られないもの |
|---|---|
| この分野で最も安価な有料の入り口($20/月) | GrowthとScaleのティアは、クレジットを共有プールではなく、ユーザー単位で課金する |
| MaxティアでのSMSとMFA/OTPのテスト | セルフヒーリングの承認ゲートは文書化されていない |
| 上位ティアで最大10の並列実行 | すべてのティアでデータの保持期間が1か月で、Enterpriseより下のティアも同様 |
| スプレッドシートで予測できるほどシンプルなクレジットモデル | プレミアムサポートとアカウント管理があるのは、Enterpriseのティアだけ |
料金: Freeは$0/月(200クレジット)。Proは$20/月(400クレジット)。Maxは$100/月(2,000クレジット、最大10の並列実行)。Growth(Team)は$40/ユーザー/月(400クレジット/ユーザー)。Scale(Team)は$200/ユーザー/月(2,000クレジット/ユーザー)。Enterpriseはカスタムです。出典:functionize.com/pricing。
最適な用途: 最初に予算を確保せずに、エージェント型テストを試したい小規模なチームや個人のQAエンジニア。
9. Reflect (SmartBear):コーディングエージェントが直接呼び出せるMCPサーバー
Reflectは、ノーコードのテストプラットフォームとして名を上げ、2024年にSmartBearの傘下に入って以来の最も特徴的な動きは、機能のチェック項目ではなく、アーキテクチャにあります。2026年3月時点で、コーディングエージェントがMCPサーバー経由でReflectに接続し、ツールとして使えます。自然言語のプロンプトでテストのステップを追加し、スクリーンショットでアプリケーションの状態を確認し、既存のテストのセグメントを再利用し、失敗したステップをリトライします。人が別のReflectのダッシュボードに切り替える必要はありません。セルフヒーリングは、コードベースのロケーターではなく、ビジュアルのオブジェクト検出で動作し、UIが変わると自動的に適応します。
その「自動」という表現は、注意深く読む価値があります。SmartBear自身の資料は、テストを「手動の介入なしに」更新する修復を説明しており、そのため、ReflectはApplitoolsやtestRigorが採るまとめてレビューする側ではなく、透明性のスペクトルの、自動寄りの端に位置付けられます。
| 得られるもの | 得られないもの |
|---|---|
| 接続したAIコーディングエージェントが、MCP経由で直接呼び出せる | どのティアにも、ドル建ての公開価格がない |
| UIの変更にまたがるセルフヒーリングのための、ビジュアルのオブジェクト検出 | 修復は、文書化された承認ステップなしに、自動で適用される |
| すべてのティアで、ユーザーとテスト作成が無制限 | モバイルのテストは、Webのテストの5倍のクレジットを消費する |
| 全機能が使える14日間の無料トライアル | Web、モバイル、APIのテストが、すべて1つの共有クレジットプールから消費される |
料金: Premium(月5,000クレジット)、Advanced(月20,000クレジット)、Enterprise(月40,000クレジット、プライベート環境のテスト)は、いずれもクレジット単位のティアで、ドル建ての価格は営業との対話まで非公開です。Webのテストは1クレジット、モバイルは5クレジット、APIは0.1クレジットです。出典:reflect.run/pricing。
最適な用途: すでにAIコーディングエージェントに標準化しており、確認すべき別のアプリではなく、そのワークフローの中で、ツール呼び出しとしてテストが行われることを求めるチーム。
10. Autify:2つの製品、1つのセルフヒーリングエンジン
Autifyは、1つのブランドの下で、2つの異なる製品ラインを運営しています。Aximoは、「Your Autonomous AI Tester」として売り出されており、クラウドベースで、テストのステップごとにクレジットが計測されます。内部では、特にClaudeのモデルで動作しています(料金ページでは、Sonnetクラスのステップがクレジット消費1倍、Haikuクラスのステップはそれより安く設定されています)。Nexusは、より従来型の対となる製品です。ノーコードとフルコードの作成を組み合わせた、Playwrightベースのツールで、コードレベルの制御を手放さずにAI生成を求めるチーム向けです。
どちらも、Webとモバイルにまたがるセルフヒーリングを共有していますが、2つの料金体系は財布を共有しません。チームが本当はNexusが必要だったのにAximoを選んだ場合(またはその逆)、料金の話し合いを最初からやり直すことになります。
| 得られるもの | 得られないもの |
|---|---|
| 自律型とコードベースの両方のテストスタイルをカバーする2つの製品 | クレジットもシートも共有しない、2つの別々の料金体系 |
| 明示的に自律型のテスターとしてブランド化され、構築されたAximo | Nexusは、ユーザー単位($250/月)、並列単位($150/月)、ワークスペースのアドオンが重なる |
| どちらの製品でも、Webとモバイルにまたがるセルフヒーリング | デスクトップアプリのテストは、AximoではEnterpriseのみ |
| 両方の製品ラインで、年払いの割引がある | 無料ティアはかなり限定的で、1ユーザー、Nexusではローカルのみ |
料金: Aximo Coreは$120/月(年払いで$99/月、月6,000クレジット)。Aximo Teamは$550/月(年払いで$450/月、月30,000クレジット)。Nexus Professionalは$400/月、または年$3,600(1ユーザー)です。どちらも、カスタムのEnterpriseティアが加わります。出典:autify.com/pricing。
最適な用途: 1つのベンダーとの関係の中で、完全自律型のテスター(Aximo)と、Playwrightベースのハイブリッド(Nexus)のどちらかを選びたいチーム。
11. Rainforest QA:人間のクラウドが背後にいる、AIによるテスト計画
Rainforest QAのAI Test Plannerは、アプリケーションを自動でマッピングして何をテストすべきかを提案し、ビジュアルなノーコードのインターフェースでテストを生成し、UIが変わると自己修復します。これは、このリストの他の複数の製品と同じ形です。Rainforestを際立たせているのは、その層の背後にあるものです。AIだけでは見逃してしまう、探索的なテストやエッジケースのテストを引き受けられる、人間のクラウドテスターがいて、重厚なスクリプト型の自動化と、手動のリグレッションテストの橋渡し役として位置付けられています。
その人間の層は、この分野全体が解決しなければならない、セルフヒーリングへの信頼の問題に対する、実際の答えです。しかし同時に、Rainforestの料金は、このリストで最も読みにくいことも意味します。何も公開されておらず、第三者の購入者データによって報告された実際の契約は、小規模チームで月およそ$1,500から、大量利用では月$7,000を大きく超える水準まで幅があります。
| 得られるもの | 得られないもの |
|---|---|
| AIのテスト計画とセルフヒーリング層の背後にいる、人間のクラウドレビュアー | ベンダーのサイトのどこにも、公開された価格がない |
| AI Test Plannerがアプリを自動でマッピングし、カバレッジを提案する | 人が支援するテストは、別のアドオンとして価格が設定されている |
| 専任の自動化エンジニアがいないチーム向けの、ビジュアルなノーコードのインターフェース | 報告されている実際の契約は、年間で5桁の金額をはるかに超える |
| 重いスクリプト作成なしに素早く出荷する必要があるチーム向けに、特化して作られている | 予算を立てるには、金額が示される前に営業との対話が必要 |
料金: 非公開。報道ベース(第三者による、匿名化された購入者の契約データに基づく)では、小規模チームが月およそ$1,500から$3,000、中規模チームが月$3,500から$6,500、エンタープライズが月$7,000から$12,000以上、平均の年間契約額が約$62,400です。出典:Vendr。Rainforest QA自身の料金ページは、営業との対話が必要です。
最適な用途: AIによるテスト計画を求めつつ、人間のレビュアーを介在させずにセルフヒーリングを信頼する準備ができていないチーム。
12. Meticulous:セレクターなし、テスト作成なし、あるのはセッションの再生だけ
Meticulousは、このリストの他のどの製品とも本質的に異なるアプローチを取っています。仕様書、クロール、録画からテストを生成する代わりに、(ステージングまたは本番の)実際のユーザーセッションを記録し、あらゆるプルリクエストで、新しいコードに対して決定論的に再生して、ビジュアルの違いを自動的にフラグ付けします。従来のロケーターに相当するものがないため、通常の意味で「自己修復」するものがありません。Meticulousの本当の技術的課題は、その逆です。実際には意味のないビジュアルの差分を除外し、チームが誤検知に埋もれないようにすることです。
そのため、このリストの他とは根本的に異なる買い物になります。特定のビジネスロジックを確認する、意図的に作り込んだスクリプト型のテストケースの代わりではなく、誰もテストを書こうと思わなかったリグレッションを捕捉する、メンテナンスゼロのセーフティネットです。
| 得られるもの | 得られないもの |
|---|---|
| テストの作成も保守もゼロ、セッションは自動的に取得される | 意図的に作り込んだ、スクリプト型のビジネスロジックのテストの代わりにはならない |
| ロケーターがないため、セルフヒーリングが間違える対象がない | 公開価格はなく、営業との対話が必要 |
| 設計上、すべてのプルリクエストに対して実行され、CIネイティブ | カバレッジは、どの実際のセッションが記録されるかに完全に依存する |
| オープンソースとパブリックリポジトリは無料 | 決定論的な再生は、エンドツーエンドのスクリプト作成全体よりも、狭い役割 |
料金: 非公開。カスタムで、営業担当に問い合わせと記載されています。オープンソースのプロジェクトとパブリックリポジトリは無料です。出典:meticulous.ai(本レビューの時点で、公開された料金ページなし)。
最適な用途: テストケースを1つも書いたり保守したりせずに、実際の利用に基づく自動のリグレッションカバレッジを求めるフロントエンドのチーム。
13. CoTester (TestGrid):バンドル型のAIテストチームメイト、シート単位の課金
CoTesterは、自社を「いつでも使えるAIのテストチームメイト」と位置付けており、TestGridのより広いエージェント型プラットフォームの上に構築されています。27を超えるAIテストエージェントをバンドルし、テストケースの生成、セルフヒーリング、バグの要約、ビジュアルテスト、パフォーマンステスト、APIテスト、ジオロケーションのテストをカバーして、エージェントごとの追加料金なしに、すべてのシートに含めています。実機とブラウザへのアクセスは、エントリーのティアから含まれており、特定のハードウェアでしかバグが現れないチームにとって重要です。
注目すべきは、シートの単価ではなく、最低シート数です。Starterは、始める前に4シートが必要で、実際の月額の下限は、$199という見出しの料金が示唆する額よりも、$800に近くなります。
| 得られるもの | 得られないもの |
|---|---|
| エージェント単位の料金なしにバンドルされた、27以上のAIテストエージェント | 最低4シートのため、実際の開始価格は月およそ$800 |
| エントリーのティアから使える、実機とブラウザへのアクセス | セルフヒーリングの透明性(承認ゲート)は、詳細には文書化されていない |
| 名前の付いたトリアージ機能として、バグの要約が組み込まれている | Growthティアのトークン許容量と価格は、どちらもカスタム |
| 最上位のティアで、オンプレミスまたはプライベートクラウドのオプション | エントリーのStarterパッケージに含まれるのは、月5,000トークンだけ |
料金: Starterは$199/シート/月、最低4シートで、4台のデバイス/ブラウザと月5,000トークンを含みます。Growthはカスタム(トークン無制限、実行の上限なし)。Custom Device Lab(オンプレミスまたはプライベートクラウド)も、カスタムです。出典:testgrid.io/pricing。
最適な用途: 機能、ビジュアル、パフォーマンス、APIのテストをカバーする、バンドル型のエージェントスイートを、機能ごとに別々に価格を設定せずに求めるチーム。
14. Ranger:コーディングエージェントが自分の失敗を直すために作られた
Rangerは、このリストで最も自律的な製品であり、他とは異なるユーザーのために作られています。結果をレビューするQAエンジニアではなく、自分の作業を素早く確実に確認する手段を必要とする、AIコーディングエージェントです。ranger goを実行すると、ブラウザを立ち上げ、機能をテストし、判定を返します。何かが失敗すると、コーディングエージェントがそれを拾い、根本のコードを修正し、Rangerで再テストします。そのサイクルは、明示的に「人が介在しない」ものです。テストは、サイトをナビゲートするAIエージェントが生成し、Playwrightとしてコード化されます。その後、スイートの一部として信頼される前に、Ranger自身の人間のQA専門家がレビューします。つまり、人によるレビューは、その後の実行のたびにではなく、テスト作成時に1回だけ行われます。

この設計は、本稿全体の主張に照らして、はっきり述べる価値があります。Rangerは、壊れたテストを黙って修復しようとはまったくしません。何かが壊れたら、正直に失敗し、その修正を、原因を作ったエージェントに渡します。スクリーンショット、録画、トレースが証拠として添付され、人がプルリクエスト上で確認できます。
| 得られるもの | 得られないもの |
|---|---|
| AIコーディングエージェント自身のリトライのループ向けに、特化して作られている | 個々の実行に人によるレビューはなく、最初のテスト作成時だけ |
| テストはオープンなPlaywrightにコンパイルされ、人間のQA専門家が1回レビューする | 価格はどこにも公開されておらず、すべての案件がデモから始まる |
| プルリクエストに添付できる証拠(スクリーンショット、録画、トレース) | ダッシュボードから結果を操作する、人間のQAエンジニア向けには作られていない |
| 信用できないセルフヒーリングがなく、失敗は正直に失敗する | 年間の、相談ベースの契約のみで、セルフサーブのティアはない |
料金: 非公開。年間契約で、テストスイートの規模に基づき、相談の後にカスタムの見積もりが出されます。ホスト型のテストインフラ、テストの作成、人間の専門家によるレビューを含みます。出典:ranger.net(公開された料金ページなし)。
最適な用途: AIコーディングエージェントを運用しており、人の関与を最小限にして、そのエージェントに自分の作業を検証し、修正させたいチーム。
選び方:意思決定フレームワーク
テストの作成モデル、セルフヒーリングの透明性、人によるレビュー、CIへの適合性、そしてスイートに合った料金の単位で選んでください。

| 必要なもの | 選ぶべき製品 | 理由 |
|---|---|---|
| QAの業務をすべて手放し、人がすべての失敗を確認してほしい | QA Wolf | Coverage as a Serviceは、AIによるテスト作成と、すべての失敗に対する24時間の人による調査を組み合わせる |
| Web、モバイル、API、アクセシビリティにまたがる1つのエージェント型プラットフォーム | Mabl | 「自ら構築し、自ら実行し、自ら復旧する」、クラウドの同時実行数は無制限 |
| 独立したアナリストの評価を受けた、エンタープライズ級のテスト | Testim (Tricentis) | GartnerのAI-Augmented Software Testingの初のMQと、ForresterのAutonomous TestingのWaveでLeaderに選出 |
| 自律的なエンドツーエンドの生成と一体になったビジュアルリグレッション | Applitools Autonomous | URLのリストをスキャンして完全なスイートにし、変更をまとめてワンクリックで承認できる |
| 手動テストと自動テストを1つのプラットフォームで、AIは無料で含まれる | Katalon AI | AI AssistantとMCP Serverが、追加料金なしですべてのティアに付属 |
| セレクターではなく、実際の本番トラフィックから生成されるテスト | testRigor | 人と同じようにアプリを読み取り、CSSやXPathなしで自己修復する |
| シート単位の上乗せがない、透明な従量課金 | Momentic | 超過料金が公開され、どのティアでもシート料金がゼロ |
| エージェント型テストを試す、最も安価な方法 | Functionize | 月$20のProティアで、実際の機能が使える |
| コーディングエージェントの内側で、ツール呼び出しとして動くテスト | Reflect (SmartBear) | エージェントが直接呼び出せるMCPサーバーとして提供される |
| 1つのベンダーで、自律型とコードベースのテストのどちらかを選びたい | Autify | 自律テストにはAximo、Playwrightベースの制御にはNexus |
| 自動の合格だけでなく、AIの背後にいる人間のレビュアー | Rainforest QA | AIのテスト計画とセルフヒーリング層の背後に、人間のクラウドテスターがいる |
| テスト作成が不要な、メンテナンスゼロのリグレッションカバレッジ | Meticulous | 実際のセッションを記録し、新しいコードに対して再生する、オープンソースは無料 |
| 最も自律的で、コーディングエージェント自身のループ向けに作られた選択肢 | Ranger | 修正と再テストのサイクルに、設計上、人が介在しない |
QAエージェントの購入で避けるべき失敗
署名の前に、修復の範囲、承認ログ、探索の深さ、不安定なテストへの挙動、最低利用条件、実際のクレジット消費を確認してください。

| 失敗 | 具体的な状況 | 代わりにすべきこと |
|---|---|---|
| 何を修復するか確認せずに、セルフヒーリングを信頼する | 「セルフヒーリング」が、どのベンダーでも同じ意味だと思い込む | 具体的に尋ねる:ロケーターだけを直すのか、アサーションにも手を触れるのか |
| 承認ゲートの有無を確認しない | 毎スプリント緑のビルドが続くが、何件のテストが自動修復されたか分からない | すべての修復が、黙って適用されるだけでなく、記録されレビューできるかを尋ねる |
| 探索と実行を混同する | 「AIを使っている」から、カバレッジのギャップを見つけてくれると思い込む | アプリを自らクロールするのか、書いたものだけを実行するのかを確認する |
| 見出しのシート価格で予算を立てる | CoTesterを$199/月と見積もり、最低4シートを見落とす | 最低利用条件、クレジットプール、ユーザー単位のアドオンの細則を読む |
| 無料トライアルが、実際の請求額を予測してくれると思い込む | 200クレジットでテストした後、モバイル中心のスイートに拡大する | 契約前に、実際のテスト量を、クレジットとドルの換算レートに当てはめて試算する |
| コーディングエージェントの購入と同じ感覚で扱う | CursorやClaude Codeを評価するのと同じやり方で、QAエージェントを評価する | コード生成の速さではなく、テストのカバレッジと欠陥の検出で評価する |
| 不安定なテストの話をしない | セルフヒーリングを目当てに購入し、不安定さが消えると思い込む | マーケティング上の主張だけでなく、ベンダー自身の、不安定な失敗と本物の失敗の比率を尋ねる |
| 更新時に料金を再確認しない | 料金モデルを再編している最中の分野で、過去の見積もりから予算を立てる | ベンダーの現在のページを再確認する。使用量とクレジットベースの料金は、頻繁に変わる |
次のステップ
1つのエージェントを選び、年間契約に署名する前に、スイートの中で実際にすでに不安定な部分に対して、2〜3週間実行してください。1回のセルフヒーリングを信頼する前に、ベンダーにログを見せてもらってください。何が、いつ変わったのか、そして人が承認する必要があったのかどうかです。営業との対話でそれに答えられないツールは、ブラックボックスを信頼し、リリースのゲートを任せるよう求めています。この機能を購入するのではなく、自分たちで構築する方向に傾いているなら、AI QA testing agent blueprintが、これらのベンダーが売っているのと同じ、実行・確認・引き継ぎの設計を順に説明しています。また、AI code review agent blueprintは、テストが実行される前に、プルリクエストそのものを審査するという、隣接する業務を扱っています。そして、この判断の土台となる、より広いエージェントプラットフォームをまだ決めていない場合は、2026年のAIエージェントプラットフォームのおすすめが、その層を最初に選ぶための、中核となるガイドです。

On this page
- 2026年8月更新:変更点
- 重要なポイント
- 比較早見表
- セルフヒーリング:バグを隠してしまうこともある機能
- 自分でテストを書くのか、与えられたものを実行するだけか
- CI/CD連携と失敗のトリアージ
- 料金モデル:シート、クレジット、予算が想定外になる場面
- 規模とペルソナの表
- 1. QA Wolf:すべての失敗を人がレビューする体制に支えられた、AIによるテスト作成
- 2. Mabl:自ら構築し、実行し、修復するカバレッジ
- 3. Testim (Tricentis):エンタープライズの自律テストにおけるGartnerとForresterのLeader
- 4. Applitools Autonomous:URLのリストを、完全なテストスイートに変える
- 5. Katalon AI:手動テストと自動テストを1つのプラットフォームで、AIは無料で含まれる
- 6. testRigor:ユーザーの実際の行動から生成されるテスト
- 7. Momentic:シート課金のない従量課金
- 8. Functionize:エージェント型テストへの、最も安価なセルフサーブの入り口
- 9. Reflect (SmartBear):コーディングエージェントが直接呼び出せるMCPサーバー
- 10. Autify:2つの製品、1つのセルフヒーリングエンジン
- 11. Rainforest QA:人間のクラウドが背後にいる、AIによるテスト計画
- 12. Meticulous:セレクターなし、テスト作成なし、あるのはセッションの再生だけ
- 13. CoTester (TestGrid):バンドル型のAIテストチームメイト、シート単位の課金
- 14. Ranger:コーディングエージェントが自分の失敗を直すために作られた
- 選び方:意思決定フレームワーク
- QAエージェントの購入で避けるべき失敗
- 次のステップ