2026年のおすすめAIリサーチエージェント:出典付きで引用可能なレポートを作る10ツール

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
AIリサーチエージェントが最も力を発揮するのは、複数ステップの文献調査やウェブ調査を、出典付きのレポートにまとめたいアナリスト、ストラテジスト、研究者です。上位の製品は用途によって分かれます。すでに契約しているチャットアプリの中で汎用的な調査をするなら OpenAI Deep Research と Google Gemini Deep Research、正式な学術文献の調査なら Elicit と Undermind、引用が本当に主張どおりのことを述べているかを確かめるなら Scite です。このガイドでは10製品を順位付けし、機能の一覧よりも重要な1つの問いを軸にしています。エージェントが引用付きの主張を示したとき、すべての情報源を自分で開かなくても、その引用を信頼できるでしょうか。
この問いが、このカテゴリのすべてです。AIリサーチエージェントは、AIリサーチツールとは違います。ツール(検索ボックス、チャットアシスタント、要約ツール)は、すべてのステップに人が関わり続けることを前提に補助します。エージェントは、複数ステップの調査を自分で計画し、検索を実行し、見つけたものを読み、次に何を確認するかを決め、引用を添えた統合レポートを、各ステップを人が承認することなくほぼ自力で返します。この自律性こそが価値そのものですが、同時に、捏造された情報源や誤って帰属された情報源が気づかれないまま紛れ込む、まさにその場所でもあります。このガイドの対象は、汎用および学術分野の調査、つまり情報を集め、検証し、レポートに統合することです。競合や商業的な市場インテリジェンスが特に必要な場合は、より限定的で隣接する購入判断であり、別に扱っています。購入する製品ではなく、リサーチエージェントの設計そのものを知りたい場合は、構築側のResearch Agent のブループリントをご覧ください。そして、何をもってエージェントと呼ぶのかという基本的な定義については、AIエージェントとはが、以下のツールがいずれも何らかの形で実装している計画・実行・観察のループを扱っています。
2026年8月更新。 以下の料金は、確認時に読み込めた場合は各ベンダー自身の料金ページまたはサポートページから取得しています。ベンダーのページが自動アクセスをブロックした場合、その数値には(報告値)と表記し、単一の情報源から採用するのではなく、少なくとも2つの独立したトラッカーで照合しています。
2026年の変更点
- Deep Research は、1つのラボの機能から、当たり前の機能になりました。 OpenAI は2025年2月に、最初の主流となる Deep Research モードを提供しました。2026年半ばまでに、Google、Anthropic、Perplexity のすべてが同等のエージェント型リサーチモードを提供しており、競争の焦点は、この機能があるかどうかではなく、深さ、情報源のカバー範囲、1回の実行あたりの価格に移っています。
- You.com は、一般ユーザー向けのリサーチエージェントを終了しました。 You.com が2025年初めにビジネスユーザー向けに立ち上げた単体のリサーチエージェント ARI は、現在の料金ページから姿を消しています。You.com は現在、アナリストが直接実行するレポートではなく、自分でエージェントを構築する開発者向けの、使用量課金の Research API を販売しているため、以下の順位付けリストには含まれません。
- 料金体系は、まだ試行錯誤が続いています。 OpenAI は2026年4月に、Plus と既存の$200の Pro プランの間に位置する新しい Pro 層のオプションを追加し、Google は AI Pro の下に、より低価格の AI Plus プランを追加しました。どちらの動きも、実際のアナリストがレポートをどのくらいの頻度で実行する必要があるのかを、ベンダーがまだ探っていることを示唆しています。購入前に、最新のプラン一覧を確認し直してください。
重要なポイント
- 8つのAI検索ツールを20のニュースパブリッシャーに対して試した1,600件のクエリで、チャットボットは全体として60%を超える割合で誤って回答し、ツール別の誤答率は37%(Perplexity)から94%(Grok 3)に及びました(Columbia Journalism Review の Tow Center による2025年の調査、CJRによる)。
- 同じ CJR の調査では、ChatGPT はテストした200本の記事のうち134本を誤って特定した一方で、確信のなさを示したのは15回だけでした。つまり、自信のある口調は、エージェントの引用が正しいことの証拠にはなりません。
- 汎用モデル(GPT-3.5、Llama 2、PaLM 2)が20万件を超える法律調査クエリに回答した、以前の Stanford の調査では、ハルシネーション率は69%から88%でした。これは、根拠に基づいて引用を優先するリサーチエージェントが減らすために存在している、まさにその失敗パターンです(Stanford HAIによる)。
- 汎用のAIエージェントは、実際のコンピュータ操作タスクのベンチマークである OSWorld で、過去1年間に成功率が12%からおよそ66%へと跳ね上がりましたが、それでも構造化されたタスクでは、約3回に1回は失敗します(Stanford HAI の2026 AI Index レポート、Stanford HAIによる)。
- 現在、57%の組織がAIエージェントを本番環境で稼働させており、従業員1万人以上の企業では67%に上ります(1,340人の実務者を対象とした LangChain の State of Agent Engineering 調査、LangChainによる)。
比較早見表
| ツール | 最適な用途 | 開始価格 | 主な強み | 主な制約 |
|---|---|---|---|---|
| OpenAI Deep Research | ChatGPT 内での汎用的な調査 | Plus 月額$20(月10回の実行、報告値) | 広範なウェブ閲覧、1回の実行で数十ページ | Plus でも、実行回数に月ごとの上限がある |
| Google Gemini Deep Research | Google Workspace のユーザー | 無料(月5レポート)、AI Pro は月額約$19.99(報告値) | Google 検索と Workspace のデータに基づく | 完全な Deep Research には有料プランが必要 |
| Anthropic Claude Research | すでに Claude を使い込んでいるアナリスト | Pro は月額$17〜$20から(年払い/月払い) | Gmail、カレンダー、ドキュメントとのネイティブな連携 | 通常のメッセージ枠を共有し、別の上限がない |
| Perplexity Deep Research | 長く待たずに、引用付きの素早い回答 | 無料(1日約5回)、Pro は月額$20(報告値) | 1レポートが数十分ではなく数分 | 書式と深さは、学術向けに作られたツールに及ばない |
| Elicit | 正式なシステマティックレビュー | 無料、Pro は月額$49(年払いで年$588) | 「Research Agent」の名を冠し、最大5,000本の論文をスクリーニング | 無料プランの Research Agent の利用には上限がある |
| Consensus | 素早く、エビデンスで重み付けした回答 | 無料、Premium は月額約$9、Deep は月額約$45(報告値) | エビデンスがどちらに傾いているかを示す Consensus メーター | 特定の問い向けで、レビュー全体向けではない |
| Undermind | キーワード化しにくい、曖昧な文献の問い | 無料(月3回の深い検索)、Pro は月額$16(年払い) | 反復型のエージェントが、数百本の論文を読んで適応 | 1回の深い検索に8〜10分かかる |
| Exa | カスタムのリサーチエージェントを構築するチーム | 従量課金、Search は1,000リクエストあたり$7 | エージェントのパイプライン向けに作られた、クリーンで構造化された検索 | 開発者向けの API で、クリックして使うレポートツールではない |
| Scite | 引用が実際に何を裏付けているかの検証 | Individual は月額$20(年払いで月額$12、報告値) | Smart Citations:Supporting、Contrasting、Mentioning | 一次的な調査や発見のエージェントではない |
| STORM | 無料でセルフホストし、完全に制御 | 無料、オープンソース(MIT) | 多角的な調査に加え、引用付きの記事の執筆まで | ベンダーのサポートも、洗練された一般ユーザー向け UI もない |
エージェントと検索ツールを分けるもの
「AIリサーチ」として売られているものがすべて、自分で次のステップを計画するわけではありません。ランク付けされたリンクを返す検索ボックスは、ツールです。1回の検索結果から回答するチャットボットは、引用を載せただけのツールです。ここでエージェントという言葉に値するのは、複数のステップにわたる自律性です。システムが最初に何を検索するかを決め、返ってきたものを読み、それで十分か、別の角度からもう一度検索する必要があるかを判断し、そのうえで初めてレポートを書きます。途中の各ステップを、あなたが承認することはほとんどありません。だからこそ、OpenAI Deep Research、Gemini Deep Research、Claude Research、Perplexity Deep Research がこのリストの軸になっています。どのベンダーも、条件を満たさない、単一パスの通常のチャットモードも提供しているにもかかわらずです。

このガイドが、隣接する2つのガイドと別である理由でもあります。学術研究向けおすすめAIツールと科学研究向けおすすめAIツールは、単一目的のリサーチソフトウェア、つまり発見のための検索、文献管理ツール、執筆アシスタントなど、人がすべてのステップを動かすものを扱っています。以下のベンダーのいくつか(Elicit、Consensus、Perplexity)は、両方の世界に登場します。無料またはエントリーのプランは検索ツールに近く、有料の Research Agent または Deep Search モードは本当の意味でエージェント型だからです。そうした区別がある場合、このガイドではエージェント型のモードを特に評価しています。また、リサーチエージェントは、商業的または競合の市場インテリジェンス向けのエージェントとは購入判断が異なります。後者は、独自の最終候補を持つ、より限定的でビジネス特化の調査業務です。
このガイドは、より広い購入判断の1段下にも位置します。ノーコード、マネージド型エンタープライズ、開発者向けフレームワークといった、エージェントプラットフォームの種類をまだ選んでいない場合は、おすすめAIエージェントプラットフォームから始めてください。おすすめAIコーディングエージェントがその総合ガイドに対して持つのと同じ関係で、はるかに大きなカテゴリの中の、特定の業務に絞った一部です。
引用の信頼性:これらのツールを実際に分けるもの
引用の信頼性を飛ばすリサーチエージェントの比較記事は、唯一重要なことを飛ばしています。以下のツールはいずれも引用を生成します。しかし、すべてのツールが同じ方法で引用を生成するわけではなく、その仕組みによって、自分で確認せずにどこまで信頼すべきかが決まります。

| ツール | 情報源の取得方法 | 構造上の捏造リスク | 検証方法 |
|---|---|---|---|
| OpenAI Deep Research | ライブのウェブ閲覧、ページ全体を読む | 情報源を引用した統合文章を生成し、Deep Research に標準的なリスク | リンク先の各情報源を直接開く |
| Google Gemini Deep Research | ライブのウェブに加え、Google 検索による根拠付け | 上記と同じ、生成による統合のリスク | リンク先の各情報源を直接開く |
| Claude Research | ライブのウェブに加え、接続した Gmail/カレンダー/ドキュメント | 同じ生成による統合のリスクに加え、接続したドキュメントが確認すべき2つ目の面になる | 情報源を開き、接続したドキュメントの引用が実際のファイルと一致するか確認する |
| Perplexity Deep Research | 1回の実行で多数の情報源にまたがるライブのウェブ | 生成による統合で、CJR の調査は Perplexity の基本の検索モードの誤答率を37%と測定 | リンク先の各情報源を直接開く |
| Elicit | 1億3,800万本の論文インデックスに対する検索(elicit.com による) | より低い:抽出テーブルは、自由形式の生成ではなく索引化された論文から取得 | 抽出された項目を、元の PDF と照らして抜き取り確認する |
| Consensus | 査読済み論文の索引化されたコーパスに対する検索 | より低い:Consensus メーターは、生成された主張ではなく、実在する索引化された研究を反映 | メーターだけでなく、メーターの背後にある研究を確認する |
| Undermind | 反復的な検索、実際に索引化した論文だけを提示 | このリストで最も低い:論文リストを返すため、結果にない論文を作り出せない | 引用する前に、返された論文のアブストラクトを読む |
| Exa | 構造化された、根拠のある結果を返すニューラル検索 API | 構築するチームが統合をどう設定するかに完全に依存 | Exa の上に構築するチームが実装する検証内容による |
| Scite | 既存の引用文を分類し、新しい主張は生成しない | 最も低い:引用元の論文が実際に述べたことを、引用文付きで報告 | ラベルだけでなく、Scite が示す引用文の文脈を読む |
| STORM | ライブのウェブまたはユーザー提供のドキュメント、全体にわたって引用 | 生成による統合で、チャット型のエージェントと同じカテゴリ | あらゆる生成型エージェントと同様に、引用を情報源のページと照らして確認する |
パターンはこうです。統合された文章の生成を軸にしたツール(OpenAI、Gemini、Claude、Perplexity、STORM)は、設計上、捏造のリスクが高くなります。言語の生成と引用の正確さは、別々の2つの能力を組み合わせたものだからです。検索と分類を軸にしたツール(Elicit、Consensus、Undermind、Scite)は、構造上、生成型の要約のように情報源を作り出すことができません。その出力は、「こう結論づけた」よりも、「こういうものを見つけた」に近いからです。どちらのカテゴリが本質的に有用ということはなく、答える問いが違います。しかし、成果物が特定の数字や引用に依存しているなら、それをさらに引用する前に、どちらのカテゴリが生み出したものかを把握してください。
情報源のカバー範囲とアクセス
| ツール | ライブのウェブ | 学術インデックス | 有料コンテンツ | 備考 |
|---|---|---|---|---|
| OpenAI Deep Research | あり | 専用のインデックスなし | アクセスできないものはスキップまたはフラグ付け | 汎用のウェブの幅広さで、文献に特化していない |
| Gemini Deep Research | あり、Google 検索経由 | 専用のインデックスなし | アクセスできないものはスキップまたはフラグ付け | Google がインデックスするものには強い |
| Claude Research | あり | 専用のインデックスなし | スキップまたはフラグ付け、接続したドキュメント/ドライブは読める | 自分のドキュメントも回答の一部になる場合に最適 |
| Perplexity Deep Research | あり | Academic Focus モードで査読済みの情報源に絞り込む | アクセスできないものはスキップまたはフラグ付け | 学術モードを備えた汎用のウェブツールで、学術向けには作られていない |
| Elicit | 限定的、インデックス優先 | 1億3,800万本の論文(elicit.com) | 公開されている場合は全文 | 文献向けに作られており、汎用のウェブの質問向けではない |
| Consensus | なし | 索引化された査読済みコーパス | 全文が非公開の場合はアブストラクトレベル | 具体的で答えられるエビデンスの問いに最適 |
| Undermind | なし | 大規模な索引化された文献コーパス、正確な規模は独立して確認されていない | 全文が非公開の場合はアブストラクトレベル | 反復的な検索が、キーワード検索では見逃す論文を見つける |
| Exa | あり、リアルタイムのニューラル検索 | 構築するチームが設定可能 | 設定による | インフラであり、カバー範囲は自分で構築したもの次第 |
| Scite | 独立した発見機能なし | 16億件以上の引用文(scite.ai) | 引用の文脈を読み、論文全体は読まない | 検証層であり、発見のためのエンジンではない |
| STORM | あり、差し替え可能な検索バックエンド(Bing、DuckDuckGo、You.com、または自前のドキュメント) | 設定したバックエンド次第 | バックエンドによる | 検索エンジンを自分で選ぶ |
検証ワークフロー:引用付きレポートを信頼する前に確認すること
上記のツールのどれも、アナリストの代わりにはなりません。すべてが、判断を下す責任を持ち続ける人に、下書きを引き渡すように設計されています。これは、Research Agent のブループリントがデフォルトで組み込んでいるのと同じ引き継ぎパターンです。エージェントが統合し、人が検証して判断します。引用付きのレポートを手元から出す前に、このチェックリストを実行してください。

- 意外に見える情報源だけでなく、レポートが頼っているすべての情報源を開いてください。 CJR の調査では、ChatGPT で、自信ありげな誤答が、不確かさを示した誤答の約9倍に上りました。つまり、口調は正確さについて何も教えてくれません。
- 学術的な引用は、繰り返す前に Scite のようなチェッカーに通してください。 実在し、取得できる論文に行き着く引用でも、その論文が見つけたことを誤って述べていることがあります。Scite の Supporting、Contrasting、Mentioning のラベル(実際の引用文付き)が、そのギャップを捕まえます。
- 単一の情報源にしか基づかない主張は、自分の名前が入る成果物に載せる前に、2つ目の独立した情報源と照らし合わせてください。 矛盾する情報源について、構築側のブループリントが推奨するのと同じ、権威の序列の規律です。
- エージェントが、引用している有料の情報源やログインが必要な情報源を、実際に読んだかを確認してください。 タイトルや検索スニペットから内容を推測していないかを見るのです。ほとんどのツールは、確認すればフラグを立てますが、自分から知らせてくれるものはほとんどありません。
- 取得日を確認してください。 レポートは、最後の検索パスと同じだけ新しいものです。「情報源の最終取得日」の行(またはその欠如)が、今日のエビデンスを見ているのか、古い下書きを見ているのかを教えてくれます。
- 整った要約だけでなく、元の情報源のリストとタイムスタンプも保管してください。 後で調査結果に異議が唱えられたときに、調査をたどり直せるようにするためです。Elicit、Exa、Undermind はいずれもデフォルトでこれを保存しますが、チャット型のエージェントは、明示的に頼む必要がよくあります。
あらゆるエージェントの出力が、行動に移せるほど信頼できるかをテストするための、より一般的なフレームワークについては、AIエージェントの評価方法が、引用の確認にとどまらない、タスクの成功指標と複数ステップの挙動の採点を扱っています。規制対象のチームが触れる前に、リサーチエージェントが調達やセキュリティのレビューを通過する必要があるなら、おすすめエンタープライズAIエージェントプラットフォームが、そのガバナンス層を特に扱っています。
1. OpenAI Deep Research:ChatGPT 内で最も広くウェブを読む
Deep Research は、ChatGPT の中でエージェント型のモードとして動作します。複数ステップの検索を計画し、1回の実行で数十ページを読み、質問の広さに応じて、引用付きのレポートを返すまでに5分から30分かかることがあります。Plus の契約者にとっては、ほとんどの専門家がすでに開いている製品の中にあるため、新しいベンダーを加えずにエージェント型の調査を行う最速の方法です。
注意点は、月ごとの上限です。Plus には月10回の Deep Research の実行が含まれており、調査の多い1週間に2〜3回を使うまでは、十分に思えます。OpenAI は2026年4月に、Plus と既存の$200の Pro プランの間に、新しい$100の Pro 層のオプションを追加しました。$200のプランには月250回の実行が含まれ、Deep Research をたまにではなく、毎日のツールとして使う人向けです。
| 得られるもの | 得られないもの |
|---|---|
| 1回の実行で数十ページにわたる、広範で汎用的なウェブ閲覧 | Plus では月10回の実行のみで、使い切りやすい |
| すでに ChatGPT に支払っているなら、新しいベンダーは不要 | 専用の学術論文インデックスなし |
| ほとんどのアナリストがすでに知っているツールの中で動作 | 料金プランが2026年に2回変わったため、購入前に確認し直すこと |
料金(報告値、OpenAI の料金ページは執筆時に直接確認できませんでした): Plus 月額$20(月10回の Deep Research の実行)、2026年4月に追加された新しい Pro 層は月額$100、Pro は月額$200(月250回の実行)。購入前に openai.com/chatgpt/pricing で、最新の構成を確認してください。
最適な用途: すでに ChatGPT を使っていて、専門ツールを追加せずに汎用的なウェブ調査をしたいアナリスト。
2. Google Gemini Deep Research:Google 検索と Workspace に基づく
Gemini の Deep Research モードは、Google が常に持っている強みに賭けています。オープンなウェブに加え、Workspace や検索履歴にあるものすべてです。実際の複数ステップの機能そのものに本物の無料プランがあるのは、このリストで唯一のエージェントで、チャットモードだけではありません。Google の無料プランには、料金を支払う前に、月最大5件の Deep Research レポートが含まれます。
有料プランは、機能ではなく使用量に応じて拡張されます。AI Pro(報告では月額約$19.99)は、Google の最新の Gemini モデルでの完全な Deep Research を解放し、AI Ultra(報告では、5倍の使用量で月額$99.99、20倍で月額$199.99)は、最高の上限に加えて、Google のより熟考型の推論モードである Deep Think を追加します。Google は2026年に、Free と Pro の間に、より低価格の AI Plus プランも導入しましたが、その正確な価格は、執筆時点では USD で確認できませんでした。現在の地域別価格は、gemini.google/subscriptions で確認してください。
| 得られるもの | 得られないもの |
|---|---|
| 本物の無料プラン:月5件の Deep Research レポート | 全機能の Deep Research には、依然として AI Pro が必要 |
| Google 検索に加え、接続すれば Workspace のデータに基づく | 専用の学術論文インデックスなし |
| Ultra プランで、使用量に応じた明確な拡張(5倍、20倍) | Ultra の料金は、たまにしか使わない人には大きな跳ね上がり |
料金(報告値、Google の料金ページは執筆時に地域別の数値を返しました): Free(月5レポート)、AI Pro は月額約$19.99、AI Ultra は月額$99.99(5倍の上限)または月額$199.99(20倍の上限)。最新のプランは gemini.google/subscriptions で確認してください。
最適な用途: Google Workspace で標準化しているチームと、料金を支払う前に本物の Deep Research エージェントを無料で試したい人。
3. Anthropic Claude Research:ネイティブな Workspace との連携
Claude の Research 機能は、Anthropic 自身のサポートドキュメントで確認されているとおり、エージェント的に動作します。互いに積み上がる複数の検索を実行し、次に何を調べるかを決め、Anthropic が「引用を簡単に確認できる、徹底した回答を数分で」と説明するものを提供します。差別化要因は、オープンなウェブ以外に何を根拠にできるかです。接続すると、Claude Research は Gmail、Google カレンダー、Google ドキュメントから情報を取り込むため、レポートは社内の自分のドキュメントを、外部の情報源と並べて、1回のパスで引用できます。
Research は Pro 以上(Pro、Max、Team、Enterprise)で利用でき、無料プランでは利用できません。また、独自の別枠が与えられるのではなく、通常の会話と同じ使用量のプールから消費されるため、調査の多い1週間は、通常の上限をより早く使い果たします。
| 得られるもの | 得られないもの |
|---|---|
| 接続した場合の、Gmail、カレンダー、ドキュメントとのネイティブな連携 | 専用の学術論文インデックスなし |
| 自身の調査結果の上に積み上がる、エージェント型の複数検索 | 別枠はなく、通常のメッセージ上限を共有する |
| Anthropic が数分で提供されると説明する、引用付きの回答 | 無料プランでは利用できない |
料金: Pro 月額$17(年払い)または月額$20(月払い)、Max は月額$100から、Team は1シートあたり月額$20〜$100、Enterprise はカスタム(claude.com/pricing による)。
最適な用途: すでに Claude で作業していて、オープンなウェブだけでなく、自分の Workspace のドキュメントに基づく調査をしたいアナリスト。
4. Perplexity Deep Research:このリストで最も速い所要時間
Perplexity の Deep Research モードは、速度のために深さをいくらか犠牲にしています。複数の検索と推論のパスを実行しますが、OpenAI のモードで知られる長い実行ではなく、数分で引用付きのレポートを返すように作られています。決定的なシステマティックレビューではなく、会議の前に説得力のある最初の下書きが必要な、動きの速いストラテジストにとって、その速さがすべてです。
無料プランには、1日に数回の Deep Research クエリ(報告では約5回)が含まれ、月額$20の Pro は、その枠を大幅に拡大します。Perplexity の Academic Focus モードは、全プランで利用でき、結果を査読済みの情報源に特に絞り込むため、引用に敏感なものには有効にする価値があります。独立したテスト(前述の CJR の調査)では、Perplexity の基本の検索モードの誤答率は37%と測定され、テストした8つのツールで最も低かったものの、丸め誤差ではなく、本物の誤答率です。
| 得られるもの | 得られないもの |
|---|---|
| 1レポートが数十分ではなく数分 | 深さと書式は、学術向けに作られたツールに及ばない |
| Academic Focus モードで査読済みの情報源に絞り込む | 無料プランの1日あたりの枠は、ヘビーな利用には少ない |
| CJR の調査で、8つのツールの中で最も低い測定誤答率 | 37%は、合格ではなく、依然として本物の誤答率 |
料金(報告値、Perplexity の料金ページは執筆時に直接確認できませんでした): Free(1日約5件の Deep Research クエリ)、Pro は月額$20または年額$200、Max は月額$200、Enterprise Pro は1ユーザーあたり月額$40(月50件の Deep Research クエリ)。現在の上限は perplexity.ai/pro で確認してください。
最適な用途: 網羅的なものより、素早く引用付きの最初のパスを必要とするストラテジスト。
5. Elicit:文字どおり「Research Agent」という名の製品
Elicit は、このカテゴリに最も文字どおり当てはまります。自身の料金ページが、この機能を「Research Agent」「Research Reports」と直接呼んでおり、汎用のウェブの質問ではなく、システマティックレビューの作業向けに作られています。Systematic Review Workflow は、Pro プランで最大5,000本の論文(Enterprise では40,000本)をスクリーニングし、定義した列に構造化された比較可能なデータを抽出できます。かつては数週間の手作業によるスクリーニングだったものを、人がレビューする数時間のパスに変えるのです。
Elicit は、自由形式のウェブ要約を生成するのではなく、1億3,800万本の論文の索引化されたベースから検索するため、その捏造リスクは、上記のチャット型のエージェントより構造的に低くなっています。抽出されたテーブルのセルは、統合された段落ではなく、開くことのできる特定の論文にたどれます。無料の Basic プランでは、実際のアクセス(全インデックスにわたる無制限の検索とチャット)が得られますが、Research Agent と Research Report の利用には上限があるため、本格的なシステマティックレビューの作業には Pro が必要です。
| 得られるもの | 得られないもの |
|---|---|
| 文字どおりの Research Agent、最大5,000本の論文をスクリーニング(Pro) | 無料プランの Research Agent の利用には上限がある |
| 文章ではなく、比較可能なテーブルへの構造化された抽出 | 一般的なビジネスやウェブの調査向けには作られていない |
| より低い捏造リスク:生成ではなく検索ベース | 最大規模のレビュー(4万本の論文)には Enterprise の料金が必要 |
料金: Basic は無料(Research Agent/Report の利用は限定的)、Pro は月額$49または年払いで年額$588、Scale は月額$169または年払いで年額$2,028(Pro の5倍の使用量)、Enterprise はカスタム(elicit.com/pricing による)。
最適な用途: 素早い回答ではなく、説得力のある構造化された文献レビューを必要とする、博士課程の研究者、システマティックレビューの担当者、R&D チーム。
6. Consensus:素早く、エビデンスで重み付けした回答
Consensus は、1つの仕事を中心に作られています。具体的な調査の問いに、査読済みのエビデンスの実際のバランスで答えることで、単一の統合された段落ではなく、視覚的な Consensus メーター(賛成、反対、あるいは混在する研究の数)として示されます。狭く、答えられる問いを投げれば、Consensus は、エッセイを書こうとするのではなく、エビデンスが実際にどこにあるかを見せようとするため、汎用の Deep Research モードより、説得力のある答えに速くたどり着くことがよくあります。
Deep Search 機能(Deep プラン、報告では月額約$45)は、これをエージェント型の領域へと広げます。1つのメーターを示すのではなく、1回のクエリで最大200本の論文にわたる調査結果を統合します。Free プランには、限定的ながら実際の枠(月15件の Pro メッセージと3回の Deep Search)が含まれ、料金を支払う前に、その形式が自分のワークフローに合うかを試すには十分です。
| 得られるもの | 得られないもの |
|---|---|
| 索引化された研究全体での実際の合意を示す Consensus メーター | 広い探索ではなく、狭く答えられる問い向けに作られている |
| 1回のクエリで最大200本の論文にわたって統合する Deep Search | Elicit のような完全なシステマティックレビューのワークフローではない |
| 形式を試すのに実際に使える無料プラン | Deep プランの料金は、同程度の深さの競合のいくつかより高い |
料金(報告値、2026年7月に確認した consensus.app/pricing と一致): Free(15件の Pro メッセージ、月3回の Deep Search)、Premium は月額約$9、Deep は月額約$45(月200回の Deep Search)。
最適な用途: 完全なレビューではなく、特定の1つの問いに、素早くエビデンスで重み付けした回答が欲しい人。
7. Undermind:曖昧な問いのために作られた反復型エージェント
Undermind は、キーワード検索のある特定の失敗パターンを解決するために存在します。実際の問いに合致するのに、語彙が共通しない論文です。いくつかのキーワードの代わりに、探しているものを1つの段落で説明すると、Undermind のエージェントは順次検索を実行し、候補の論文を読み、学んだことをもとに次の検索を絞り込み、1回の Deep Search あたりおよそ8〜10分で、数百本の論文を処理します。
その出力は、生成された物語ではなく、実際に見つけて読んだ論文の、ランク付けされた注釈付きリストであるため、Undermind は、このリストの生成型に近いツールの中で、構造上の捏造リスクが最も低くなっています。自身の検索結果にない論文を引用することはできません。Free プランには月3回の深い検索が含まれ、Pro(年払いで月額$16と確認済み、無料の約10倍の使用量)が、定期的に使う人にとって現実的なプランです。
| 得られるもの | 得られないもの |
|---|---|
| 読みながら検索を適応させる反復型エージェント | 1回の深い検索に8〜10分かかり、即座ではない |
| 論文を捏造できない。出力は実際に取得したもの | 統合された物語のレポートではなく、論文のリストを返す |
| 重複した作業を避けるため、検索履歴を共有する Team プラン | 無料プランの月3回の検索では、定期的な利用はまかなえない |
料金: Free(月3回の深い検索、$0)、Pro は年払いで月額$16(月払いに比べて約20%オフ)、Team は年払いで1人あたり月額$15、Enterprise はカスタム(undermind.ai/pricing による)。
最適な用途: 本当に曖昧な、あるいはキーワード化しにくい問いを持ち、通常の検索エンジンが見逃す再現率を必要とする研究者。
8. Exa:カスタム構築のエージェントのための検索層
Exa は、サインインして質問を投げかける、レポートを生成するエージェントではありません。AIエージェントや LLM が呼び出すために特別に作られた検索 API で、生の HTML ではなく、クリーンで構造化された、引用可能な結果を返します。チームが、リサーチエージェントがどのように情報を取得し、何を有効な情報源とみなし、引用をどう整形するかを完全に制御したいなら、Exa はその構築の下にあるインフラ層です。AWS Bedrock AgentCore が汎用のエージェントに対して果たす役割と同じです。
2026年6月の Agent API は、これをさらに押し進め、単一の検索呼び出しではなく、より大きな自律的なパイプラインの中で Exa を動かすチーム向けに、コンピュートユニット、検索呼び出し、エンリッチメントのアドオンにまたがる料金を設定しました。その柔軟性は、率直な制約でもあります。洗練されたレポートの UI はありません。エンジニアリングの支援がないアナリストは、Exa からそのまま使えるものを何も得られません。技術チームは、このリストにある他のエージェント製品が、その一部の土台にしている検索層を手に入れます。
| 得られるもの | 得られないもの |
|---|---|
| 生の検索結果ではなく、クリーンで構造化された、エージェント向けの検索 | エンドユーザー向けのインターフェースはなく、開発者向けの API |
| 実際のクエリ量に応じて拡張される従量課金 | 非技術系のアナリストは直接使えない |
| 完全なリサーチパイプライン向けに作られた Agent API(2026年6月) | 完成したレポートツールにするには、エンジニアリングの時間が必要 |
料金: 従量課金。$20のサインアップクレジットに加え、月$10の無料クレジット。Search は1,000リクエストあたり$7、Deep/Research 検索は1,000リクエストあたり$12〜$15、Agent API はコンピュート(1ユニットあたり$0.10)、検索呼び出し(1回あたり$0.005)、エンリッチメントのアドオンにまたがって設定されています(exa.ai による)。
最適な用途: 完成品を買うのではなく、社内にカスタムのリサーチエージェントを構築するエンジニアリングチームとデータチーム。
9. Scite:引用の信頼性を担う層
Scite は、上記のレポートを生成するエージェントと競合するものではありません。そのエージェントの宿題を、そして他のすべての宿題を、チェックします。Smart Citations は、16億件を超える索引化された引用文のそれぞれを、付けられている主張を Supporting、Contrasting、または Mentioning のいずれかに分類し、実際の引用文を示すため、引用が主張を本当に裏付けているのか、同じ一般的な話題に言及しているだけなのかが、数秒でわかります。
そのため、Scite は、このリストにあるすべての生成型エージェントと自然な組み合わせになります。Deep Research のレポートの主要な引用を、成果物で繰り返す前に Scite に通してください。Scite 単体では発見のツールではなく、統合されたレポートを書いてくれることもありません。より狭く、よりリスクの高い1つの問いに、うまく答えるツールです。
| 得られるもの | 得られないもの |
|---|---|
| 引用文の文脈付きの Supporting/Contrasting/Mentioning の分類 | それ単体では、発見やレポート生成のエージェントではない |
| 上記のどのツールとも組み合わせられる検証層 | 16億件以上の引用文は深いが、網羅的ではない |
| 主張どおりのことを述べていない引用を、素早く見つける方法 | すでに確認すべき引用を持っている必要がある |
料金(報告値、scite.ai の料金ページは執筆時に直接確認できませんでした): Individual は月額$20、または年払いで月額$12(年額$144)、Team は報告では1ユーザーあたり月額約$30、Enterprise はカスタム。
最適な用途: 実際の成果物で学術的な引用に頼ろうとしている人で、発見や Deep Research のツールの代わりではなく、それと併用する。
10. STORM:無料で、オープンソースで、完全に制御できる
STORM(Synthesis of Topic Outlines through Retrieval and Multi-perspective Question Asking)は、Stanford の OVAL ラボによるもので、このリストの中でも本当に種類の違う項目です。商用製品ではなく、オープンソースのリサーチシステムです。2段階のプロセスで動作し、ウェブの情報源に基づく多角的な専門家の会話をシミュレートしてトピックを調査し、見つけたものから、引用付きの完全な Wikipedia 形式の記事を書きます。Co-STORM はこれを、共有された進化するマインドマップを囲んで、人が AI の「専門家」とモデレーターのエージェントと一緒に参加する、共同作業モードへと広げます。

コードは MIT ライセンスで、GitHub で積極的に保守されており(スター数3万以上)、セットアップなしで試したい人向けに、storm.genie.stanford.edu で限定的なホスト型のリサーチプレビューが利用できます。実際の作業で動かすには、自分の LLM の API キーを用意し、検索バックエンド(Bing、DuckDuckGo、You.com の API、または自前のドキュメントセット)を選ぶ必要があります。これが、無料であることのトレードオフです。ベンダーのサポートも、SLA も、洗練された一般ユーザー向けのインターフェースもありません。おすすめオープンソースAIエージェントフレームワークで扱っているのと同じ、セルフホストのトレードオフです。エンジニアリングを自分で負担する代わりに、完全な制御が得られます。
| 得られるもの | 得られないもの |
|---|---|
| 無料のオープンソース(MIT ライセンス)、サブスクリプションなし | ベンダーのサポートや SLA はなく、コミュニティによる保守のみ |
| 多角的な調査と、完全な記事の執筆を、1つのパイプラインで | 本格的に動かすには、自分の LLM の API キーと検索バックエンドが必要 |
| 人が関わる共同作業モードを加える Co-STORM | ホスト型のデモは限定的で、本格的な利用にはセルフホストが必要 |
料金: 無料、オープンソース(MIT ライセンス)。ホスト型のリサーチプレビューは storm.genie.stanford.edu で無料。実際の導入コストは、自分の LLM の API 利用料に加え、検索バックエンドの費用です(github.com/stanford-oval/storm による)。
最適な用途: リサーチのパイプラインを完全に制御したく、セルフホストに抵抗のない、研究者や技術チーム。
選び方:意思決定フレームワーク
リサーチエージェントは、完了させたい仕事で選んでください。広範な統合、Workspace との連携、文献の発見、引用の確認、あるいはカスタムのパイプラインです。

| 必要なもの | 選ぶべき製品 | 理由 |
|---|---|---|
| すでに支払っているチャットアプリの中の Deep Research エージェント | OpenAI Deep Research または Gemini Deep Research | 新しいベンダーは不要で、広範な汎用のウェブ閲覧 |
| 自分の Gmail、ドキュメント、カレンダーに基づく調査 | Claude Research | ウェブ検索に加えて、ネイティブな Workspace コネクタを持つ唯一の製品 |
| 網羅的ではなく、素早く引用付きの下書き | Perplexity Deep Research | 1レポートが数分で、それでも本当に複数ステップ |
| 数千本の論文にわたる、正式で説得力のあるシステマティックレビュー | Elicit | 構造化された PRISMA 形式のスクリーニングを備えた、専用の Research Agent |
| 特定の狭い調査の問いへの素早い回答 | Consensus | Consensus メーターが、エビデンスが実際にどこに落ち着くかを示す |
| 曖昧で、キーワード化しにくい問いに対する、深い文献の発見 | Undermind | 反復型のエージェントが、読みながら検索を適応させる |
| 引用が、付けられた主張を実際に裏付けているかの検証 | Scite | 競合するレポート生成ツールではなく、専用の分類 |
| カスタムのリサーチエージェントを構築するための、完全なエンジニアリング上の制御 | Exa(API)または STORM(オープンソース) | Exa は検索層で、STORM は無料でセルフホストのパイプライン |
規模とペルソナの表
| ツール | 最適な用途 | 向かない用途 |
|---|---|---|
| OpenAI Deep Research | すでに ChatGPT を使っている個人のアナリスト | 専用の学術インデックスが必要なチーム |
| Gemini Deep Research | Google Workspace で標準化しているチーム | Google のエコシステムの外にいるチーム |
| Claude Research | Claude と Google Workspace を使い込んでいるアナリスト | 専用に作られた論文インデックスを求めるチーム |
| Perplexity Deep Research | 所要時間の短い、汎用的な調査 | 正式で網羅的なシステマティックレビュー |
| Elicit | 博士課程の研究者、システマティックレビューの担当者、R&D チーム | 素早い、単発のビジネス上の問い |
| Consensus | 狭く、答えられるエビデンスの問いを持つ人 | 広範で探索的な文献レビュー |
| Undermind | 曖昧で、キーワード化しにくい問いを持つ研究者 | 論文リストではなく、統合された物語を求めるチーム |
| Exa | カスタムのエージェントを構築するエンジニアリングチーム | すぐに使えるツールを求める非技術系のアナリスト |
| Scite | 実際の成果物で論文を引用しようとしている人 | 一次的な発見。それ単体では検索エンジンではない |
| STORM | セルフホストに抵抗のない、技術系または学術系のユーザー | ベンダーのサポートや、一般ユーザー向けの UI を求める人 |
リサーチエージェント購入時の避けたい失敗
リサーチエージェントの購入がうまくいかなくなるのは、チームが整った出力を信用したり、間違った単位で比較したり、そのツールが完了させるようには作られていない調査業務のためにツールを選んだりしたときです。

| 失敗 | 具体的な状況 | 代わりにすべきこと |
|---|---|---|
| 書式が正しいという理由で引用を信用する | 付けられている主張どおりのことを述べていない情報源への、きれいな脚注 | 主張を繰り返す前に、情報源を開くか、Scite に通す |
| 自信のある口調を、正確さの代わりとみなす | エージェントが、ぼかした表現を一切使わずに数値を述べる | CJR の調査結果によれば、自信と正しさは相関しなかった。それでも検証する |
| 統合に発見のエージェントを使う、またはその逆 | Undermind に物語の要約を求める、または Perplexity に5,000本の論文のスクリーニングを求める | ツールを仕事に合わせる。発見、統合、検証は別の仕事 |
| 無料プランの上限に達する前に Pro プランに課金する | 無料の Research Agent の枠が何をカバーするかを試す前に、Elicit Pro に申し込む | まず実際の問いで、無料プランを使い切る |
| 「Deep Research」が、どこでも同じ枠を意味すると思い込む | OpenAI の月10回の実行と、Perplexity の1日あたりの枠を、同等として比べる | 実際の単位で比較する。月あたりの実行回数、1日あたりのクエリ数、スクリーニングした論文数 |
| 監査証跡を省く | 要約が完成したように見えたら、元の情報源のリストを削除する | 後で擁護する必要があるかもしれないものには、情報源と取得日を添付しておく |
| 有料の情報源が実際に読まれたと思い込む | エージェントが、アクセスの失敗をフラグ付けせずに、有料の記事をタイトルで引用する | ツールが、到達できなかったものにフラグを立てるかを確認する。ほとんどは黙って推測する |
AIリサーチエージェントに関するよくある質問
AIリサーチエージェントとAIリサーチツールの違いは何ですか?
AIリサーチツール(検索ボックス、文献管理ツール、チャットアシスタント)は、すべてのステップを動かす人を補助します。AIリサーチエージェントは、複数ステップの調査を自分で計画します。検索し、読み、次に何を確認するかを決め、ステップごとの監督をはるかに減らして、統合された引用付きのレポートを返します。
AIリサーチエージェントは、どのくらいの頻度で引用を捏造しますか?
8つのAI検索ツールを対象にした、2025年の Columbia Journalism Review の調査(Deep Research モードに限定されません)では、1,600件のニュースクエリ全体で、チャットボットは60%を超える割合で誤って回答し、ツール別の誤答率は37%から94%でした。このガイドに検証ワークフローがあるのはそのためです。引用付きのすべての主張は、自分で情報源を開くまで、未検証として扱ってください。
OpenAI Deep Research と Gemini Deep Research では、どちらが正確ですか?
この2つを具体的に比較した、独立して検証された正確さのベンチマークはありません。どちらもエージェント型で、どちらも越えられない有料の壁に突き当たることがあり、どちらも元の情報源を読むことの代わりにはなりません。ベンダーが公表するベンチマークのスコアは、最終的な答えではなく、出発点となる指標として扱ってください。
これらのエージェントは、有料の学術誌にアクセスできますか?
機関または個人のアクセス権を接続していない限り、一般にはできません。ほとんどのツールは、有料のコンテンツをスキップするか、情報源は見つけたが有料の壁を越えられなかったとフラグを立てます。いくつかは、全文を読んでいないことを開示せずに、黙ってタイトルを引用します。これがまさに確認すべき点です。
AIリサーチエージェントを試す最も安い方法は何ですか?
無料プランから始めてください。Gemini の無料プランには月5件の Deep Research レポートが含まれ、Elicit の Basic プランには限定的な Research Agent の利用が含まれ、Undermind は月3回の無料の深い検索を提供し、Stanford の STORM にはアカウント不要の無料のホスト型デモがあります。
学術関係者は、Elicit と Consensus のどちらを使うべきですか?
問いの形によります。Elicit は、数千本の論文をスクリーニングして、構造化された比較可能なデータを抽出する、正式なシステマティックレビュー向けに作られています。Consensus は、特定の1つの問いに、素早く、狭く、エビデンスで重み付けして答えるために作られています。多くの研究者は、同じプロジェクトの別々の段階で、両方を使います。
Exa は、直接使えるAIリサーチエージェントですか?
それ単体ではそうではありません。Exa は、他のエージェントや社内の構築物が検索のために呼び出す、検索 API です。非技術系のアナリストは、Exa からそのまま使えるものを何も得られません。技術チームは、その上にカスタムのリサーチエージェントを構築するための、クリーンなデータ層を手に入れます。
これは、市場調査向けのAIエージェントとどう違いますか?
このガイドが扱うのは、汎用および学術分野の調査、つまり情報を集め、検証し、出典付きのレポートに統合することです。競合の追跡、市場規模の算定、業界の監視といった、商業的および競合の市場インテリジェンスは、独自の別の購入判断を持つ、より限定的でビジネス特化の調査業務です。
これらのエージェントを使っても、人間のアナリストは必要ですか?
はい。ここにあるエージェントはすべて、最終的な答えではなく、下書きを引き渡すように設計されています。エージェントの仕事は統合であり、情報源が信頼できるか、主張を繰り返しても安全か、調査結果が実際に何を意味するかを判断する役割は、依然として人にあります。
次のステップ
最も有名な名前ではなく、実際の仕事に合うツールを1つ選んでください。問いが探索的で汎用的なら、すでに契約している可能性が高いため、OpenAI Deep Research か Gemini Deep Research で実行してみてください。正式な文献レビューなら、Pro に課金する前に、実際の問いで Elicit の無料プランを始めて、Systematic Review Workflow が必要なものをカバーするかを確認してください。いずれの場合も、最初のレポートで上記の検証チェックリストを実行してから、実際の仕事でそこから何かを引用してください。また、承認する人にサブスクリプションの費用を正当化しようとしているなら、AIエージェントのROIフレームワークが、節約した時間が実際に料金に見合うかを測る方法を扱っています。

On this page
- 2026年の変更点
- 重要なポイント
- 比較早見表
- エージェントと検索ツールを分けるもの
- 引用の信頼性:これらのツールを実際に分けるもの
- 情報源のカバー範囲とアクセス
- 検証ワークフロー:引用付きレポートを信頼する前に確認すること
- 1. OpenAI Deep Research:ChatGPT 内で最も広くウェブを読む
- 2. Google Gemini Deep Research:Google 検索と Workspace に基づく
- 3. Anthropic Claude Research:ネイティブな Workspace との連携
- 4. Perplexity Deep Research:このリストで最も速い所要時間
- 5. Elicit:文字どおり「Research Agent」という名の製品
- 6. Consensus:素早く、エビデンスで重み付けした回答
- 7. Undermind:曖昧な問いのために作られた反復型エージェント
- 8. Exa:カスタム構築のエージェントのための検索層
- 9. Scite:引用の信頼性を担う層
- 10. STORM:無料で、オープンソースで、完全に制御できる
- 選び方:意思決定フレームワーク
- 規模とペルソナの表
- リサーチエージェント購入時の避けたい失敗
- 次のステップ