8月18日、PCMagが「I Tested ChatGPT, Gemini, Perplexity, and Grok on Deep Research. One Clear Winner Emerged」と題した記事を公開した。ChatGPT・Gemini・Perplexity・Grokのディープリサーチ機能を同一テーマで比較検証し、どのAIが最も質の高いレポートを生成したかを詳しく報告している。結論はGemini総合1位、ChatGPT 2位。8分で図表付きの網羅的レポートを出力したGeminiに対し、ChatGPTは質こそ高いものの49分を要するという対照的な結果となった。
各AIが「ディープリサーチ」機能、すなわち通常の会話ではなくウェブを自律的に検索して構造化レポートを生成するモードを相次いで提供し始めたのは2024年末から2025年にかけてのことだ。OpenAI・Google・Perplexity・xAIがほぼ同時期にこの機能を投入したことで、「どれが実用に耐えるか」という比較ニーズが高まっている。PCMagのレビュアーはこの問いに答えるべく、「GPSが軍事利用から現在の商用システムへどのように発展したか」という同一テーマを4つのAIに与え、レポートの質・深度・所要時間を横断的に評価した。
結論:Geminiが1位、ChatGPTが2位
総合評価は Gemini > ChatGPT > Perplexity ≒ Grok という結果だ。
Geminiのレポートは最も網羅的で、GPSの発展を論理的なセクションに整理し、冒頭にタイムライン、末尾に各国GPSシステムの比較表を配置。さらに図やチャートも自動生成し、読みやすさと情報密度の両立という点で他を圧倒した。処理時間は約8分。
ChatGPTは質自体は高かったが、フル版の処理に49分を要した点が大きな減点要素となった(軽量版は約5分)。PerplexityとGrokはいずれも速いものの、レポートの深度と分析量で大きく劣った。
各AIの詳細
ChatGPT
OpenAIのChatGPTはディープリサーチを「フル版」と「軽量版」の2段階で提供している。
| プラン | フル版 | 軽量版 |
|---|---|---|
| 無料 | 利用不可 | 月15回 |
| Plus / Team / Edu | 月10回 | 月15回 |
| Pro | 月125回 | 月125回 |
フル版は詳細なレポートを生成する高性能モデルを使用する。今回のテストでは、リクエスト送信後にAIが調査計画(箇条書きのアウトライン)を提示し、ユーザーが編集・承認するか60秒待つと自動で調査が始まる仕様だ。フル版は49分という予想外の長さがかかったが、生成されたレポート自体はタイムライン・主要な活用事例・結論を含む充実した内容だった。軽量版は約5分で完了し、以前と比べてもかなり情報量が増えていた。
なお、元記事ではフル版で使用されるモデル名の明記はなく、「GPT-5.5」等の具体的なモデル名は確認されていない。モデルの詳細についてはOpenAIの公式情報を参照されたい。
Google Gemini
GeminiのディープリサーチはGoogleのコンピュート課金モデルに基づいており、クエリの複雑さやモデルの種類によって消費量が変わる。ディープリサーチは通常クエリより多くのコンピュートを消費する。
調査中はどのサイトにアクセスしているかをリアルタイムで表示するため、ChatGPTより透明性が高い。約8分で完成したレポートは、論理的なセクション分け・タイムライン・GPSシステムの比較表・図表を含む高品質なものだった。速さと品質を同時に達成した点が今回の評価を決定づけた。
Perplexity AI
Perplexityのディープリサーチは無料ユーザーでも利用可能(1日5回)、Pro契約者は1日500回まで利用できる。処理は約3分と最速クラスだが、レポートは短く分析も浅い。「素早く概要をつかむ用途には使えるが、深い調査には向かない」というのが率直な評価だ。
Grok
xAI(イーロン・マスク)のGrokは「DeepSearch」と「DeeperSearch」の2モードを持つ。DeepSearchは多数のソースを高速に検索し5秒で完了するが、信頼性の低いソースも含む。DeeperSearchはより高品質なソースに絞るが、所要時間はほぼ同等だった。
どちらのモードも今回のテストでは情報量が不足しており、Perplexityと同様に深度という観点では上位2つに及ばなかった。なお、UIの問題でディープリサーチメニューが表示されなかったため、プロンプトに「Use Deep Search:」と直接記述する形で対応している。
ハルシネーションへの対処
ディープリサーチ系のツール全般に言える話だが、生成されたレポートの正確性は保証されない。記事では2点の対策を挙げている。
- ディープリサーチは通常の会話より高品質なソースを優先的に参照する傾向がある
- レポートには引用元リンクが付くため、気になる箇所は原文に当たれる
全件チェックは現実的でないが、重要な箇所だけでもソースを確認する習慣をつけることが推奨されている。
今回の比較はあくまで1つのクエリに基づく結果ではあるが、深い調査が必要な場面ではGeminiまたはChatGPTが有力な選択肢だ。処理時間を重視するならGemini、ChatGPTフル版の品質にこだわるなら時間的余裕を確保した上で使うという使い分けになるだろう。
詳細はI Tested ChatGPT, Gemini, Perplexity, and Grok on Deep Research. One Clear Winner Emergedを参照していただきたい。