FEATURE

LLMは、あなたのカテゴリで検索するのか。何と検索するのか

RAG発火測定とRAGシミュレーターは、LLMが記憶で答えるかカンニングペーパー(Web検索)に頼るか、頼るなら何と検索し、何を参照し、どう答えるかを、自社のカテゴリで実測するディギディギの機能です。

RAG発火測定とRAGシミュレーターの画面

LLMの回答の起点は、検索ではなく想起集合

LLMは多くのカテゴリで検索せず、記憶で答えます。検索に向かうのは、想起集合が不安定なカテゴリに偏ります。検索する場合も、クエリにはLLMが検索前から想起しているブランド名・商品名が種として埋め込まれます。つまり検索クエリは想起集合から作られ、想起集合に入っていないブランドはクエリに現れません。

当社調査では検索クエリの85.8%が「人気 ランキング」「おすすめ 2024」のような現行確認型でした。

サイテーション獲得などのRAG対策を検討する前に、「そもそも自社のカテゴリでLLMは検索するのか」「検索クエリに自社名は入るのか、競合名だけが入るのか」を確かめる必要があります。
想起集合から検索クエリが作られ、参照記事を経て回答に至る流れ
検索クエリは想起集合から作られる

RAG発火測定:想起集合の分析と同時に「検索するか」を測る

ディギディギのチャットでカテゴリを質問すると、想起集合と想起強度に加えてRAG発火回数が結果カードに表示されます。同じ質問文で検索ツールを与えた試行を並行して実行し、検索を呼び出そうとした回数を数えます。想起の強さと検索への依存を、1回の質問で同時に確認できます。

想起集合の強度とRAG発火回数を表示した結果カード
想起集合の強度とRAG発火回数を1枚のカードで表示

RAGシミュレーター:「何と検索し、何を参照し、どう答えるか」を再現する

RAGシミュレーターの操作デモ
RAGシミュレーターの全体画面

結果カードのRAG発火回数チップを押すと、そのカテゴリ・モデルの条件を引き継いでRAGシミュレーターが起動します。検索ツールを与えた状態で複数回試行し、以下を記録・表示します。

4-1RAG発火の観測

試行ごとに検索ツールを呼び出したかを記録。カラーボールで一覧表示します。

試行ごとの検索ツール呼び出しをカラーボールで示す観測ログ
観測ログ
右ペインに発火状況と試行の進捗を表示
右ペインで発火状況と進捗を確認

4-2検索クエリの採取と分類

LLMが組み立てたクエリを発行順に表示し、検索意図で4分類(現行確認/語義確認/比較評価/その他)します。

LLMが組み立てた検索クエリを発行順・意図別に表示
1回の質問でどんな検索語が使われたかを確認できる

4-3実行ログ

検索結果を受け取った後にLLMがどう回答したかまで、往復を追跡します。

検索結果を受け取った後のLLMの回答を示す実行ログ
RAGを介したLLMの回答を確認

4-4参照記事とrobots.txt判定

参照記事(タイトル・URL・ドメイン)と、参照先のAIクローラー許否(RAGブロック/RAG許可)をチップ表示。検索はされても採用されないサイトが分かります。

参照記事の一覧と参照先ドメインのAIクローラー許否チップ
検索はされても採用されないサイトを確認できる

4-5複数モデル対応

GPT/Claude。同一の検索基盤を接続し、検索基盤差を排除して比較します。

使いどころ

ディギコのチャピりログ

カテゴリごとの想起集合とRAG発火率をモデル更新のたびに記録する公開サイト。ビューティー領域84カテゴリ。RAGシミュレーターと同じ測定基盤です。

ディギコのチャピりログを見る →

よくある質問

RAG発火測定とRAGシミュレーターの違いは?

RAG発火測定は、LLMが「検索するか」を回数で示します。RAGシミュレーターは、「何と検索し、何を参照し、どう答えたか」という中身を記録・表示します。

実行回数に上限はありますか?

上限があります。詳細は資料をご覧ください。

カンニングペーパー(Web検索)を使った回答への対策になりますか?

直接の対策機能ではありません。検索クエリが想起集合から作られる以上、まず想起集合に入ることが先だという判断材料を提供します。

LLMは、あなたのカテゴリで検索するのか。何と検索するのか

RAG発火測定とRAGシミュレーターは、LLMが記憶で答えるかカンニングペーパー(Web検索)に頼るか、頼るなら何と検索し、何を参照し、どう答えるかを、自社のカテゴリで実測するディギディギの機能です。