LLMの回答の起点は、検索ではなく想起集合
LLMは多くのカテゴリで検索せず、記憶で答えます。検索に向かうのは、想起集合が不安定なカテゴリに偏ります。検索する場合も、クエリにはLLMが検索前から想起しているブランド名・商品名が種として埋め込まれます。つまり検索クエリは想起集合から作られ、想起集合に入っていないブランドはクエリに現れません。
当社調査では検索クエリの85.8%が「人気 ランキング」「おすすめ 2024」のような現行確認型でした。
RAG発火測定:想起集合の分析と同時に「検索するか」を測る
ディギディギのチャットでカテゴリを質問すると、想起集合と想起強度に加えてRAG発火回数が結果カードに表示されます。同じ質問文で検索ツールを与えた試行を並行して実行し、検索を呼び出そうとした回数を数えます。想起の強さと検索への依存を、1回の質問で同時に確認できます。
RAGシミュレーター:「何と検索し、何を参照し、どう答えるか」を再現する
結果カードのRAG発火回数チップを押すと、そのカテゴリ・モデルの条件を引き継いでRAGシミュレーターが起動します。検索ツールを与えた状態で複数回試行し、以下を記録・表示します。
4-1RAG発火の観測
試行ごとに検索ツールを呼び出したかを記録。カラーボールで一覧表示します。
4-2検索クエリの採取と分類
LLMが組み立てたクエリを発行順に表示し、検索意図で4分類(現行確認/語義確認/比較評価/その他)します。
4-3実行ログ
検索結果を受け取った後にLLMがどう回答したかまで、往復を追跡します。
4-4参照記事とrobots.txt判定
参照記事(タイトル・URL・ドメイン)と、参照先のAIクローラー許否(RAGブロック/RAG許可)をチップ表示。検索はされても採用されないサイトが分かります。
4-5複数モデル対応
GPT/Claude。同一の検索基盤を接続し、検索基盤差を排除して比較します。
使いどころ
- 自社の主要カテゴリで検索するか、検索するなら何と検索されるかを確認し、想起集合対策の効果とRAG経由の露出機会を実測で把握する
- 質問文を言い換え(「〜といえば」「おすすめの〜」)、各カードから起動して検索回数とクエリの変化を比較する
- 施策前後・モデル更新前後で同一条件で測り、想起集合の安定化を確認する
ディギコのチャピりログ
カテゴリごとの想起集合とRAG発火率をモデル更新のたびに記録する公開サイト。ビューティー領域84カテゴリ。RAGシミュレーターと同じ測定基盤です。
よくある質問
RAG発火測定とRAGシミュレーターの違いは?
RAG発火測定は、LLMが「検索するか」を回数で示します。RAGシミュレーターは、「何と検索し、何を参照し、どう答えたか」という中身を記録・表示します。
実行回数に上限はありますか?
上限があります。詳細は資料をご覧ください。
カンニングペーパー(Web検索)を使った回答への対策になりますか?
直接の対策機能ではありません。検索クエリが想起集合から作られる以上、まず想起集合に入ることが先だという判断材料を提供します。
