検索強化生成(RAG)は、生成と、情報源コレクションから取得した情報を組み合わせる手法です。モデルが訓練時に学習した内容だけに頼るのではなく、特定の質問に対して関連する文章を提示できます。
基本的な考え方については、主要な参考文献をご覧ください。ここでの実例は、製品実装を網羅的に説明するものではなく、出力をどう確認すればよいかを理解するためのものです。
検索は材料を見つけますが、それを正しく使って答えることは別の段階です。
引用は、すぐ横にある具体的な主張を裏づけていなければなりません。
根拠が見つからないなら、推測で埋めずに未確認のまま扱うべきです。
参照用フォルダを開いて答えるイメージで考える
レポートについての質問であれば、システムは関連する箇所を検索してモデルに渡せます。すると、生成される回答はそのソース資料を踏まえたものになります。
これは仕組みを理解するうえで有効なたとえであり、アップロードしたすべてのファイルが常に完全に検索・引用されることを保証するものではありません。
検索が適切な根拠を取りこぼすことがある
関連する文章が選ばれないこともあれば、文書自体が古いこともありますし、そもそも情報源の質が十分でない場合もあります。取得された文章をモデルが誤って解釈することもあります。
回答の横にリンクが付いていても、その文章がその主張そのものを裏づけているとは限りません。
ソースと主張のつながりを確認する
元のソースを開き、該当箇所を見つけて、その範囲が回答内容と一致しているかを比べましょう。日付や定義を確認し、慎重な表現が出力の中で断定に変わっていないかも見てください。
2つのソースが食い違っている場合は、理由が分かるまではその不一致を残したまま扱いましょう。
ソースに基づく回答を成果物に活かす
調査の要約は、重要な主張を確認したうえで、プレゼンテーションの要点メモにできます。あとで修正しても追跡できるよう、スライドと一緒にソースのメモも残しておきましょう。
詳しくはプレゼンテーションに使うソースを確認するをご覧ください。なお、この説明は、検索を使うすべての製品でプライバシー、保持、学習に関する扱いが同じだという意味ではありません。
回答を2つの出典箇所にさかのぼって確認する
検索強化生成(RAG)は、モデルによる生成と、取得したソース資料を組み合わせる手法です。元のRAG論文では、この組み合わせをパラメトリック知識とノンパラメトリック知識の併用として説明しています。実際に文書を扱う場面では、システムが関連箇所を検索し、回答の前に選ばれた資料をモデルへ渡します。
架空の規程A: 「試行期間は2週間で、対象はTeam Northに適用される。」 規程B: 「予算承認は保留中。」 期間についての質問なら検索はAを見つけるべきで、開始の準備状況についての質問なら両方の文章が必要です。もし回答が「試行は開始可能」と述べているのにAしか取得していないなら、欠けている文章によって結論は変わります。
規程Aへの引用だけでは、予算が承認済みだという主張は支えられません。どちらの文章にも責任者が書かれていないなら、ソースに基づく正しい答えは「責任者は明記されていない」です。検索は回答の材料を与えるものであり、存在しない根拠を生み出したり、生成結果がソースにある留保や条件付きの表現を必ず保ったりするわけではありません。
よくある質問
RAGは、文書でモデルを訓練することと何が違うのですか?
検索は、関連する資料を回答ワークフローに持ち込む仕組みです。訓練はモデルのパラメータを変化させます。あるシステムが文書を検索するという事実だけでは、その保持方針や学習方針までは分かりません。実際のサービス規約を別途確認してください。
まずはPDFに質問するを試し、次に得られた主張を検証するとよいでしょう。コンテキストウィンドウの解説では、回答に使える情報量を左右する別の制約を説明しています。
記事の作成について
Syaxisでは、執筆と翻訳の補助にAIを使用しています。比較はリンク先の資料に基づくもので、検証方法が記載されていない限り、実機での検証結果ではありません。掲載例は、特に断りのない限り説明用のものです。
Syaxis Chatを試す
質問や参考資料をチャットに持ち込み、回答を確認しながら追加の質問で内容を深めましょう。



