In Silico

AI協働

RAGのチャンク分割は手法で精度がどこまで変わる?固定長との比較

2026/8/22 (更新: 2026/10/7)

  • RAG
  • 検索
  • LLM
  • チャンキング
  • 固定長分割
  • Paragraph Group Chunking
  • LumberChunker
  • GraphSeg
  • Recursive Semantic
  • UltraDomain
  • クロスエンコーダ
  • リランキング
  • 埋め込みモデル
  • nDCG@5
  • Precision@1
  • Accuracy@5
  • Recall@10
  • LLM-as-judge
  • 提示順
  • 処理時間
  • メモリ不足
  • BGE-M3
  • GPT-OSS-20B
  • Mixtral-8x22B
  • Faithfulness
  • RAGAS
  • MT-bench
  • Cohenのκ
目次
背景・問い・要点
背景

手元の文書を検索して答えを作らせるとき、機械はまず文書を細かく切り分ける。長いままでは扱えないので、決まった長さで機械的に切るか、意味の切れ目で区切るか、見出しの構造に沿って分けるか、どこで切るかを誰かが決めなければならない。

この切り分けは、地味な前処理として扱われがちだ。目立つのは使うモデルのほうで、切り方は最初に決めたまま見直されない。だが検索が拾ってくるのは機械が切り分けた断片そのものなので、切り方は答えの材料を決めている。

やり方を変えれば結果は変わる。では、どれだけ変わるのか。この問いを測った研究は複数あり、その答えが食い違っている。片方は切り方で大きく差がつくと言い、もう片方は素朴なやり方でも十分だと言う。どちらも実測である。

問い

切り分け方はどれだけ効くのか。食い違う報告を、測り方の違いまで降りて読み分ける。

要点

切り方の提案は増え続けているが、独立した二つの実測は、費用をかけた手法ほど効くわけではないという点で一致した。 チャンキング(chunking、文書を検索用の断片に区切る前処理)には、従来法より良いと称する提案が増えている1。完走まで測った比較では、LLMベースやグラフの手法が時間切れとメモリ不足で脱落した1。網羅比較でも、最良だった段落単位の構造認識の手法は固定長分割より安かった2。したがって成果は安い側に集まっている。しかし、素朴な固定長分割で足りるかは決まっておらず、ここで二つの実測は逆向きに見える。網羅比較は固定長分割のPrecision@1(検索結果の最上位1件が参照回答を完全に支える割合)が最良手法に遠く及ばないと報告する2。完走まで測った比較では、固定長分割がAccuracy@5(上位5件に関連するチャンクが含まれる割合)で最良手法にごく僅差まで迫り、しかも桁違いに速い1。二つの実測は固定長の刻み幅・指標・リランカーの有無・データセットが同時に違うので、食い違いを切り方の優劣だけに帰すことはできない。指標をRecall@10に変えると差は約9ポイントに開くので、決めるのはこの指標と、自分の構成がどちらの条件に近いかである1。

モデル・例示

同じ検索結果が、指標と平均の取り方で近くも遠くも見える

※ この節の数値は説明のための仮定で、測定値ではありません。

二つの切り方A・Bで、同じ2問を検索するとする。どちらの問いにも、答えの材料になる関連断片が4個ずつある。切り方Aは上位5件に関連断片を1個ずつ、切り方Bは3個ずつ入れる。

「上位5件に関連断片が1個でも入れば当たり」と数えると、AもBも2問中2問が当たりで、どちらも100%になり差は無い。「関連断片のうち上位に入った割合」と数えると、Aは4個中1個で25%、Bは4個中3個で75%になり、50ポイント開く。

次に、短い文書の条件2つと長い文書の条件2つ、計4条件で測るとする。切り方Aは4条件とも完走し、値は短い側で60・60、長い側で30・30、平均は45になる。切り方Cは長い文書の2条件で時間切れになり、短い側の70・70だけで平均すると70になる。平均どうしを並べると差は25だが、同じ短い2条件に揃えるとAは60で、差は10にとどまる。

並べた二つの場合は、数え方と分母について次のことを示す。

  1. 上位に1件でも入れば満点になる数え方は、関連断片をどれだけ多く上位に集めたかの差を消す。
  2. 完走した条件だけで取った平均は、手法ごとに分母が違えば並べて比べられない。比べるには、両方が完走した条件に揃える。

網羅比較では、手法差が大きく出た

Shaukatらは、固定長、意味的、構造認識、階層的、適応的、LLM支援の6系統にまたがる36種類のチャンキング手法(チャンキングは、文書を検索用の断片に区切る前処理)を比較した(原典の表1はこれを8カテゴリに分けている)2。埋め込みモデルは5種類で、BAAI/bge-m3(1024次元)、sentence-transformers/all-MiniLM-L6-v2(384次元)、POTIONの3バリアント(256・128・64次元)である。データセットはUltraDomainベンチマークで、Biology・Physics・Health・Legal・Maths・Agricultureの6ドメインを使う。組み合わせは36×5×6=1,080構成に及んだ。

評価指標は主にnDCG@5(検索結果の上位5件を、正解との一致度と順位の両方で評価する指標。1に近いほど良い)と、Precision@1(検索結果の最上位1件が参照回答を完全に支える割合)、Hit@5(上位5件のどこかに正解が含まれる割合)だ。Precision@1とHit@5は、参照回答を直接かつ完全に支えるとLLMが判定したチャンクだけを正解と数える厳しい基準で、問いそのものはLLMジャッジに見せていない2。最良だったのはParagraph Group Chunking(PGC)で、平均nDCG@5は約0.459、Precision@1は約24%、Hit@5は約59%。PGCは原典の表1で固定長分割と同じ「決定的・規則ベース」の族に入り、設定は段落2つを重なり1つで束ねる規則である2。次点はDynamic Token Size Chunking(nDCG@5=0.441)とLLM Boundary Detection(同0.415)。対して100文字刻みの固定長分割(基準手法)はnDCG@5が0.244前後、Precision@1は2〜3%にとどまった。nDCG@5は、原典の要旨が「0.244未満」、結果の節が「=0.244」と書いており、原典の中で揃っていない。

ドメインごとに最良手法は入れ替わる。Dynamic Token Size ChunkingはBiology(0.534)・Physics(0.648)・Health(0.621)で最も強く、LegalとMathsではPGCが埋め込みモデルを問わず優位だった。埋め込みモデルを大きくしても、この順位はおおむね変わらない。原典は「チャンキング戦略間の相対順位は、モデルの能力が上がっても概ね安定している」と述べる。大きな埋め込みモデルは絶対値を押し上げるが、粗いチャンキングに対する感度は残る。「不適切なチャンキングはあらゆるモデル規模で検索性能の天井を課す」という。良いチャンキングと大きい埋め込みモデルは、代替ではなく補完的な効果だと原典は結論づけている。相関分析でも、埋め込み次元と性能指標の相関は|r|<0.2にとどまり、チャンキング手法の選択のほうが性能を支配すると原典は述べる。原典自身が断る限界もある。関連性判定はLLM(Mixtral-8x22B)に3段階尺度で行わせたもので、人手の注釈ではない。ただし原典はこの評価器を、外部のLLMジャッジのベンチマーク(Han ら。54モデルを人間の判定と突き合わせた比較)で報告された相関Pearson r=0.879・一致度Cohenのκ=0.813を根拠に選んでおり3、「自動評価はなおバイアスやノイズを持ちうる」という限定つきの限界として書いている。

完走まで測ると、高価な手法は見合わない

Śmigielskiらは対象を8手法に絞り、前処理の実時間と失敗モードまで測った1。コストそのものはShaukatらも36手法すべてについて測っており(Table 3、Figure 5)、Śmigielskiらに固有なのは「そもそも完走するか」という側である。比較対象は固定長分割(長さ512、重なり50。原典は単位を書いていない)、Recursive Semantic、Sequential HAC、Max-Min Semantic、TextTiling、GraphSeg、LLMベースのLumberChunker、DenseX。このうちLumberChunkerだけは、呼び出すLLMを原著の設定からGPT-OSS-20Bに差し替えて走らせている。データセットは物語系(GutenQA、LiteraryQA、NovelQA)、科学系(Qasper)、オープンドメイン系(TriviaQA、SQuAD、PoQuAD、Natural Questions)の8個である。これに、うち3個を1本の巨大文書へ統合したストレステスト版を合わせて11条件になる(8手法×11条件=88構成)。検索にはBGE-M3とクロスエンコーダ・リランキング(BGE-reranker-v2-m3。検索で拾った候補を、質問と各候補文書のペアとして読み直し、並べ直す仕組み)を使う。生成も採点も同じGPT-OSS-20Bが担い、採点はLLM-as-judge(採点そのものをLLMに行わせる手法。ここでは5段階のリッカート尺度)だ。

指標はAccuracy@5(上位5件に関連するチャンクが含まれる割合)とRecall@10(関連するチャンクのうち、上位10件に入った割合)の両方を見る必要がある。原典は、抽出型の答えが無い問いでは、関連文書から切り出したチャンクをすべて関連とみなしている。固定長分割はSQuADでRecursive Semanticの約3.4倍(10,887対3,159)のチャンクを作っており、両者のRecall@10の差はGutenQAで約28ポイントと大きく、SQuADとPoQuADでは0〜4ポイントにとどまる1。Accuracy@5の平均が最も高いのはRecursive Semanticで、Accuracy@5は89.36%、Recall@10は53.81%。固定長分割はAccuracy@5が87.71%、Recall@10が44.75%。GraphSegはAccuracy@5 86.85%・Recall@10 61.75%、LumberChunkerはAccuracy@5 85.44%・Recall@10 78.16%だった。ただしこの2手法は時間切れやメモリ不足で11条件を完走できておらず、平均の分母が他手法と違う。GraphSegは6条件、LumberChunkerは4条件だ。落ちたのは長文の物語系だけではない。LumberChunkerはNatural QuestionsとTriviaQAでも時間切れになり、GraphSegはPoQuAD統合版とTriviaQA統合版でも落ちている。原典は原因をジャンルではなく文書長に置き、48時間の超過と「100万文字を超える文書」でのエラーとして記録している。Accuracy@5で見ると固定長分割は最良手法にわずか1.65ポイント差だが、Recall@10で見ると約9ポイント差まで開く(この2つはどちらもRecursive Semanticとの比較で、両手法とも11条件すべての平均だ)。一方、LumberChunkerの78.16%は完走した4条件の平均で、同じ4条件で固定長分割を平均すると73.81%で、差は33ポイントではなく4.35ポイントにとどまる。良い数字だけを見て「固定長で十分」と言い切るのも、分母の違う平均を並べて「大きく負ける」と言うのも早い。

指標がポイント単位で並ぶのに対し、処理時間は秒から時間まで開く。固定長分割は1秒未満、Sequential HACは2.10分、Max-Minは2.44分、TextTilingは1.56分、Recursive Semanticは4.90分、GraphSegは3.09時間、LumberChunkerは8.37時間、DenseXは15.05時間。ただしこの平均も分母が揃っていない。DenseXとGraphSegは11条件のうち6条件、LumberChunkerは4条件ぶんの時間しか記録がない。DenseXとLumberChunkerで欠けているのは時間切れで打ち切られた条件なので、この2手法が実際に要する時間は上の値より大きい。処理はしばしば完走すらしない。88構成のうち12構成が48時間の制限に代表される深刻なスケーラビリティの壁に当たり、さらに5構成が100万文字を超える文書でメモリ不足に落ちた。合わせて約2割が使える出力を返していない。安定して使える出力を返したのは8手法中5手法(Recursive Semantic、固定長分割、Sequential HAC、Max-Min、TextTiling)だけだった。もっともTextTilingとSequential HACは原著者実装ではなく、TextTilingは比較可能性の問題で第2実験から外され、原典の結語でも完走した手法の列挙から落ちている。原典は、チャンク数が少なく意味的にまとまった塊を作る手法(GraphSeg、LumberChunker)がRecall@10とAccuracy@5で最も強いとする。ただしAccuracy@5の平均ではRecursive Semanticのほうが高く、この記述も完走したデータセットに限った話だ。エンドツーエンドのRAG品質(LLMジャッジ、5段階)は、LumberChunkerが4.35(完走した3条件の平均)、GraphSegが4.13、Recursive Semanticが3.86、固定長分割が3.76だった。原典は冒頭の貢献として「計算コストの高いチャンキング手法は、意味のある効果改善をもたらさない一方、著しく高い計算負荷を招く」を挙げ、「チャンキングはRAGシステムの中核的な研究課題として扱われるべきものであり、単なる前処理として済ませるべきではない」と述べる。ただし論文の最後の一文はさらに慎重だ。「チャンキング手法がRAG品質に意味のある影響を与えるのか、それとも観測された差が主にデータセット選択と実装の影響なのか」に答えるには包括的で標準化された比較が要る、と自分たちの比較では決着していないことを断っている。

二つの結果は、噛み合わない

二つの結果を並べると矛盾して見える。Shaukatらは固定長分割を壊滅的と測った。固定長分割のPrecision@1は、PGCの24%に対しわずか2〜3%である。Śmigielskiらは固定長分割をほぼ最良と測った。固定長分割のAccuracy@5は、最良手法とわずか1.65ポイント差だ。両者は同じ主張の強弱ではなく、測っているものが違う。

そもそも、両者が「固定長分割」と呼ぶものは同じ設定ではない。Shaukatらの2〜3%は、100文字(重なり10文字)で切る基準手法の値である。50トークンで切る固定長の方式も、原典の図では弱い側に入る。原典は、この基準手法と最良手法の差を、コンテキストを恣意的に細切れにする危険を示すものとしている2。Śmigielskiらの固定長分割は、長さ512・重なり50で切っている1。データセットも違う。ShaukatらはUltraDomainの6ドメイン、Śmigielskiらは物語・科学論文・オープンドメインの11条件で、重なりがない。データセットの差が効いているという読みは、先に引いた原典の最終文と一致する。著者ら自身が、観測された差は主にデータセット選択と実装の影響かもしれないと書いている1。Shaukatら自身も、結果はUltraDomainの固定された部分集合のものであり、あらゆる検索設定に一般化しないかもしれないと限界に挙げている2。指標も違う。nDCG@5・Precision@1・Hit@5と、Accuracy@5・Recall@10は、定義も算出方法も異なる。さらにŚmigielskiらは8手法のチャンクサイズを統一していない。各手法を、デフォルトないし推奨設定のまま比較している。ただし原典はこれを不備ではなく設計判断として、「各手法がその設計上の前提に従って自由にチャンキングできるようにしたかったので、手法間でチャンクサイズは正規化しなかった」と書いている。比較としては筋が通るが、固定長分割だけが長さ512という特定の設定に固定される点は残る。埋め込みモデルも、Shaukatらが5種類を横断的に比較したのに対し、ŚmigielskiらはBGE-M3ひとつに固定している。この点は原典自身が今後の課題に挙げており、同じ一文で、リランキング構成を変えて検索コンポーネント横断の一般性を確かめることも並べている。

コスト軸の答えは食い違っていない。ShaukatらのPGCは36手法のなかでも安い部類で、固定長分割の基準手法よりRAM・前処理時間・クエリ遅延のいずれも小さい(873 MB/6.26秒/3.72 msに対し953 MB/8.27秒/4.47 ms)。原典は固定長ベースラインを「インデックスを膨らませるうえに効果は低い」とPareto前線から遠い側に置く2。両者が一致しているのは「高価な手法ほど効く、ではない」という点である。

もうひとつ、見過ごせない違いがある。Śmigielskiらは検索の下流にクロスエンコーダ・リランキングを挟んでいるが、Shaukatらはリランキングなしで検索順位そのものの質を測っている。 ∴ 二つの数字は、チャンキングだけが違う比較ではない。リランキングが効くこと自体は、小規模ながら実測がある。MaharjanとYadav(トレド大学)は、CDCの政策文書を対象に3構成を比較した4。検索なしのバニラLLM(Mistral-7B-Instruct-v0.2)、素朴なRAG(バイエンコーダのみ、上位3件をコサイン類似度で選択)、そしてクロスエンコーダ再ランキングを加えたAdvanced RAG(10候補を取得し上位3件に絞り込む)である。Faithfulness(忠実性。検索なしのバニラにも値が付いている)はバニラ0.35、素朴なRAG 0.62、Advanced RAG 0.80。Relevance(回答が質問にどれだけ関連しているか)はバニラ0.45、素朴なRAG 0.70、Advanced RAG 0.80。再ランキングの追加で、Faithfulnessは素朴なRAGに対して28%の相対改善を示した(28%は原典が丸め前の値から出した数字で、上の0.62・0.80は表の丸め値であり、丸め値どうしで計算すると29%になる)。ただしこの評価は10問だけの結果である。 原典は採点方法としてRAGASを参照するだけで、どのモデルが採点したかを書いていない。同じ原典は、クロスエンコーダ再ランキングを入れた構成でもなお「文書分割の構造的制約が多段推論のボトルネックとして残る」とし、結語では「今後の研究はstructure-aware(構造を意識した)チャンキングを優先しなければならない」と書いている4。

どこまでが測定誤差か

Shaukatらも Śmigielskiらも、評価の少なくとも一部をLLMジャッジに頼っている。前者は検索したチャンクが参照回答を支えるかの判定をLLMに行わせ、後者はエンドツーエンドの回答品質をLLM-as-judgeの5段階リッカートで採点した。ただし条件は対称ではない。Śmigielski側は回答を書いたモデルと採点したモデルが同一(GPT-OSS-20B)で、Shaukat側には生成段そのものが無い。一方、LLMジャッジの判定が人間とどれだけ一致するかは、どちらの論文も自前では測っていない。Shaukatらが根拠に挙げるκ=0.813は、Hanらが54のモデルをジャッジに立てて人間の判定と突き合わせた外部ベンチマークの値で、同じベンチマークはGPT-OSS-20Bもκ=0.765と測り、人間どうしの一致(平均κ=0.801)の範囲内に置いている3。∴ 少なくともこの外部ベンチマーク(生成回答と参照回答の一致の判定)では、人間との一致で両者を分けることはできない。採点をLLMに任せる方式に、どれだけのノイズが乗るのか。提示順で測った例がある。

Zhengらは、3種のLLMジャッジ(GPT-4、GPT-3.5、Claude-v1)に、同じ質問への2つの応答を提示順を入れ替えて2回採点させた5。GPT-4でも判定が両順序で一致したのは65%で、先に提示した側を選んだ率は30%。GPT-3.5では一致46%・先頭選好50%、Claude-v1では一致24%・先頭選好75%だった。ただしこの試験は、同じモデルに温度0.7で2回書かせた似た応答の対で行われており、原典は答えが「人間にも区別がつかないことがある」難しい設定だと断っている。同じ論文は別の実測で、GPT-4の判定が人間の評価者と80%を超えて一致し、人間どうしの一致と同じ水準にあることも報告している5。LLMジャッジは人間並みに一致しながら、拮抗した対では提示順に引かれる。

Śmigielskiらのエンドツーエンドの RAG 品質スコアは、LumberChunker 4.35、GraphSeg 4.13、Recursive Semantic 3.86、固定長分割3.76。ここに挙げた4手法の隣り合う差は0.1〜0.3点程度だ。しかもLumberChunkerとGraphSegのスコアは完走した3〜4条件の平均で、同じ条件に揃えて固定長分割と比べると差は0.02点しかない。DenseXの3.83も完走した5条件の平均で、同じ5条件の固定長分割は4.32と、最も時間のかかる手法のほうが下回る1。原典自身も「成功した実行数が限られるため強い結論は引けない」と断り、固定長分割を「より複雑な手法と競り合う堅実な基準」と位置づけている。Zhengらが測ったのは2応答の優劣(ペアワイズ)判定で、Śmigielskiらの5段階採点(ポイントワイズ)とは形式が違う。Zhengらの65%(一致率)と30%(先頭選好)は、ペアワイズ判定の数字であって、この採点の数字ではない。

出典について。 本稿が引く5本のうち、査読を経た掲載版があるのは Zheng ら(NeurIPS 2023)だけである。Shaukat ら、Maharjan と Yadav、Han らの3本は、2026年9月12日時点で arXiv 版しか無く、掲載版は Crossref にも OpenAlex にも見つからない。KES 2026(査読制の国際会議。2026年9月9〜11日、ダブリン)の公式プログラムは Śmigielski らの論文を9月10日の口頭発表として掲載しているが、Procedia Computer Science の巻号と DOI は本稿執筆時点でまだ発行されていない。∴ チャンキングの数値は、いずれも査読を経た掲載版で確かめられていない報告から取っている。同じ問いには、意味的分割の計算コストが一貫した性能向上に見合わないと報告した査読済みの比較(Qu ら「Is Semantic Chunking Worth the Computational Cost?」、NAACL 2025 Findings)もあるが、本稿はその数値を引いていない。


出典5件
  1. M. Śmigielski ほか「Chunking Methods on Retrieval-Augmented Generation – Effectiveness Evaluation Against Computational Cost and Limitations」arXiv, 2026. https://arxiv.org/abs/2606.00881 — 精度と処理時間を測る。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9

  2. M. A. Shaukat ほか「A Systematic Investigation of Document Chunking Strategies and Embedding Sensitivity」arXiv, 2026. https://arxiv.org/abs/2603.06976 — 1,080構成を、リランキングを挟まない検索だけで比べ、関連性はLLMが判定した。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8

  3. S. Han ほか「Judge’s Verdict: A Comprehensive Analysis of LLM Judge Capability Through Human Agreement」arXiv, 2025. https://arxiv.org/abs/2510.09738 — 54のLLM審判を人間の注釈と突き合わせた。課題は回答と参照回答の一致の判定である。 ↩ ↩2

  4. A. Maharjan, U. Yadav「Chunking, Retrieval, and Re-ranking」arXiv, 2026. https://arxiv.org/abs/2601.15457 — CDCの政策文書の10問で、クロスエンコーダの再ランキングがFaithfulnessを素朴なRAG比28%上げた。 ↩ ↩2

  5. L. Zheng ほか「Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena」NeurIPS 2023 Datasets and Benchmarks Track. https://proceedings.neurips.cc/paper_files/paper/2023/hash/91f18a1287b398d378ef22505bf41832-Abstract-Datasets_and_Benchmarks.html — 似た2応答の提示順を入れ替える試験で、GPT-4の判定の一致は65%。 https://arxiv.org/abs/2306.05685 ↩ ↩2

この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。