タグ: 論文解説
-
RAG併用でもハルシネーションは残る——法務AIの実測 2026/6/20根拠文書を検索して与えればハルシネーションは消える、とよく言われる。スタンフォードが実際に測ると、そう謳った法務AIですら17〜33%はハルシネーションしていた。RAGは強力な緩和策だが、治療ではない——そして失敗の形を、より見つけにくいものに変える。
-
LLMの過信は測れる——RLHFが較正を崩す傾向 2026/6/20LLMの口調の自信は、正しさの信号ではない。アライメント(RLHF)には較正を犠牲にする圧力がかかる——法則ではなく傾向だ。GPT-4の報告書はMMLUの一部で、素のモデルのほうが較正が良かったと報告した。そして、このズレは測れる。
-
ハルシネーションは採点ルールへの最適応答でもある 2026/6/20ハルシネーションは神秘でも、ただの設計上の宿命でもない。残り続ける大きな理由は、ベンチマークが「自信ある当てずっぽう」を採点で得させ、「分かりません」を罰していることにある。そして、そこは直せる。