タグ: 検証
-
AI出力の検証は、指示でなく機構ゲートで 2026/8/1生成もレビューも安くなったが、出力は自信満々に誤る。検証を指示で守るか機構で守るか、そして確信度を正しさと取り違えないための信頼の置き方を、統計的工程管理と多層防御の規律から翻訳する。
-
人手を残す理由は、ドメイン知識と責任という中身にある 2026/7/23「最後は人間が見る」に潜む、漠然とした「人間なら質が上がる」という前提。第一線の文書が名指すのは責任の割り当てと要件整合。要件整合を検証=品質の土台に戻し、そこに文脈へ載りきらないドメイン知識を置くと、人手の理由はドメイン知識と責任という二つの中身に分解できる。順位ではなく配置の問題として、その線の引き方を辿る。
-
AI形式的証明が保証するのは形式化した命題だけ 2026/7/20AIに数学を『形式的証明つき』でやらせる流れが本物になりつつある。2週・約100ドルで13万行、Lean 4の評価基盤には未解決予想も並ぶ。だが機械が保証するのはAIが書いた形式の命題だけで、それが元の主張とズレていれば保証は空になる。自動形式化はまさにそこが脆い。
-
AI出力の検証と、生成前の仕様設計 2026/7/16レビューの第一の目的は、欠陥をすべて捕まえることではない。コードベースの健全性を守り、知識と規範をチームへ移すことだ——そうGoogleの研究は報告する。この原則を先に置くと、AI出力の検証も、生成前の仕様設計も、やることは自然に決まる。どちらもAI以前からある規律の話だ。
-
エージェントの偽の成功——完了報告と実際の状態のずれ 2026/7/9自律エージェントは、達成していないのに『完了』と自信満々に報告することがある。ある研究は、単一制御タスクの失敗の45〜48%がこの『偽の成功』だと測った。しかもLLMに合否を判定させても、自信ある締めの言葉に引きずられAUROC0.65を超えない。見抜く鍵は、独立した状態の確認だ。
-
シミュレーションの信頼性はソルバーでなく検証で決まる 2026/7/4「何でもシミュレートできる」という宣伝が飛ばしている問い——その計算が正しいと、誰がどう確かめたのか。工学が規格化してきたV&Vの手続き、検証域の外で使われたコロンビア号のCrater、そしてML代理モデルの弱い基準線まで、シミュレーションの信頼の源泉と限界を辿る。
-
掛け算の残酷さ——なぜデモは凄いのに実用は脆いのか 2026/6/21AIエージェントのデモは魔法のようだ。だが実際の長いタスクに乗せると、ぼろぼろ崩れる。理由は、製造業の歩留まりとまったく同じ「掛け算」にある。各ステップ95%でも、20回続けば成功率は4割を切る。シリーズの本丸。
-
AIによる材料発見——ふるいには効くが発見者にはまだ早い 2026/6/21「AIが数十万の新材料を発見」「ロボットが17日で41個合成」——華々しい見出しが続いた。だが専門家が中身を見にいくと、多くは“新しくなかった”。AIが材料探しで本当に効く場所と、見出しが先走る場所を、冷静に切り分ける。
-
RAG併用でもハルシネーションは残る——法務AIの実測 2026/6/20根拠文書を検索して与えればハルシネーションは消える、とよく言われる。スタンフォードが実際に測ると、そう謳った法務AIですら17〜33%はハルシネーションしていた。RAGは強力な緩和策だが、治療ではない——そして失敗の形を、より見つけにくいものに変える。
-
LLMの過信は測れる——RLHFが較正を崩す傾向 2026/6/20LLMの口調の自信は、正しさの信号ではない。アライメント(RLHF)には較正を犠牲にする圧力がかかる——法則ではなく傾向だ。GPT-4の報告書はMMLUの一部で、素のモデルのほうが較正が良かったと報告した。そして、このズレは測れる。
-
ハルシネーションは採点ルールへの最適応答でもある 2026/6/20ハルシネーションは神秘でも、ただの設計上の宿命でもない。残り続ける大きな理由は、ベンチマークが「自信ある当てずっぽう」を採点で得させ、「分かりません」を罰していることにある。そして、そこは直せる。
-
脳データの本当の難所はモデルでなく「何を測るか」だ 2026/6/19神経データの信号とノイズを分ける作業は、機械学習以前の問題だ。測定・アーティファクト・解釈のギャップが本当のボトルネックである理由を、触れる合成デモとともに論じる。