タグ: 解釈可能性
-
単一意味性——AI内部を読める特徴へほどく研究 2026/7/27大規模モデルの内部を、人間が読める『特徴』の集まりへほどく研究がある。ある特徴のつまみを上げると振る舞いまで動く、と Anthropic は報告する。面白いが、取り出せるのはごく一部で、実務ツールにはまだ遠い。
-
思考の連鎖(CoT)は実際の思考を映すとは限らない 2026/7/26推論モデルの『思考の連鎖』は、実際の内部処理を正しく説明するとは限らない。ヒントの言語化率はClaudeで25%・R1で39%。ただし2026年の追試は、トークン予算を増やせば9割まで上がるとし、これは忠実さの点数ではなく下限だと示した。