タグ: 科学
- ビームラインのAIエージェント、「動いた」は誰が確かめるか 2026/8/24
LLMエージェントがシンクロトロンのビームラインで試料アライメントのコマンドを自律生成した。ただし実機では安全要件で実行を人間が中継しており、成功率と試行回数が出ているのは仮想環境の側だけである。
- 論文の自動再現で、AIが出した再現率は何を数えているか 2026/8/22
研究レビュー企業SAIのエージェントがICML 2026の口頭発表168本をレビューし、105本を再実行した。その105本のうち、検証可能な主張が5つ以上あった92本で、試行できた主張の4割超を再現できたのは34本。その105本で全実験を回す費用は中央値で約8,900ドル。だが「再現できた」の定義はまだ揃っていない。
-
AI査読の2研究が測る、第一次選別の精度と操作への脆さ 2026/7/72026年の独立2研究。片方は、AIの第一次採点が却下と採択をAUROC0.82で分離し、その精度の源泉はモデル自身=『賢さは足りている』と示す。もう片方は、証拠のない反論一文で評点が+0.53点上がる(採否の反転は未報告)と監査し、関連研究の要約の偏りでも評点が動くと示す。足りないのは賢さでなく信頼性と頑健さだ。