マテリアルズインフォマティクス・材料
ビームラインでAIエージェントが単結晶アライメント、成果と限界
- ビームライン
- シンクロトロン
- 自律実験室
- LLM
- Claude Opus 4
- MCP
- human-in-the-loop
- 方位行列
- 参照反射
- 六軸回折計
- アライメント
- 仮想環境
- 成功率
- 組成無秩序
- 再解析
- ビームタイム
- X線ナノプローブ
- Rietveld 解析
- 会話履歴
- Zenodo
- 回折パターン
- 査読
目次
六軸回折計は、試料と検出器をそれぞれ複数の回転軸で動かす装置である。単結晶の回折実験は、試料を載せるたびに、この装置の軸を一から合わせ直すところから始まる。結晶がどの向きで載ったかは載せてみるまで分からず、軸の角度がずれていれば、狙った反射は検出器に現れない。そこで、既知の強い反射をまず探し当て、結晶の軸と装置の座標系の対応を確定させる。この向き合わせは地味で、時間がかかる。大型の実験施設は使える時間をあらかじめ割り当てるので、向き合わせに費やした分だけ、本来測りたかったものを測る時間が減る。だから熟練した実験者が付き添って、手で追い込む。
そこへ、言語モデルを核にしたエージェントが入ってきた。手順を計画し、装置にコマンドを送り、返ってきた測定結果を読んで、次の操作を決める。うまくいけば、人が付き添う必要は減り、装置の持ち時間はそのまま測定に回る。研究の速さが、装置の性能よりも人の手数で決まっている場面は多い。
ただし、ソフトウェアの自動化とは違う点がある。相手は実在の装置と実在の試料で、操作の多くは取り消せない。そして動かした結果が正しかったかどうかは、装置から出てきた信号を誰かが解釈して初めて決まる。その解釈まで機械に任せるなら、任せた判断が正しかったことを、どこで、誰が確かめるのか。
実験装置を自律的に操作するエージェントについて、「動いた」と言えるための証拠は何であり、それを誰が確かめるのか。
実機では動いた。ただし実機で自律だったのはコマンドの生成までで、成功率が数字で出ているのは仮想環境の側である。 2026年に出た報告で、既存の大規模言語モデルを外部ツールに繋いだエージェントが、シンクロトロンのビームラインでX線試料の向き合わせを担った1。著者らは、自作の仮想環境で組み立てた手順を、中核の推論構造を保ったまま実機へ移している1。ただし実機の初回試行では、施設の安全要件を満たすため、エージェントが出したコマンドの実行だけは人間が中継した1。そして実機については、成功率も試行回数も、人間の専門家と比べた結果も、著者らは公表していない1。同じ問題領域には、人をループに残す設計を提示するもう一本もある。割れているのは目標ではなく経路のほうで、人を残す側も自分たちの枠組みを「自走ラボの自律を高めるもの」と位置づけている2。そして先例がある。無機材料の自律実験室の報告には外部の研究者による再解析が出て3、著者側が訂正を公開した4。著者側が手作業で回折パターンを見直した結果、報告にあった成功の大半は正しかったが、一部は判定できなかった4。確かめる側の記録は出はじめているが、二本を突き合わせる共通の形式はまだ無い。
一回通った記録と、十回のうち何回通ったかの記録
※ この節の数値は説明のための仮定で、測定値ではありません。
試料の向き合わせを自動で行う手順について、二通りの報告を考える。一つ目の報告は、一回試して最後まで通った、とだけ書く。二つ目の報告は、同じ条件で十回試して八回通った、と書く。
一つ目の報告から分かるのは、通る場合があることだけである。十回に九回通る手順でも、十回に一回しか通らない手順でも、一回試して通ることは起こりうる。二つ目の報告なら割合の見当が付き、通らなかった二回で何が起きたかを調べる手がかりも残る。
もう一つ分けておくことがある。手順を走らせた側が自分の決めた基準で「通った」と書く場合と、走らせていない側が残された記録を見て同じ判定に至る場合である。前者だけでは、判定の基準そのものの誤りは見つからない。
実機のビームラインで、何が起きたか
Chen らの報告は、Nature Machine Intelligence に2026年7月1日オンライン公開された。著者14名の所属は7機関にまたがる1。
シンクロトロンは、電子を円軌道で加速して極めて明るいX線を作り出す装置だ。そこから取り出したX線を実験ハッチまで導き、試料に当てて測る設備一式をビームラインと呼ぶ。回折は、結晶に当たったX線が原子の並びによって特定の方向へ強め合う現象で、そのパターンから原子の配置を読む。
単結晶の散乱実験では、測る前に試料の向きを合わせる必要がある。これがアライメントである。結晶の格子面と入射X線の関係を確定させるために、既知の強い反射を探し出す。この反射を参照反射と呼ぶ。そこから方位行列を決める。方位行列は、結晶の軸と装置の座標系を結びつける行列だ。これが決まらなければ、どの角度で何を測っているのかが定まらない。
著者らのエージェントは、既存のLLMをそのまま使う。用いたのは Claude Opus 4・Claude Sonnet 4・Gemini 2.5 Flash の三機種である。実機のビームライン実験に充てられたのは Claude Opus 4 だ1。限られた貴重なビームタイムのあいだ頑健性を最大化し運用上のリスクを最小化するため、より高性能なモデルを選んだと原典は書く1。著者らが仮想環境で突き合わせたのは残る2機種である1。装置との接続は Model Context Protocol(MCP)による1。MCP は、モデルが外部のツールを構造化された形で呼び出すための取り決めである。行動を計画し、装置コマンドを発行し、返ってきた観測を解釈し、実験目標に向けて反復する。
著者らは、開発と試験を自作の仮想実験環境で行った。この環境が模したのは六軸回折計である。六軸回折計は、試料と検出器をそれぞれ複数の回転軸で動かし、任意の散乱条件に持ち込む装置だ。そこで作った一連の手順を実機のビームラインへ展開した。原典によれば、著者らはプロンプト・推論構造・判断ロジックというエージェントの中核を無改変で持ち越した。実機の制御インターフェースに合わせて、MCP ツールには環境固有の小改変が入っている1。ガイダンスも、コマンドを人間へ渡す形式を指示する安全上の一点だけが加わった1。
実機では、エージェントが参照反射を正しく同定し、方位行列を決定した1。原典の抄録はこれを「あらゆる種類の単結晶散乱実験における不可欠な最初の一歩」と位置づけている。ただし論文の本文での言い方はこれより狭く、「多くの種類の散乱実験において不可欠かつ困難な前提条件」であり、別の箇所では対象を単結晶散乱に限らず、シンクロトロンX線・X線自由電子レーザー・中性子の実験に広く関わる前提条件だとしている1。加えて原典は、エージェントが予期しない実験条件にも有効に対応し、適応的な問題解決を示したと述べる。ただし、この言い切りは抄録のものである。本文の Results では、予期しない η のずれとそれへの適応的な振る舞いは限られた回数の実機試行で観測されたもので、統計的に確立された能力と解釈すべきではないと限定している。そのうえで示されたのは、頑健な閉ループ運転を保てる可能性だとする1。
自律の範囲も、実機と仮想環境で違う。仮想環境ではコマンドの実行と結果の解析を含む全ステップが人手の介入なしに進むが、実機の初回実証では、生成されたコマンドの実行を人間の実験者が中継している。理由は施設の安全要件を満たすためであり、提案されたコマンドは無改変で実行されたのだから自律性は保たれている、というのが原典の立場である1。自律だったのは何を打つかの決定であって、打つ行為そのものではない。
装置の内訳は、原典の Methods に書かれている。Stanford Synchrotron Radiation Lightsource のビームライン BL17-2、試料は Co₃Sn₂S₂ の単結晶で、入射X線のエネルギーは 16.0 keV(波長 約0.7749 Å)、試料は銅のホルダーに載せて室温で測定された。ただしエージェントに与えられた構造ファイルは、仮想環境のものではなく Crystallography Open Database の別ファイルである1。実機の実証もこの1件ではない。原典はもう1件、単結晶 Si の試料で、モーターのオフセット Δη = 1.5度 と極端に鋭いピークという難条件下でアライメントを通したと報告している1。
成功率は仮想環境にはある。実機には無い
ここは読み違えやすい。成功率が無いのは実機のほうだけである。 仮想環境では、原典は成功の判定基準をアライメント誤差 15度以下、格子定数 c の絶対誤差 0.01 Å 以下と数値で定めている。そのうえで、Claude Sonnet 4 と Gemini 2.5 Flash をそれぞれ十回の独立した実行で走らせ、成功した実行回数を総試行回数で割った形で図に示している1。図の値は、アライメント誤差の基準では両機種とも10回中10回、格子定数の基準では両機種とも10回中8回である1。ただし原典は、この格子定数の精度は結晶学の実験で通常求められる精度にはまだ届かないと自分で書いている1。続けて原典は、一般の実験で最も難しいのは多くの場合、正しいピークを見つけることで、見つかれば格子定数の精密化は、反復的な手順を含むものの比較的容易だと述べる1。
この図の成績は、実機で走ったモデルのものではない。原典は、仮想では他に試した機種も課題を遂行できたとしたうえで、実機にはより大きなモデルを充てたと書いている1。原典はGemini 2.5 Flashについて、モーターのずれを大きくする・多結晶粒・推論予算を512トークンに制限・温度を下げる、の4条件でも各5回走らせている1。成功した回ではおおむね向きと格子定数を回復できたが、より敵対的な条件、とくに推論の深さを制限した条件では性能が落ちた、というのが原典の書き方である1。図の成功数で見ると、アライメントの基準で最も少ないのはずれを大きくした条件と温度を下げた条件(各5回中3回)で、推論を制限した条件が最も少ないのは格子定数の基準(5回中3回)である1。
載っていないのは、実機での試行回数と成功率、そして人間のビームライン科学者と比べた結果である1。原典が実機について示したのは、二つの試料で、アライメントが最後まで通ったという記録である。何回に何回通るのかは、この報告からは分からない。原典はその理由も書いている。ビームタイムの制約により、実機の実験構成はビームラインのセッション中に同一条件で系統的に反復されなかった1。そしてそれは、原典自身が先に書いていることでもある。前節で見た、適応の振る舞いを統計的に確立された能力と見るなという限定も、観測が限られた回数の実機試行のあいだだったことと並べて書かれている1。全体の自己評価は「大規模散乱施設の多様な実験環境にわたる自律運転へ向けた一歩」である1。本文の Results も、適応を限定した2文あとで、二試料の実証を「実環境で信頼でき柔軟に動けることの概念実証」とまとめている1。同一条件の反復をしていないと同じ Results に書いたうえでの言い方である1。
著者らが問題として置いているのは、通常の研究室でも大規模施設でも、実験タスクの遂行に広範な人間の監督が要ることだ。著者らはそれを、完全に自律的なAI駆動の科学への道に残る主要な課題と見ている1。監督をどれだけ減らせたかを言うには、監督下で何がどれだけ起きたかの記録が要る。この報告は、その手前にある。
もう一方は、人をループに残す
Vriza らの報告は、npj Computational Materials に2026年3月6日に公開された2。扱う装置は近い。X線ナノプローブ・ビームラインと、材料の設計・特性評価に専従する自律ロボットステーションである。X線ナノプローブ・ビームラインは、X線を微小な点に絞って試料の局所を測るビームラインだ。
問題の置き方が違う。著者らは、次世代X線光源や自走式ラボのような先端の共用施設が、定型作業の自動化で発見を変えつつあると認める。そのうえで、新しい実験ワークフローへの対応、多様な利用者プロジェクトへの適応、より複雑な装置・実験への要求に応えて進化し続けねばならないと書く。その継続的な開発が、運用上の複雑さを生む2。著者らが焦点に置くのは、使いやすさ、再現性、直感的な人と装置の相互作用だ。
著者らが提示するのは、human-in-the-loop のパイプラインである。複数のLLMを「訓練可能な科学アシスタント」として評価し、マルチモーダルなデータを含む複雑な多タスク・ワークフローを統括させる。性能は、任意の人間の入力と反復的な学習によって最適化する2。狙いは、高度な自動化と使いやすい運用の間の隔たりを埋めることにある。
同じ年、同じ種類の装置について、割れているのは目標ではなく経路だ。どちらも自律の度合いを上げようとしている。人をループに残す側も、自分たちの枠組みを「自走ラボの自律を高める」ものとして位置づけ、蓄積した指示を再利用することで「継続的な人間の介入の必要を減らす」と書く2。違うのは、人間の入力をどう扱うかである。片方は人間の監督を減らすべき主要な課題として置き、もう片方は任意の人間の入力と反復的な学習を、性能を上げる設計上の要素として組み込む12。人がループにいるかどうかで二つを隔てることはできない。 自律を掲げる側の実機実証にも、安全要件を理由に人間がコマンドの実行を中継する形で入っていた1。隔てているのは、人がそこにいることを過渡的な制約と見るか、設計上の要素と見るかである。
どちらが正しいかは、公表されている資料からは決まらない。決まらない理由の一つは、両者が同じ評価基準で測られていないことだ。自律の側は実機についての成功率を出していない。人をループに残す側は実機で成功率を出しているが、測っているのは生成コードが実機で走るかどうかである12。Vriza らは、人間の介入なしと教示を蓄えたあとの二条件を四試行ずつ比べており、GPT-4o mini では最も易しい課題で33%から100%へ、最も難しい課題で0%から50%へ動いた2。ただし Vriza らは、教示が効くのは関数呼び出しのようなテキスト課題で、モデル固有の視覚推論には効きにくいと同じ図で断っている2。
先に起きた外部の再解析と、著者の訂正
装置を動かす自動化には、すでに前例がある。無機材料の合成を加速する自律実験室の報告で、2023年11月29日に Nature でオンライン公開されたものだ4。
公開後、外部の研究者による再解析が出た。Leeman ら(責任著者は Schoop と Palgrave)が2024年1月7日に ChemRxiv へ投稿し、のちに PRX Energy(3, 011002)へ査読を経て掲載された3。中心的な指摘は、組成無秩序を無視できない、という点だった。組成無秩序とは、結晶構造の中で原子の配置に乱れがあり、同じ席をいくつかの元素が分け合っている状態である。これを見落とすと誤った結論に至りうる、とする。批判側は新規性についても、成功とされた材料の三分の二は、予測された規則構造の既知の組成無秩序版である公算が高いと指摘した3。
批判の射程は、組成無秩序の一点にとどまらない。批判側は報告された合成生成物43件すべてを検討して分析上の見落としを4類型に整理し、「これらの誤りは、その研究において新材料は一つも発見されていないという結論を導く」と書く。加えて、粉末X線回折の自動 Rietveld 解析はまだ信頼できない、というのがもう一方の結論である3。後者は、装置を動かす自動化の「動いた」を誰が確かめるかという本稿の問いに、そのまま重なる。
批判側は指摘を件数でも示している。その数え方では、自律実験室が成功と分類したのは36件、部分的な成功が7件で、合わせて43件になる。その成功36件のうち35件について、示された分析に4類型のうち一つ以上が含まれるとする3。結論部では、43件のうち少なくとも40件は、予測された材料は合成できていないという逆の読みでも解釈できるとする3。
著者側の応答は、2026年1月19日の訂正として出た4。訂正文は、公開後に二つの懸念が提起されたと書く。回折による化合物構造の一義的な同定と、material novelty(材料の新規性)の当初の主張である。
著者らは、新規性の当初の主張は誤解を招きうるものだったと認めた。意図は、材料が予測プラットフォームにとって新しいという意味であって、必ずしも科学にとって新しいという意味ではなかった、と述べている4。著者らは、これを反映して本文を改訂した。
加えて著者らは、回折パターンを手作業で再解析した。その結果、報告された40件の成功のうち36件については、予測プラットフォームが正しい結論に達していたことを確認した。4件は判定不能(inconclusive)である4。著者らは、成功として数える化合物の総数を、この4件を除外するよう更新した。この更新で、原著の見出しの数は、公開時の58標的中41件(成功率71%)から、57標的中36件(63%)へ動いた5。この再解析は、公開後の査読を受けている4。
区別が要る。訂正が認めたのは三つである。新規性の表現、判定不能の4件、そして訓練データに誤って混入していた化合物1件(Zn₂Cr₃FeO₈)を議論から削除したこと4。三つ目は前の二つとは別種の譲歩で、判定の当否ではなく、評価対象そのものの汚染にあたる。
著者らが外部の指摘をすべて認めたわけではない43。数が食い違ったまま残っているのは、合成の成否のほうである。批判側は43件のうち少なくとも40件を、合成できていないとも読めるとし、訂正側は40件中36件を正しい結論と確認した34。新規性については、批判側は「A-lab にとって新しい」という著者側の応答を先に挙げ、それでも題と抄録の「novel」は強く誤解を招くと書いていた3。ここで、査読という基準を片側にだけ当てないよう注意が要る。訂正側の再解析は公開後の査読を受けているが、批判側もまた PRX Energy に掲載されて査読を通っている3。査読の有無で片方を割り引くことはできない。それでも順序は動かない。外部の再解析が先にあり、訂正がそれに続いた。その訂正文の末尾で、Nature 誌は、問題を編集部と著者の双方に持ち込んだ人たちに謝意を述べている4。プレプリントの公開から訂正までは、約2年である34。
装置を動かすエージェントの検証は、論文の再現とは別の問題
機械に論文を再実行させる話には、突き合わせる相手がある。公開されたコードとデータをもう一度走らせれば、数字が出てくる。それを論文の主張と比べられる。装置の側では、その相手がない。
エージェントが方位行列を決めたとして、それが正しかったかは、以降の測定が意味を成すかで初めて分かる。参照反射の同定を誤れば、その後のスキャンはずれた場所を測り続ける。そしてそのずれは、試料そのものの性質として解釈されうる。自律実験室の前例で問題になったのも、この形だった。回折による構造の同定が、独立の再解析まで確定しなかった43。
やり直しの条件も違う。訂正の事例で著者らができたのは、回折パターンを手作業で引き直すことだった4。手元にパターンが残っていたからだ。装置操作のほうは、そうはいかない。装置条件そのものは公表されている。原典は入射エネルギーも試料ホルダーも測定温度も Methods に書いた1。復元を妨げるのはビームタイムのほうである。原典自身、ビームタイムの制約で同一条件の系統的な反復は行われなかったと書いている1。割り当て制である以上、同じ試料に同じ光を当て直す機会が誰にでもあるわけではない。何を見て、どのコマンドを選び、どう解釈したかという履歴が残っていなければ、同じ引き直しはできない。
その履歴は公開されている。Chen らは実機実証の完全な会話履歴を Supplementary Note に置き、データとコードを Zenodo で公開している1。Vriza らもデータとコードを GitHub で公開し、LLM の確率的な振る舞いを、制限された行動空間・自動リンティング・人間の監督・管理者エージェントの層で抑え、低レベルの装置制御は決定的かつ検証済みに保つと書く2。足りないのは記録そのものではなく、二本を突き合わせられる共通の形式である。 人をループに残す側は、コード品質・正しさ・実機での実行・同一プロンプトでの再現・言い換えたプロンプトでの一貫性という、装置に依存しない五項目の基準を定めている2。その基準を、X線ナノプローブと N9 ロボットという別施設の二装置に同じ形で当ててもいる。ただし採っているのは著者らの一グループで、自律を掲げる側の判定基準は課題固有の誤差の閾値である1。
残るのは、会話履歴のような記録が個別の論文の付録として出されるのか、施設の運用として常に出る形になるのかである。
出典5件
-
Chen ほか「An agentic artificially intelligent X-ray scientist」Nature Machine Intelligence 8, 1075–1086, 2026. https://www.nature.com/articles/s42256-026-01261-5 — 仮想環境で組んだエージェントが実機の二試料で向き合わせを通した。実行は人が中継し、成功率は仮想環境のみ。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 ↩30 ↩31 ↩32 ↩33 ↩34 ↩35 ↩36 ↩37 ↩38 ↩39
-
Vriza ほか「Operating advanced scientific instruments with AI agents that learn on the job」npj Computational Materials 12, 160, 2026. https://www.nature.com/articles/s41524-026-02005-0 — 教示を蓄えるエージェントで二装置を動かし、教示の有無を比べた。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11
-
Leeman ほか「Challenges in high-throughput inorganic material prediction and autonomous synthesis」ChemRxiv, 2024. https://chemrxiv.org/engage/chemrxiv/article-details/65957d349138d231611ad8f7 — 43件を再解析し、新材料は見つかっていないと結論。PRX Energy 3, 011002 に掲載。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12
-
Szymanski ほか「Author Correction: An autonomous laboratory for the accelerated synthesis of inorganic materials」Nature 650, 2026. https://www.nature.com/articles/s41586-025-09992-y — 新規性の表現を改め、成功40件中36件を確認、4件を判定不能とした。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14
-
Szymanski ほか「An autonomous laboratory for the accelerated synthesis of inorganic materials」Nature, 2023. https://www.nature.com/articles/s41586-023-06734-w — 訂正後の現行版は57標的中36件(63%)。公開時の58標的中41件(71%)は2023年12月の保存版による。 ↩
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。