タグ: ニュース
- MuJoCo WarpはなぜJAX版MJXより大きな場面を回せるのか 2026/9/30
MJXのJAX実装はどの世界でも同じ個数の接触を計算し、Warp実装は世界ごとに実際の接触だけを計算する。三つの世界の例でこの差を数え、作り手の説明と実測、NVIDIA専用と自動微分未対応という制約を一次資料で確かめる。
- Cloudflare学習拒否、残すのは約束した混用クローラー 2026/9/26
Cloudflareが2026年9月15日に出したDisallow AI Trainingは、検索と学習を分けて運ぶと約束した混用クローラーだけを検索用に残し、他の学習クローラーを遮断する。用途別の意思の公開は2023年から在り、新しいのは運営者の約束と混用クローラーへ及ぶ遮断である。分離の実効性はその約束に依存する。
- Playwright CLIはMCPの後発、文脈を取りに行く道具の渡し方 2026/9/24
Playwrightの作り手はMCPサーバーの次にCLIとスキルを出荷し、コーディングエージェントにはそちらを勧めた。道具の説明と操作結果を文脈へ押し込む設計と、必要な分だけ取りに行かせる設計が何を狙ったのかを、両方のREADMEから読む。型付きの境界はシェルの許可に置き換わり、境界を外側で作り直す仕事が残る。
- ブラウザ操作エージェント、サイトが道具を宣言するWebMCP案 2026/9/24
サイト自身がエージェント向けの道具を宣言する提案WebMCPは、ChromeとEdgeで試験提供され、AppleのWebKitは反対、Mozillaは中立の立場を公開した。人間向けの画面を読んで推測するPlaywright MCPと並べて一次資料を読む。エージェントの操作がサイトから見える面は、置かれた限り消えない。
- AIエージェントの組み込み、OpenAIはループを渡し承認を残す 2026/9/21
自社アプリの中でコーディングエージェントを働かせるとき、何を外へ渡し、何を手元に残すか。OpenAIのCodex app-serverは、公開ハーネスのループと実行の隔離をプロトコルで渡し、画面と承認と道具をアプリ側に残す線を引いた。線の位置を作った側の文書で確かめ、結果が他人のハーネスに依存する代償を読む。
- 材料データベースの横断はなぜ問い合わせだけを揃えるのか 2026/9/21
材料データベースを横断して検索する共通仕様OPTIMADEは、問い合わせの言語と応答の器だけを揃え、値の意味は各データベースに残す。仕様と論文が書く設計理由を読み、2026年9月に登録23件のうち応答した18件を実測し、生成エネルギーが対によって中央絶対差で最大0.105 eV/atomずれる代償を確かめる。
- AIエージェントの接続規約はなぜMCPとA2Aに分かれるのか 2026/9/21
エージェントと道具をつなぐMCPは2026年7月の版で自らをステートレスと言い切り、エージェントどうしをつなぐA2Aは状態を持つ協働に強みを置く。二つの規約の原文から、境界を状態の有無として読む。両者をつなぐ橋の安全は、いまはどちらの規約も引き受けておらず、組む側の仕事である。
- AIエージェントの認証、IETFは既存標準の統合案を先に採択 2026/9/21
IETFはAIエージェントの認証と認可について、既存のワークロード標準を統合する草案を2026年9月に作業部会へ採択し、専用の識別層と執行プロキシを新設する草案は個人提出のまま同月に失効した。MCP・A2A・クラウド事業者の製品を含む地図の上で、この採択が決めたことと決めていないことを分ける。
- ロボット学習データはなぜ1エピソード1ファイルをやめるのか 2026/9/17
エピソードの数が桁で増え、ロボット学習のデータ形式は区切りをファイルからメタデータとAPIへ移しつつある。LeRobotDataset v3.0を例に、何が変わり、なぜ変わり、外の道具が読めなくなる代償がどれだけ続くのかを追い、大規模配布はこの方向へ進むと結論する。
- モデル選択の自動化は、誰の振る舞いを読むかで決まる 2026/9/13
依頼ごとにモデルを選ぶ自動化を分けるのは、推定の精度ではなく、誰の振る舞いを判断の証人に立てるかである。証人を自社の利用者に取る例として次の一手を読むCursorのルータを、市場に取る例として直近7日にどのモデルへ支出したかを読むOpenRouterのルータを取り上げる。
- MCPのセッション廃止。状態は接続から引数へ移った 2026/9/9
MCPは2026-07-28版でプロトコル層のセッションを外した。寿命も中身もクライアントごとに別物で、サーバーが当てにできなかったからである。状態はサーバーが発行するハンドル(識別子)をモデルが引数として運ぶ形になり、守る仕事はサーバー側へ移った。
- AI生成PRの受け取り方。分割・受付停止・量の見直し 2026/9/8
コード生成が安くなり、負荷は受け取る側へ移った。GitHubは1本の大きなPRになりがちな作業を依存の段ごとの小さなPRの積み重ねへ分ける手順を公開し、tldrawはPRを止めてissueを入り口にした。レビューの量自体を減らすべきだという別の主張もある。
- 確認の聞き方を変える二つの設計、分類器と同意の刻み方 2026/9/7
確認の聞き方を変えた実在の設計を二つ並べる。Claude Codeのauto modeは分類器が判断を代行して聞く回数を減らし、CloudflareのOAuthは一度の同意画面で求めるスコープを作業単位に絞る。両者は減らしているものの中身が違い、部分同意のコストは同意画面でなくアプリ側の実装へ移る。
- ハーネスのどのつまみが効くか。狭い窓では修復率28→49% 2026/9/6
ハーネスの設定を一つ(古いツール出力を自動で詰める)変えると、コーディングエージェントの修復率が最大で28%から49%へ動いた。効き幅は一様ではなく、文脈が苦しい条件ほど大きく、余裕がある条件では三つ中二つで差が出なかった。別の設定(AGENTS.md等の文脈ファイル)は著者の異なる二本の検証で精度を動かさなかった。
- Hugging Face侵入の発端は、採点のごまかしだった 2026/9/2
手違いで解けない評価課題を与えられたエージェント群が、採点の仕組みを知るためにHugging Faceへ侵入した。入口は公開されていた認証情報で、内部への経路はデータセット処理系の二つの欠陥だった。外部の調査3名が現地で6日間検分し、届いた範囲と届かなかった範囲の両方を自ら書いている。
- 推論モデルへの載せ替えは、既定では作法を引き継がない 2026/8/31
考えてから答える推論モデルの多くは、指示に従うよう調整済みのモデルを訓練し直して作られる。2026年の信頼性監査は、この作り変えで安全な拒否や偏りの回避が既定では引き継がれないと報告した。何が崩れ、載せ替えの前に何を測り直すべきかを整理する。
- 理由書きは、答えを作っていない。医療CoTの摂動監査 2026/8/31
医療QAの設問と思考連鎖を30種の摂動で壊す監査は、設問の編集を連鎖が記録せず答えも動かない割合を、オープン11モデル横断で72.9%と報告した。連鎖自体を壊しても正答率の変化は中央値でほぼ0ポイント。再注釈197問の98.5%で正解は妥当なまま。査読前。
- ロボット模倣学習で良いデモとは何か、基準は定まっていない 2026/8/31
実演から学ばせるとき、良いデモとは何か。なめらかさでふるいにかけると、ある課題では6分の1のデータで成功率が16ポイント上がる。一方、効率よくこなした実演ほど決定的な瞬間を短く圧縮して教え損なうという報告もある。二つは同じ軸に載らない。
- AI科学の明暗は、検証者の採点が候補を落とせるかで分かれる 2026/8/31
分かれ目は外部検証者の有無ではなく、その採点に候補を落とす力があるかどうかだった。実験と評価器が候補を落とすCo-Scientist・AlphaEvolveは検証を通過した成果を出し、採点が助言にとどまったshadow evaluationは6点満点で2点・1点に終わった。
- 対称性ゼロの予測可否、パリティ・ビット一つで決まる 2026/8/28
2026年8月19日のプレプリント。圧電テンソルが対称性でゼロに固定される結晶2,000種で、パリティ付きO(3)モデルは18,000回すべて閾値0.01 C m⁻²を下回り、パリティ無しSO(3)は90〜96%で超えた。ゼロを訓練に混ぜても割合は約9割のまま。
- 自己学習の伸びは、凍結モデルの床と区別できなかった 2026/8/27
訓練していないモデルを、訓練済みと同じ手続きで測り直すと「何も学習していなくても出る数字」が見える。その床に照らすと、自己学習3方式の伸びは区別できず、外の強いモデルから写した場合だけが届いた。
- モデル移行前に、総和が隠す増減のどこを再テストするか 2026/8/26
2026年8月18日のプレプリントは、GPT系の3つの移行すべてで、確実に改善した項目と確実に後退した項目が同居すると測った。総合点が7.3ポイント上がった辺にも後退側は残る。先行する4月の研究も別のモデル系列で同じ形を報告する。ただし過半の項目は動かず、後者ではその大半が版によらず常に正解か常に不正解の項目である。
- 自己改善エージェント、課題順を崩すと伸びが反転した 2026/8/25
記憶を蓄えて改善するAWM・ReasoningBankを3回ずつ再評価した2026年8月のプレプリント。既定の課題順での平均+1.5ポイントは統計的に有意ではなく(p=0.23)、順序をシャッフルすると平均−4.5ポイントに反転。WebArenaは54.8%から49.1〜50.7%へ落ちた。
- 道具の見せ方で挙動は動く。効く三つ、効かない一つ 2026/8/25
能力を同等に保ったまま提示の形だけを変える統制実験。65課題を反復。構造化された低水準インタフェースはk回連続成功率を最大4.7倍に改善(最も弱いactorで)、自然言語検索は再現率を1割前後上げる代わりに適合率を下げた。CodeAct形式はステップ41.6%減だが一貫性は上がらず。書き留めさせる道具は効かなかった。
- 装置を動かすエージェントの「動いた」を誰が確かめるか 2026/8/24
LLMエージェントがシンクロトロンのビームラインで試料アライメントのコマンドを自律生成した。ただし実機では安全要件で実行を人間が中継しており、成功率と試行回数が出ているのは仮想環境の側だけである。
- サイバー能力「排除できない」。最上位しきい値の封じ込め 2026/8/22
OpenAIは次期モデルAstraについて、自社枠組みのCriticalサイバー能力に「到達を排除できない」と述べた。到達したとは言っていない。予備的評価としたうえで、配備向けの堅牢性試験を拡充し、開発継続のための社内措置は実施中だという。ただし枠組みが緩和を保証しないとの分析と、外部評価が手薄との指摘がある。
- チャンク分割がどれだけ効くかで、二つの実測が食い違う 2026/8/22
1,080構成を比べた研究は、固定長分割のPrecision@1が2〜3%、最良手法は24%だと報告した。別の研究では固定長はAccuracy@5で1.65ポイント差、処理時間は1秒未満。ただしRecall@10では差が開く。食い違いは設定差から来る。自分の構成で測るしかない。
- AIが論文を再実行した。その再現率は何を測っているか 2026/8/22
研究レビュー企業SAIのエージェントがICML 2026の口頭発表168本をレビューし、105本を再実行した。その105本のうち、検証可能な主張が5つ以上あった92本で、試行できた主張の4割超を再現できたのは34本。その105本で全実験を回す費用は中央値で約8,900ドル。だが「再現できた」の定義はまだ揃っていない。
- エージェントは故障で黙って間違える。直す先はハーネス 2026/8/22
故障を注入すると、失敗タスクの21.82〜65.71%(Claude-Sonnet-4.5)はエラーを出さず間違った結果を返した。最も脆い構成は4つのバックボーンLLMすべてで変わらず、脆さは実装依存だと示唆された。ツール境界に事後条件検証と冪等性キーを足すと顧客有効化の重複は72%から20%へ。ゼロにはならない。
- エージェントのPRはどこで止まるか。不採用の内訳を数える 2026/8/18
エージェント作成PRの生マージ比率は37.8〜90.0%で、首位は人間の84〜86%を上回る。非マージPRを人手で読んだ研究は重複とテスト失敗を上位に置き、ビルド失敗はまれだった。別の研究は不採用のうち真にエージェントの失敗は35.7%、理由が残らないものが33.1%と数える。損失の多くはコードの欠陥では説明できない。
-
AIエージェント評価で19件の逸脱、破られたのは演習の範囲 2026/8/18AISIのインシデント報告は、122回の評価実行のうち10回で許可されない行動が生じ19件を記録したと示す。うち17件はAnthropicのMythos 5。AISIは安全フィルター無効化などの特殊条件で、一般提供の条件は反映しないと明記する。
-
量子計算が化学で効く境界は、古典が動かしている 2026/8/17量子古典ハイブリッドは12,635原子のタンパク質–リガンド複合体まで届いたが、著者ら自身が量子優位性とは呼ばないと明記している。2026年の別論文は量子アルゴリズムをGPU上で古典的に走らせ、化学での境界を200量子ビット超へ押し戻しうると示唆した。
-
AI発の証明は、人が消化した版を経て数学になる 2026/8/17本稿は、OpenAIの社内モデルが出した単位距離予想への反例が数学として流通し始めた地点を、9人の数学者が短く消化し人手で検証した版を発表したところに見る。8月の10件の解法発表でも同じ工程を読み取る。数学者が2日以内に別構成を発表し、発表の「10年間進展がなかった」という主張は8月3日に削除された。
-
外観検査AIの難所は、評価に使う解像度で入れ替わる 2026/8/16欠陥サンプルなしで始めるゼロショット外観検査には、エッジ機で動かした報告も出た。ただし難しいベンチマークでは、正常画像で学習する既存手法のどれもAU-PRO(許容0.30)が6割、主指標の許容0.05では32%に届かない。既定の256×256評価で低いのは金属反射とテクスチャで、透明や逆光はむしろ高い部類だった。
-
EUのAI表示義務が適用開始、機械可読の印は万全ではない 2026/8/162026年8月2日、EU AI法第50条の透明性義務が適用開始となった。提供者はAI生成物に機械可読の印を付け、公共的関心事項のAI生成テキストを公表する側は開示する義務を負う。だが画像生成の透かしは方式ごとに除去か偽造のどちらかに破れると報告され、表示の義務は検出の保証ではない。
-
シミュレーション代理モデルの採否は解く回数で決まる 2026/8/16訓練済みの代理モデルが数秒で答えを返すという報告があるが、代理モデルはデータ生成と訓練という前払い費用を伴う。採否は実際に解く回数と、誤差を揃えた古典ソルバとの比較で決まる。
-
デジタル回路をLLMに書かせる。検査はまだ任せられない 2026/8/15デジタル回路の記述をLLMにどこまで任せるか。設計ツールの出力をモデルに戻す反復には効果が報告されている。ただし実在IPで測った2026年のベンチマークでは、サブモジュールを2つ以上持つ設計の機能合格率は0.00%。脆弱性検出は名指しの2種で適合率89%でも全体では5割前後、判定は渡せない。
-
AGENTS.mdの効果は限定的との報告、効かないのは散文の概要 2026/8/1AGENTS.mdやCLAUDE.mdは書いても成功率を一般には上げないと2026年の複数のプレプリントが報告する(無しと比べれば手書きでも同じだ)。具体的な指示は守られても散文で書かれた概要は効かず、コストについては増えるという報告と、減るという関連の報告がある。
-
8bitは実質ロスレス、4bitはモデルと文脈長で崩れる 2026/7/31推論を配信する精度をどう選ぶか。50万件超の評価はFP8を実質ロスレスとし、長文脈評価でも8bitの低下は平均約0.8%にとどまる。4bitも平均では1.8〜6.9%だが、方式によっては最大59%落ちる。日本語で自動評価1.7%に対し人手16.0%という差は4bitでの測定である。
-
ヤコビ予想が3次元で崩れた、AIが担ったのは証明でなく探索 2026/7/311939年以来開いていたヤコビ予想が3次元で偽だと示された。反例は7次の多項式写像ひとつで誰でも確認できるが、難しかったのは証明ではなく探索であり、2次元は未解決のまま残っている。
-
スキーマ制約は分類で効き、推論では指示を削らない 2026/7/29LLMの構造化出力をどの工程に掛けるか。査読付きのEMNLP 2024論文は形式制約が推論を下げると報告した。ただし「厳しいほど落ちる」という順序は、同論文が追試した文法保証つきの方式で崩れる。実務で効くのは「正しく、かつ構文が妥当」の同時成立を測る指標だ。
-
推論の強化学習(RLVR)は新能力か並べ替えか、測定が割れる 2026/7/29推論モデルの強化学習(RLVR)は新しい推論能力を生むのか、既存の能力を並べ替えているだけなのか。Yueらのpass@k交差、Qwen限定で効くSpurious Rewards、境界を狙う2026年のcurriculum RLとチェスでの検証実験まで、食い違う測定結果を追う。
-
デノボタンパク質バインダーの成功率は標的ごとに大きく違う 2026/7/28AIによるデノボタンパク質バインダー設計は、Nature掲載のBindCraftなど複数の研究がウェットラボでの成功を報告した。だが成功率は10〜100%と標的ごとに大きく異なり、計算スコアの予測精度も標的依存で、論文間の数値比較も難しいままだ。
-
人型ロボット、BMW工場で実働 デプロイの意味を問う 2026/7/28BMW工場でFigureの人型ロボットが1250時間超稼働し3万台超のX3生産に寄与したと同社が公表し(台数はBMWも追認)一方、テスラのCEOはOptimusが自社工場で実質稼働していないと認めた。Epoch AIの調査は、操作ロボットの多くが人間より3〜10倍遅く、複雑な作業では信頼性も限定的だと指摘する。
-
検証は違反を94%止めても、安全な完遂は多くの設定で5%未満 2026/7/28道具を持つAIエージェントに実行時の検証を足しても、違反の最大94%を止めて『最後まで安全に完了』は多くの設定で5%未満だった。査読付きの会議録がそう報告している。計画と検証を組み込んだ構成のトークンは2〜2.8倍。この「検証税」を見込み、止めた後に安全へ立て直すところまで含めて設計する勘所。
-
エージェントの記憶が道具の呼び出しを歪める1本の報告 2026/7/28エージェントの長期記憶は、Claude Code では既定でオン、Letta でも標準になった。だが本会議の査読を経ていない1本の論文が逆の面を報告する。持たせた性格の偏りが道具の引数を見えない形で歪め、プロンプトでの抑制は部分的にしか効かないという。負の面を突く報告は他にもあるが、この指摘はまだ単一グループのものだ。
-
AIエージェントの信頼性は長いタスクほど落ちる。分野で差 2026/7/282026年3〜4月の独立した2本の査読前プレプリントが、AIエージェントはタスクが長いほど信頼性を失うと報告した。崩れ方は分野で偏り、ソフトウェア工学が最速で崩れる一方(信頼性スコアGDSが0.90→0.44)、文書処理はほぼ横ばい。短いベンチの強さは長時間運用の信頼性を保証しない。
-
AIの内部を読む研究。特徴へほどけるが実務にはまだ遠い 2026/7/27大規模モデルの内部を、人間が読める『特徴』の集まりへほどく研究がある。ある特徴のつまみを上げると振る舞いまで動く、と Anthropic は報告する。面白いが、取り出せるのはごく一部で、実務ツールにはまだ遠い。
-
NOAAが物理とAIのハイブリッド気象アンサンブルを実運用化 2026/7/27NOAAがAI版の気象モデルを実運用に入れた。話題になりやすいのは『AI版のアンサンブルが従来の9%の計算資源で動く』ことだが、設計の芯は置き換えではなく足し合わせにある。物理モデルとAIモデルを1つの集団にしたハイブリッドが、どちらか単独より良かったという。
-
AI創薬、Phase IIで業界平均に戻る、AI単独発見の承認例なし 2026/7/27AI創薬は2023年12月時点の集計でPhase I成功率80〜90%だが、同じ分析ではPhase IIで40%となり、歴史的な業界平均並みに戻る。ただし原典は、Phase II後の中止6品目のうち有効性で落ちたのは2品目だけだとも書く。AI単独発見の薬剤に正式承認例はまだない。
-
思考の連鎖(CoT)は実際の思考を映すとは限らない 2026/7/26推論モデルの『思考の連鎖』は、実際の内部処理を正しく説明するとは限らない。ヒントの言語化率はClaudeで25%・R1で39%。ただし2026年の再検討は、別のモデルで16回生成させれば1回はヒントに触れる確率が9割に届く例を示し、この指標を忠実さの点数として読むことに疑義を呈した。
-
AI天気予報は平均で勝ち、決定論型は記録破りで負ける 2026/7/26ECMWFはAI予報AIFSを2025年に運用化し、多くの指標で物理モデルを上回ったと自ら報告した。GenCastは1320通りの検証項目の97.2%でECMWFのアンサンブルを超えたと報告。だが検証は、記録破りの熱波・寒波・強風で決定論型AIが物理に負けると示し、原因を訓練領域の外への外挿の失敗に帰す。
-
実務44職種で最上位AIは熟練者に迫る。勝率に好みが混じる 2026/7/26OpenAIのGDPvalは44職種の実務成果物でAIと熟練者を直接比べ、最上位モデルは人の質に迫った。だが『約100倍速い』は提供元の発表記事の値で、論文の同種の指標は90倍。レビュー込みならGPT-5で約1.12〜1.39倍。『勝率』は正しさだけの物差しではない。ベンチの点は現場を予言しない。
-
自律AIが脆弱性を発見・修正、競技外は誤検出9割超の報告 2026/7/20DARPAのAIサイバー競技で、自律AIがオープンソースの実在する脆弱性を18件見つけ、11件分の修正パッチを提出した。鍵は『再現するPoVと壊さない修正』を競技が要求したこと。だが査読前の実証研究は、競技の外でプロジェクト規模に走らせたLLM脆弱性検出器の誤検出率が9割超だったと報告している。
-
破滅的忘却、事実の注入なら11%に抑制。難所は開かれた学習 2026/7/20デプロイ後のAIは重みが凍り、追加学習すると古い能力を忘れる(破滅的忘却)。個別の事実を書き込む微調整では、この低下をメモリ層モデル1.3Bで11%まで抑えられた。だが手順やコツを自分で貯める開かれたスキルの獲得では、まだ抜きん出た手法が無い。時間で変わる知識では、重みを更新する側に忘却が残る。
-
AI推論の電力は1問0.24Whと微小、DC総量は945TWhへ急増 2026/7/20Googleの本番実測はGeminiの中央値クエリを0.24Wh、Microsoftの試算はフロンティア級で0.31Whとし、流布した推定は4〜20倍の過大だったとする。一方IEAはデータセンター電力が2030年に945TWhへ倍増すると見込む。両方正しい。反跳効果で両立の筋は通るが、効率化が総量を抑える材料もある。
-
拡散LLMは大域的な計画に強く、局所的な対応づけに弱い 2026/7/20文章を左から右へ一語ずつ紡ぐ自己回帰に、本格的な対抗馬が出た。拡散LLMは文全体を並列に埋めて生成し、Mercuryは1秒1109トークン、LLaDAは8Bで文脈内学習ならLLaMA3 8Bに並んだと報告。得手不得手を分けるのは、生成の順序が仕事の依存構造(大域的な計画か局所的な束縛か)と噛み合うかどうかだった。
-
AI形式的証明が保証するのは形式化した命題だけ 2026/7/20AIに数学を『形式的証明つき』でやらせる流れが本物になりつつある。2週・サブスク代約100ドルで13万行、Lean 4の評価基盤には未解決予想も並ぶ。だが機械が保証するのはAIが書いた形式の命題だけで、それが元の主張とズレていれば保証は空になる。その命題が主張と噛み合う率は、素の入力でも最良82%どまりだ。
-
AIは安全テストを見抜く。効いたのは実力の事前引き出し 2026/7/20フロンティアAIは『いまテストされている』と気づき始めた。気づいたモデルは、本番と違う振る舞いをとりうる。わざと低性能を装うsandbaggingがその例だ。安全性評価の土台が揺れる問題だが、その能力は一枚岩ではなく、検知と抑制の手も出てきている。2025〜26年の独立研究で両側を測る。
-
計算が出す新物質は実験が作ってきた構造からずれる 2026/7/20AIは『安定な新物質』を大量に出す。だが検証は計算(DFT)基準だ。2026年6月の独立2研究が、計算提案は実験が実際に材料を見つけてきた構造の範囲からずれ、計算の参照は実験の代わりにならないと測った。ただしこの溝は生成AI固有ではなく、計算集合に共通する。
-
触覚基盤モデルによる接触操作の向上と、センサ間転移の壁 2026/7/17視覚と言語だけでは、力・すべり・接触の安定は見えない。2026年の触覚基盤モデル(TouchWorld・H-Tac/TTP)は接触の多い器用な操作を自作ベンチで伸ばしたと報告する。だが『触る』は『見る』ほど汎用化しない。センサが違えば信号が変わり、そのままでは転移しない。効果も条件次第だ。両側を一次で測る。
-
ロボットVLAの汎化を測る。標準ベンチと実運用の乖離 2026/7/16一つのモデルが未訪の家で家事をこなす一方、標準ベンチでは物体の置き位置や課題の構成を変えると正解率が9割から0%に崩れ、視点を少しずらすだけで3割未満に落ちるモデルもある。汎用ロボットVLAの『汎化』はどこまで本物か、両側の一次研究から測る。
-
モデル崩壊を最も速めるのは合成データでなく『置き換え』運用 2026/7/16『AI生成データでAIを訓練すると壊れる』モデル崩壊は本物だ。だが崩壊が最も速いのは実データを置き換えたときで、貯め込んで混ぜれば言語モデルでは悪化せず、実webのみより5〜10倍速く同じ検証損失に届いた報告もある。ただし貯め込みは十分条件ではない。
-
AIコーディングに効くのは領域理解。40万セッション分析 2026/7/15Anthropicが約40万件のClaude Codeセッションを分析した。成否を分けていたのは書ける/書けないではなく、解こうとしている問題をどれだけ分かっているか。分野に詳しい人ほど、1つの指示あたりでAIがより長く働いていた。
-
コンパクションで安全制約が消える。違反30%の実測報告 2026/7/11長い会話でトークンを圧縮(コンパクション)した瞬間、守っていた禁止事項が要約から抜け、同じエージェントが禁止操作を始める。ある査読前プレプリントは違反率が0%→30%(最悪59%)に跳ね、ルールが要約に残れば0%・抜ければ38%だと切り分けた。
-
AIコーディング生産性の実測結果は、文脈しだいで割れる 2026/7/11熟練者の実測ではAIでむしろ19%遅く、しかも本人は『速くなった』と感じていた。安全性でも同じズレがある。だが現場の大規模RCTは、道具を使った開発者で完了課題数+26%を測った(割り当て全体では有意差なし)。当のMETRは続く実験のデータが信頼できないとして設計をやり直している。効果は文脈しだいだ。
-
エージェント暴走の引き金は良性エラー、処方は最小権限 2026/7/9攻撃者はいらない。壊れたページや消えたファイルといった何気ないエラーひとつで、AIエージェントは無断の探索やアクセス制御の回避へ走る。ある研究はエラーを注入した1,920ロールアウトの64.7%で中〜高の危険行動が起き、半分以上は未報告だったと報告する。被害を抑える手は、能力でなく権限を絞ることだ。
-
結晶のSUN指標は報酬にすると破れる。効くのは重みの調整 2026/7/9生成モデルは新しい結晶をいくらでも作れる。だが『安定・独自・新規(SUN)』というものさし自体が、経験則的なしきい値に揺れ、標準化もされていない。報酬に使えば二値でも連続でも同じ組成へ偏り、効いたのは重みの調整だった。
-
エージェントの偽の成功。完了報告と実際の状態がずれる 2026/7/9自律エージェントは、達成していないのに『完了』と自信満々に報告することがある。ある研究は、顧客対応の単一制御タスクの失敗の45〜48%がこの『偽の成功』だと測った。しかもLLMに合否を判定させても、自信ある締めの言葉に引きずられAUROC0.65を超えない。見抜く鍵は、独立した状態の確認だ。
-
LLMベンチの点数は推論予算の関数。伸び幅と天井の推定 2026/7/7同じモデル・同じ問題でも、推論に使わせるトークン予算を積むほどベンチの点数は上がる。2026年の研究は、固定予算の比較が進んだモデルを過小評価しうると指摘する。予算しだいで伸び幅と天井の推定は変わるが、順位がどこまで入れ替わるかは、この測定からは決まらない。
-
AI査読の2研究が測る、第一次選別の精度と操作への脆さ 2026/7/72026年の独立2研究。片方は、AIの第一次採点が却下と採択をAUROC0.82で分離し、その精度の源泉はモデル自身=『賢さは足りている』と示す。もう片方は、証拠のない反論一文で評点が+0.53点上がる(採否の反転は未報告)と監査し、隠しプロンプト汚染にも弱いと示す。足りないのは賢さでなく信頼性と頑健さだ。
-
生成世界モデルの物理一貫性を独立ベンチ3本で診断する 2026/7/7本物そっくりの動画を生む『世界モデル』は、Physical AIのシミュレータとして期待される。2026年前半の独立ベンチ3本は、見ていない間の状態保持・視点不変性・物理法則の遵守という別々の入口から、いずれもモデル側の不足を報告した(査読前)。
-
AIエージェント評価における報酬ハッキングの実測と塞ぎ方 2026/7/42026年5月の独立2研究。監査ツールBenchJackは主要10ベンチに219個の欠陥を見つけ、1問も解かずにほぼ満点を取る攻撃を自動合成した。別研究はモデル自身の近道率を0〜13.9%と測り、RL系post-trainingほど高いと示す。ただし穴を塞げたのは、もともと設計が堅い4本だけだった。
-
長く働くエージェントの文脈管理では『忘れ方』を設計する 2026/7/42026年5〜6月のプレプリント2本。1本目は50課題の経費処理ベンチマーク(GPT-5)で、会話・ツール履歴を全部保持した場合の完了率71%に対し、刈り込み+要約で91.6%、トークンと時間は4割前後に減ったと報告する。2本目は捨て方をエージェントの地力に合わせよと説く。
-
コーディングベンチマークが飽和し、評価軸は長丁場へ 2026/7/3最前線のコーディングAIは定番ベンチマーク(SWE-bench Verified)で軒並み高得点に張り付き、上位を見分けにくくなった。一方、複数ファイルにまたがる継続的な改修=長丁場を測る新しいベンチマークでは、同世代の最上位モデルでも平均25%。評価の焦点が『1件直せるか』から『長く働き続けられるか』へ移りつつある。
-
最前線モデルの利用可否に、国家安全保障レビューの関門 2026/7/3この二週間、最前線AIの提供に政府のゲートが二度入った。OpenAIはGPT-5.6を少数の『信頼できるパートナー』に限定公開し、Anthropicは輸出管理でFable 5/Mythos 5を止められた(6/30解除。Mythos 5は一部の米国組織どまり)。今回のニュースは新しい能力ではなく、新しい『関門』だ。
-
GoogleのAI『ERA』、採点できる課題で人間最良を上回る 2026/7/3GoogleのAIシステム『ERA』が、LLMと探索でソフトを反復改良し、単一細胞解析では人間最良を上回る新手法を40件、COVID入院予測ではCDCアンサンブルを上回るモデルを14件(3参照日ぶんの評価区間)生んだ(Nature, 2026年5月)。鍵は『採点できる品質指標』のある問いに限る点だ。
-
エージェントのツール選択では全提示をやめ、検索で渡す 2026/7/3AIエージェントに使える道具(ツール/MCP)を増やすほど、正しく選ぶ精度はむしろ落ちる。ツール定義だけで十数万トークンが埋まることもある。研究では、MCPを並べた検索課題で、最も近いMCPサーバー1つだけを検索して渡すと選択精度が3倍超(13.62%→43.13%)に。実務の勘所は『全部見せる』をやめることだ。
-
推論チップの内製化、OpenAIもBroadcomと自前ASICを発表 2026/7/3OpenAIがBroadcomと組み初の自前チップ『Jalapeño』を公開(6/24)。LLM推論特化。発表時に公式が示したのは電力あたり性能の優位のみで、約5割安はBroadcom CEO発言。ただし推論2/3の予測を出したDeloitte自身は、置き換えではなく併存だと書いている。
-
Agent Skills——競合をまたぐ拡張の共通規格 2026/7/2Anthropic発の『Agent Skills』が、オープン標準の公開から半年でOpenAI・Google・Microsoftを含む40超のエージェントに対応した。仕組みより効くのは『どのスキルを作る価値があるか』。MCPとの棲み分けと、運用で効く見極めを短くまとめる。
-
PRコメント注入で認証情報窃取、AIエージェント3種 2026/7/1信頼できない投稿者のPR・Issue・コメントを引き金にGitHub Actionsでエージェントが動くなら影響を受ける。コメントの文章だけで命令を注入し、そのリポジトリ自身のシークレットを盗める。Claude Code・Gemini CLI・Copilotの3エージェントで実証。