タグ: AI協働
-
AI駆動の研究が成果を出す条件は?AlphaEvolveなど4事例を比較 2026/8/31分かれ目は外部検証者の有無ではなく、採点に候補を落とす力があるかだった。実験・評価器・採点指標が候補を選ぶCo-Scientist・AlphaEvolve・ERA(保留データで採点し直した単一細胞解析)は検証を通り、論文への採点が助言にとどまったshadow evaluationは6点満点で2点・1点に終わった。
-
RAGのチャンク分割は手法で精度がどこまで変わる?固定長との比較 2026/8/22RAGのチャンク分割を1,080構成で比べた研究は、固定長分割のPrecision@1が2〜3%、最良手法は24%だと報告した。別の研究では固定長はAccuracy@5で1.65ポイント差、処理時間は1秒未満。ただしRecall@10では差が開く。二つは設定も違い、差を切り方だけに帰せない。
-
機械学習論文の再現性はAIで確かめられる?再実行の結果と費用 2026/8/22研究レビュー企業SAIのエージェントがICML 2026の口頭発表168本をレビューし、105本を再実行した。その105本のうち、検証可能な主張が5つ以上あった92本で、試行できた主張の4割超を再現できたのは34本。その105本で全実験を回す費用は中央値で約8,900ドル。だが「再現できた」の定義はまだ揃っていない。
-
AIと学習:認知負荷理論で分ける、任せてよい負荷と任せられない努力 2026/8/14本は読者ごとに較正がずれ、家庭教師は地図を持って困難を課す。AIはどこに立つか。認知負荷理論の三負荷で測ると、強みは較正ずれを消せること、危険は学習が起きる場所の負荷まで頼めば消えること。努力の引き受けは代われない。足場は作れるが、既定の勾配はそちらを向いていない。約千人の実験では、プロンプト設計が害の有無を分けた。
-
AI協働で本当に新しい問題は何か:AIが壊す前提の見分け方 2026/8/14AI協働の問題の大半は、昔からある規律の翻訳で解ける。見分ける問いは二つある。既存の作法はあるか、AIが壊す前提は何か。残った新しさは壊れた前提として名指しし、その答えには日付を添える。
-
AIを使えば判断力は伸びる?伸びない二つの理由と直し方 2026/8/10AIの議論は生産性一色だが、同じツールは人間の学習を加速も空洞化もさせうる。「使っていれば上手くなる」という素朴解が破綻する過程を認知負荷理論と熟達研究で追い、負荷の配分と検証ループの二つの修正を経て、判断を持ち込む先が続くかどうかという、ループの固定費を回収できる条件で学習投資の配分を決める。
-
AIエージェントの組織化:人の組織論が効く部分と効かない部分 2026/8/7AIエージェントを何体も並べると、人を並べたときと同じ問題が出る。重複、噛み合わない成果物、滞留。人間のマネジメント技術は半分だけ効く。分け方・調整・流し方は前提を当て直せば使えるが、動機づけと責任は載せる土台がない。その境目を原典の前提条件で引く。
-
ソフトウェア開発とは何をする仕事か:4つの見方とAIに任せる範囲 2026/8/3AIが書いたコードは動くし、テストも通る。だが「なぜこの形なのか」を誰も説明できないと、安全には変えられない。ソフトウェア開発を「何をする活動か」とどう捉えるか。理論を組むのか、証明するのか、組み立てるのか、コードを書くことそのものか。この答えによって、AIとの協働の姿勢と、選ぶべき実在のハーネスが変わる。
-
AIエージェントを多数動かすガバナンス:例外監視と権限の絞り方 2026/8/3エージェントを増やすのは一瞬だ。だが1人でN体を統べることと、その速さで壊せる範囲を縛ることは、別の設計仕事になる。実運用ハーネスの既定は、戻す・止める・持たせない・届く先を縮めるに分かれ、いちばん広く合意が取れたのは最後の一つだった。
-
AIエージェントとスクリプトの使い分け:非決定のコストと来歴 2026/8/3生成が安くなったからといって、何でもエージェントに投げるのは違う。非決定のコストを差し引いた後の純益で選び、そして安く作った以上、二度と再現できない出力の来歴を残す。どちらもAI以前からある経済と来歴の規律が土台になる。ただし、それが届かない先が三つ残る。
-
AIエージェントの記憶の設計:RAG・要約・引き継ぎの使い分け 2026/8/2知識は最新に保て、仕様化も生成も安い。だが有界のコンテキストしか持たないエージェントは忘れ、自然言語の意図は曖昧だ。知識はメモリ階層に写して外部化し、意図は曖昧さの高い所だけ固定して対話で収束させる。どちらも、AI以前からある記憶と仕様の規律の延長で扱える。
-
AI出力の検証はどこまで自動化できる?CIで止める違反と人が見るもの 2026/8/1生成もレビューも安くなったが、AI出力は自信満々に誤る。機械が判定できる違反は指示でなく機構ゲートで赤く止め、判定できないものに人手を温存する。確信度を正しさと取り違えない信頼の置き方を、品質を工程に組み込む規律と自動化研究の知見から翻訳する。
-
AIエージェントに人の確認が必要な理由:ドメイン知識と責任 2026/7/23「最後は人間が見る」に潜む、漠然とした「人間なら質が上がる」という前提。第一線の文書が挙げるのは責任の割り当てと要件整合。要件整合を検証=品質の土台に戻し、そこにコンテキストに入りきらないドメイン知識を置くと、人手の理由はドメイン知識と責任という二つの中身に分解できる。順位ではなく配置の問題として、線の引き方を辿る。
-
AIエージェントの任せ方:任せていい仕事の見分け方と知識の置き場所 2026/7/17AIは速い。だから全部投げる、は設計をしていないのと同じだ。何をAIにやらせないか、知識をどこに置くか。委譲の線引きの大半は、AI以前からある古い規律で引ける。
-
AI生成コードのコードレビューは何を見る?目的・危険度・仕様 2026/7/16レビューの第一の目的は、欠陥をすべて捕まえることではない。コードベースの健全性を守り、知識と規範をチームへ移すことだ。Googleの研究と、同じ著者が加わった書物はそう報告する。この原則を先に置くと、AI出力の検証も、生成前の仕様設計も、やることは自然に決まる。どちらもAI以前からある規律の話だ。
-
AIエージェントのハーネスとは:外側で組む制御と検証 2026/7/12AIに頼むと、最初に返るものは驚くほど整っている。問題はそのあとだ。本当に使おうとした瞬間に綻びが見える。「作らせる」ことはもう難しくない。難しいのは、返ってきたものを安心して次へ渡せる状態にすることだ。その距離を、誰もがつまずく型を入口に一つずつ詰めていく。
-
AIコーディングの生産性は本当に上がる?遅い実験と速い実験の違い 2026/7/11熟練者の実測ではAIでむしろ19%遅く、しかも本人は『速くなった』と感じていた。安全性でも同じズレがある。だが現場の大規模RCTは、ツールを使った開発者で完了課題数+26%を測った(割り当て全体では有意差なし)。当のMETRは続く実験のデータが信頼できないとして設計をやり直している。効果は文脈しだいだ。