タグ: エージェント
-
掛け算の残酷さ——なぜデモは凄いのに実用は脆いのか 2026/6/21AIエージェントのデモは魔法のようだ。だが実際の長いタスクに乗せると、ぼろぼろ崩れる。理由は、製造業の歩留まりとまったく同じ「掛け算」にある。各ステップ95%でも、20回続けば成功率は4割を切る。シリーズの本丸。
-
コンテキストエンジニアリング——机に載せる最小限を選ぶ 2026/6/21AIには「一度に見られる量」に限りがある。長く動くエージェントでは、その限られた枠に毎回“何を載せるか”が、出来を大きく左右する。「プロンプトを書く」から「コンテキストを設計する」へ——いま最も注目される足場の技術。
-
ハーネス——同じモデルでも“外側”で成績は動く 2026/6/21AIエージェントの話になると、つい「GPTとClaude、どっちが賢い?」とモデルを比べたくなる。だが同じモデルでも、“外側の足場”——ハーネス——の作り方しだいでベンチマークの成績は動く。エンジンだけでなく、車体の話でもある。
-
AIエージェントとは何か——LLMをループと道具で包んだもの 2026/6/21ChatGPTは質問に答える。でも「エージェント」はもう一歩進んで、自分で道具を使い、結果を見て、また考える。その違いを作っているのは、モデルの賢さではなく「ループと道具」という構成だ。AIエージェントの一番の基礎の話。
-
AIエージェントの急所は生成ではなく検証だ 2026/6/21AIに自律的なマルチステップ作業をやらせて本当に壊れるのは何か。生成は安い、検証は高い——完了報告は実際の状態とずれ(単一制御ドメインでは失敗の45〜48%が偽の成功)、テスト通過は成果物のすり替えを見逃し、LLM判定も文面に釣られる。実測に沿って、検証可能性を設計に埋め込む規律を整理する。