AIエージェント入門
デモは魔法のように見えるAIエージェントの出来(凄さと脆さ)は、実際には何で決まっているのか
- 到達点
- エージェントの性能主張を「どのモデルが賢いか」の外側で評価できる能力——ループ×ハーネス×コンテキストの足場と、各ステップ成功率の掛け算(0.95の20乗≈36%)に分解し、ベンチマーク数字を測り方の条件つきで受け取れる状態
- 扱わないこと
- 個別ツールの操作法・モデル間の優劣比較(陳腐化が速い。実在ハーネスは設計判断の実測例としてのみ引く)/モデル内部の仕組み(訓練・アーキテクチャ)は扱わない/この労働力をどう統治・協働するかは、AI協働の姿勢を扱う単独記事の領分
- AIエージェントとは?LLMとの違い・仕組み・落とし穴
ChatGPTは質問に答える。でも「エージェント」はもう一歩進んで、自分でツールを使い、結果を見て、また考える。その違いを作っているのは、モデルの賢さではなく「ループとツール」という構成だ。AIエージェントの一番の基礎の話。
- AIエージェントのハーネスとは?同じモデルで成績が変わる仕組み
AIエージェントの話になると、つい「GPTとClaude、どっちが賢い?」とモデルを比べたくなる。だが同じモデルでも、ハーネスと呼ぶ“外側のスキャフォールド”の作り方しだいでベンチマークの成績は動く。エンジンだけでなく、車体の話でもある。
- コンテキストエンジニアリングとは?プロンプトとの違いと圧縮の判断
AIには「一度に見られる量」に限りがある。長く動くエージェントでは、その限られた枠に毎回“何を載せるか”が、出来を大きく左右する。その采配を設計する技術を、「プロンプトを書く」と対比して整理する。
- AIエージェントはなぜ長い作業で失敗する?成功率の掛け算と評価方法
AIエージェントのデモは魔法のようだ。だが実際の長いタスクに乗せると、ぼろぼろ崩れる。一因は、製造業の歩留まりとまったく同じ「掛け算」にある。各ステップ95%でも、20回続けば成功率は4割を切る。シリーズの本丸。