In Silico

AIエージェント入門

シリーズ 全4回・最終更新 2026/6/21

デモは魔法のように見えるAIエージェントの出来(凄さと脆さ)は、実際には何で決まっているのか

到達点
エージェントの性能主張を「どのモデルが賢いか」の外側で評価できる能力——ループ×ハーネス×コンテキストの足場と、各ステップ成功率の掛け算(0.95の20乗≈36%)に分解し、ベンチマーク数字を測り方の条件つきで受け取れる状態
扱わないこと
個別ツールの操作法・モデル間の優劣比較(陳腐化が速い。実在ハーネスは設計判断の実測例としてのみ引く)/モデル内部の仕組み(訓練・アーキテクチャ)は扱わない/この労働力をどう統治・協働するかは、AI協働の姿勢を扱う単独記事の領分

第1回から読む →

  1. 第1回 2026/6/21
    AIエージェントとは?LLMとの違い・仕組み・落とし穴

    ChatGPTは質問に答える。でも「エージェント」はもう一歩進んで、自分でツールを使い、結果を見て、また考える。その違いを作っているのは、モデルの賢さではなく「ループとツール」という構成だ。AIエージェントの一番の基礎の話。

  2. 第2回 2026/6/21
    AIエージェントのハーネスとは?同じモデルで成績が変わる仕組み

    AIエージェントの話になると、つい「GPTとClaude、どっちが賢い?」とモデルを比べたくなる。だが同じモデルでも、ハーネスと呼ぶ“外側のスキャフォールド”の作り方しだいでベンチマークの成績は動く。エンジンだけでなく、車体の話でもある。

  3. 第3回 2026/6/21
    コンテキストエンジニアリングとは?プロンプトとの違いと圧縮の判断

    AIには「一度に見られる量」に限りがある。長く動くエージェントでは、その限られた枠に毎回“何を載せるか”が、出来を大きく左右する。その采配を設計する技術を、「プロンプトを書く」と対比して整理する。

  4. 第4回 2026/6/21
    AIエージェントはなぜ長い作業で失敗する?成功率の掛け算と評価方法

    AIエージェントのデモは魔法のようだ。だが実際の長いタスクに乗せると、ぼろぼろ崩れる。一因は、製造業の歩留まりとまったく同じ「掛け算」にある。各ステップ95%でも、20回続けば成功率は4割を切る。シリーズの本丸。

← 全シリーズ