スキャフォールドとプロンプトの自動最適化が、重みを変えずに性能を伸ばすレバーとして台頭した。強化学習を上回りながらロールアウトは最大35分の1で済んだ、と報告する手法がある。だが自動最適化は評価データに過適合しうる——分布シフトで崩れることが報告されている。
← 全タグ