2024年からGGUFを展開して読めたtransformersが、ggmlカーネルまで取り込み、モデル定義だけを手元に残す設計を、作り手の記事から読む。対応範囲の狭さ、量子化による精度低下、同じカーネルを複写して使うvLLMとの違いという三つの代償も確かめる。
← 全タグ