ものづくり・製造
外観検査AIの難所は、評価に使う解像度で入れ替わる
目次
工場で不良品を見つける仕事は、長く人の目が担ってきた。これを機械に任せる試みは古くからあるが、大きな壁があった。不良の見本を大量に集めないと学習できない。ところが不良品は、滅多に出ないから不良品である。見本が集まるころには、現場はその不良の対策をもう済ませている。
近年、この前提を外す手法が出てきた。これらの手法は、良品だけ、あるいは言葉による説明だけを頼りに、見たことのない不良を見つけにいく。現場の小さな機械に載る段階まで来たという報告もある。
ならば次に知りたいのは「使えるか」ではなく「自分のところの対象で使えるか」になる。ここで手掛かりになるのは、難しさの呼び名ではない。透明だから難しい、光っているから難しい。そうした直感は、実際の成績と食い違うことがある。何が効いていて何が効いていないのかは、対象ごとの数字を並べて初めて見えてくる。導入を判断する側は、その並びを読むべきだ。
自分の対象で通用するかは、何を見れば分かるのか。難条件の呼び名ではなく、対象別の成績から読む。
欠陥画像が集まらないという長年の壁は下がった。だが、下がった先で効くかどうかは、ベンチマークの数字では決まらない。 製品の欠陥画像を一枚も使わないゼロショットの手法が、標準的なデータセットで実用域の検出精度を報告している1。軽量化も進んだ。メモリとパラメータを大きく削って推論を速くし、精度の低下を数ポイントに抑えたまま組み込み機器で動かした報告もある2。問題は測り方のほうに移った。従来のベンチマークは飽和し、最先端どうしの差が誤差に埋もれて、順位を見ても差が分からなくなっていた3。現実的な産業条件で組み直したベンチマークでは、それを作った当人たちが試した、正常画像で学習する既存手法のどれも実用の目安に届いていない3。しかも難所は直感とずれる。作った側が難条件に挙げた透明・逆光の対象は、対象別に見るとむしろ成績が良い部類だった。画像を縮小して測る標準の条件で低いのは金属の正反射と正常品そのもののばらつきだった。解像度を上げて測り直すと、低かった4対象のうち3つは持ち直し、最下位に残ったのは金属缶の1対象だけだった3。それぞれの数値と、どの指標・どの許容値での話かは本文で示す。
欠陥サンプルを集めずに始められる
外観検査をAIで自動化するときの障害は、昔からモデルではなくデータだった。教師あり学習で不良を分類させるなら不良の画像が要る。ところが工程が安定しているほど不良は出ず、歩留まりが高い工程ほど学習データが集まらない。
そこで使われてきたのが教師なし異常検知である。正常品の画像だけを学習し、そこから外れたものを異常と判定する方式だ。それでも自社製品の正常画像を集めて学習を回す工数は残る。ゼロショットはその工数も外し、対象製品の画像を一枚も学習させずに検出させる。
視覚言語モデル CLIP は、画像とテキストを同じ埋め込み空間に写し、両者の近さを測れるモデルである。Li、Ivanova、Bruveris の FADE は、この CLIP を産業用の異常検知に適応させた。著者らが挙げる仕組みは三つ。多重スケールの画像特徴を言語側と揃うように取り出すこと、異常に関するテキストプロンプトの組を自動生成して束ねること(この束ねは ChatGPT に作らせたもので、著者ら自身が再現できないと書いている)、問い合わせ画像と参照画像から得た視覚側の手がかりで検出を導くことだ1。以下に引く FADE の数字は、手法の提案者が自分の手法について報告したものである(著者3名は商用企業 Onfido/Entrust に所属する)。
著者らは数値を画素単位の指標 pixel-AUROC で示している。pixel-AUROC は、画素ごとの判定の識別性能をしきい値を動かしながら面積で集計した値で、1に近いほど切り分けがよい。ゼロショットで MVTec-AD 89.6%、VisA 91.5%。正常画像を1枚だけ与える 1-normal-shot では MVTec-AD 95.4%、VisA 97.5% に上がる1。BMVC 2024 に採択された査読付き論文である。本稿が引いているのは arXiv 版(2024年8月31日投稿)の数値で、BMVC の掲載版とは突き合わせていない1。
エッジ機で動いたという報告が出た
見えるかどうかと、ラインに載るかどうかは別だ。ゼロショット手法は大きな視覚言語モデルを抱えることが多く、検査装置のそばに置く小型計算機であるエッジデバイスには収まりにくかった。Khan らの LiZAD は、密で位置情報を保った画像特徴を出す DINOv3 と、計算量の軽い MobileCLIP2 のテキスト埋め込みを、学習可能な射影ヘッドで共通の潜在空間に写して組み合わせる2。
既存の最先端ゼロショット異常検知6手法と比べ、著者らはメモリ使用量が平均61.5%減、パラメータ数が74.6%減、レイテンシが3.02倍速になったと報告する。精度の代償は、データセットごとの最良値(手法をまたぐ)に対して平均 P-AUROC が 6.4 ポイント下がる(88.05% 対 約94.5%)というものだ。比較先は単一の手法ではない。4データセットの最良値のうち MPDD だけが AdaCLIP で、残る3つは Bayes-PFL である。実在する単一の最良手法(Bayes-PFL)と並べ直すと平均は93.3%で、差は5.25ポイントに縮む。データセットは VisA、BTAD、MPDD、MVTec-AD の4つ2。なお、これも手法の提案者自身が回した比較である2。
ただし効率側と精度側で分母が違う。61.5%・74.6%・3.02倍速は6手法の平均に対する値で(表の注記は「LiZAD の改善は全手法の平均に対するもの」)、6.4/5.25 は最良値に対する値である。平均側には P-AUROC が3割台のデータセットもある素の CLIP が入っている。分母を単一最良の Bayes-PFL に揃えると、3.52倍速・メモリ69.4%減・パラメータ78.7%減で代償が5.25ポイントになる。実在する最強の対抗手法と一対一で並べたほうが、LiZAD は全軸で良く見える2。
Jetson NX と Jetson AGX という2種のエッジデバイスに載せ、著者らの所属先であるヴェローナ大学 ICE Lab の生産ラインで定性的に試験している2。著者らが報告するのはそこでの精度ではなく速度と電力で、Jetson NX で1枚あたり754.6 ms・14.8 W、AGX で554.4 ms・28.5 W である2。IEEE COINS 2026 に採択された。
ベンチマークは情報を失っていた
セグメンテーションは、画像を画素単位で塗り分け、どの画素が欠陥かを示す処理である。Heckler-Kram らは、MVTec AD や VisA での性能がこのセグメンテーションの指標で頭打ちになったと指摘する。AU-PRO は、欠陥領域ごとにどれだけ正しく重なったかを、誤検出の水準を変えながら集計した値だ。この AU-PRO で、最先端の手法がしばしば1パーセントポイント未満の範囲で競り合う状態になっていた。著者らはこれを識別力の欠如と呼ぶ3。
指標は混ぜられない。AU-PRO は欠陥領域単位の重なりを、pixel-AUROC は画素単位の識別性能を測る別物で、データセットも違う。FADE の 89.6% と次節の 60% は直接比べられない。
難しい条件では6割に届かない
Heckler-Kram らは、その識別力を取り戻すために MVTec AD 2 を組んだ。このデータセットは8つの異常検知シナリオ、8,000枚を超える高解像度画像からなる3。評価を回したのはデータセットを作った当人たちである。著者らはマシンビジョンの商用ベンダー MVTec Software に所属する。評価された7手法は、いずれも対象ごとに正常画像で学習する教師なしの手法で、前節までのゼロショット手法は含まれていない。7手法の公式実装を対象ごとの調整なしに既定設定のまま動かしている(原文 without scenario-specific tuning of hyperparameters。掲載版は category-specific)。調整すれば上がる余地は残っている3。掲載版は、WinCLIP のような視覚言語モデルを評価していないことを自ら限界に挙げている。付録では GPT-4o-mini と Gemini 2.5 Flash を一部の対象の画像に定性的に当て、どちらも専用の異常検知手法に及ばなかったと書いている3。
結果として著者らが示したのは、最良の手法ですら AU-PRO(許容0.30)が58.7%にとどまるという一文だ(原文 the current best model achieves only 58.7% AU-PRO0.30)。7手法が一つも60%に届かず、平均は52.6%である。「平均が下回る」と書くと超えた手法があるように読めるが、無い。しかもこの許容0.30は著者らが「より寛容な設定」と呼ぶほうで、本ベンチマークの主指標である許容0.05ではどの手法も31%に届かない(最良の EfficientAD で30.8%。arXiv 版の値で、掲載版は INP-Former を加えて最良31.6%・全手法32%未満。いずれも8対象を平均した手法単位の値)3。
著者らは評価設計にも手を入れた。テストデータは3つに分かれ、うち2つは正解データが非公開である。この設計は、手法の側が公開された正解に合わせ込むという、既存ベンチマークの飽和の経路を塞ぐ。非公開側の一方は照明条件を変えてあり、実運用で起きる分布のずれに対する頑健性を測れる3。International Journal of Computer Vision に 2026年に掲載された。
掲げた難条件と、実際に落ちた対象は揃わない
ここからは本稿の読み方であり、論文が主張していることではない。
論文がデータセットの難条件として掲げるのは、要旨では四つである。透明な対象と重なり合う対象、暗視野照明と逆光照明、正常データ自体のばらつきが大きい対象、そして極めて小さな欠陥だ(結論部ではさらに画像全域に分布する欠陥が加わり、画像端に接する欠陥は著者らが本文3.1節で述べる)3。暗視野照明とは、対象に斜めから光を当てて正反射光をカメラに入れず、傷などで散乱した光だけを拾う方式を指す。逆光照明は対象の背後から光を当て、輪郭を影として写す方式だ。
ただし、掲げた難条件のうち透明と逆光は、むしろ最も高い部類だった。 対象別の AU-PRO(許容0.05、TESTpriv=照明変化なしの非公開テスト。以下は対象単位の値で、前節の30.8%は同じ指標を8対象で平均した手法単位の値)を手法横断の最良値で並べると、逆光の Vial が63.0%、同じく逆光の Fruit Jelly が54.4% で8対象中の1位と2位である。低いのは反射する金属の Can が13.9%、暗視野の Sheet Metal が18.0%、重なり合う Wall Plugs が20.3%、テクスチャの Fabric が22.2% だった。測った結果の議論で著者らが対象名を挙げて難しいと書くのも Can だけである(原文 The object Can is especially challenging for the investigated state-of-the-art models.)。著者らはどの対象にどの難条件を割り当てたかを8対象すべてについて書いており(本文3.1節と表3)、ずれているのはその割り当てと実測の順位のほうだ3。
ただしこの並びは、評価の解像度が作っている。 これらは画像を 256×256 に縮小して回した条件の値で、同じ論文が原寸の半分で再評価した表では順位が入れ替わる。Fabric は 22.2% から 82.9% へ上がって上位に移り、Sheet Metal と Wall Plugs も大きく持ち直す。低いまま残るのは Can だけだ3。透明・逆光はデータセットの設計意図としての難条件であって、測ってみて落ちた側ではない。逆に、掲げられた条件のうち暗視野(Sheet Metal)と正常データのばらつき(Fabric・Sheet Metal)は、256×256 の既定条件では掲げたとおり下位に来ている。
256×256 の既定条件で実際に落ちた側に並ぶ性質は二つある。金属の正反射(Can・Sheet Metal がともに底)と、正常面のばらつき/テクスチャ(Fabric・Sheet Metal がともに底)である。後者は前段のとおり、評価の解像度を上げると持ち直す。前者も一様ではない。同じ反射する金属でも Sheet Metal は持ち直し、底に残るのは Can だけになる。もっとも Can の通常の撮影は、白い紙で拡散させた均一な照明で行われている。鏡面ハイライトを出すスポットライトは、照明を変えたテストにだけ加えられた。原典は Can の難しさとして、反射のほかにテクスチャ面の微小な欠陥と、缶の回転による正常品のばらつきを挙げており、どれが効いたかは切り分けていない。反射の影響が数字に出るのは照明を変えたテストのほうで、原寸の半分での Can の最良値は 26.6% から 15.8% へ下がる3。
なお「対象どうしの重なり」と「欠陥の見かけの小ささ」は、前段の二つの性質と違って上下を分けない。重なりに指定された3対象は Wall Plugs 20.3・Rice 27.6・Walnuts 51.8 と散らばり、小さい欠陥は最下位の Can にも1位の Vial にも付いている。正反射は照明の角度と偏光で、重なりは整列と単品化で、見かけの大きさはレンズの解像力と距離と画素数で決まる。つまり光学系、照明、治具という工場が自分で握っている変数だ。
一方、著者らが結論部で「MVTec AD 2 での成績は、概して画像サイズを大きくすることで上げられる」と書いた画像サイズは、このうちの画素数とは別の量である。動かしたのはカメラではなく、 2.6〜5 メガピクセルで撮影済みの画像を、モデルに入れる前にどこまで縮めるかだった。著者らの説明では、このデータセットは小さく低コントラストの欠陥を狙って設計されており、256×256 へ縮小する前処理の段階で欠陥そのものが消えるという仮説から、原寸の半分までの再評価を行った。その代わり実行時間とメモリは1桁以上増える。著者らの処方も、実行時間とメモリの面でモデルを効率よく大きくすることに置かれている。自社の欠陥が縮小で消える大きさなら、先に効くのはカメラの画素数ではなく、モデルへ渡す解像度のほうだ。
言葉と画素の粒度が合っていない
欠陥の位置を細かく当てられない理由の一端は、手法の側にもある。Fan らは、画像の説明文と画素パッチ単位の異常のあいだに意味的な不一致があると指摘する。従来手法は画像全体を指す説明文しか事前定義できず、それを画素パッチ一つひとつに突き合わせていた。細かい記述が欠けているため位置の特定が最適でなくなる、というのが著者らの診断だ4。画像全体を指す一つの記述では、基板のピンと抵抗のように別々の部品からなる面を、部品ごとに言い分けられない。著者らが挙げる例もそこである。
対策として Fan らは、多段階のテキスト記述を生成する MFSC と、多段階の学習可能プロンプトと意味整合を持つ FineGrainedAD を提案し、MVTec-AD と VisA の few-shot 設定で優れた性能を示したと報告している。ただし要旨に数値は載っておらず、著者らは成績を本文の表で報告している。著者ら自身の要約によれば、補助的な学習データなしに3つの少数ショット設定で画素単位 AUROC が既存手法を上回る4。arXiv 投稿時は査読前だったが、その後査読誌 Pattern Recognition に掲載された(vol.178, 113316)。
何から手を付けるか
まずゼロショット手法で試す。FADE のような手法は対象製品のサンプルを学習させずに動くので、欠陥画像の収集や治具の設計に予算を付ける前に、そのタスクが画像で見えるかを切り分けられる1。ただし良否の判定そのものを見るなら、参照すべきは画素単位ではなく画像単位の数字だ。ゼロショットの画像単位 AUROC は MVTec-AD 90.0%、VisA 75.6% で、WinCLIP の 91.8%/78.1% を下回る。著者ら自身、画像単位の比較について「ゼロショットの FADE は WinCLIP の再現であり新規の追加はない」と書いている。画素単位は逆で、同じ論文は隣の段落で「ゼロショットでは FADE が全指標で大幅に上回る」とし、実際 89.6% 対 85.1%、91.5% 対 79.6% である。前節までに挙げた 89.6%/91.5% はこちら側の数字だ1。さらに、FADE の著者ら自身が結論部で適用限界を切っている。ゼロショットの視覚誘導はクエリ画像自身のパッチから参照を作るため、革のようなテクスチャ画像ではよく効くが、トランジスタのような物体画像では効きが落ち偽陽性を出す。本稿が 256×256 の既定条件で「実際に落ちた側」として挙げた金属反射・テクスチャとは向きが逆なので、対象が物体寄りなら、ゼロショットの一次切り分けは通ったほうも疑ってかかる必要がある。
次に、自社のタスクを実際に成績が低かった側に照らす。対象は正反射する金属か。当たるなら、公開ベンチマークの高い数字は自社の条件を代表していない。論文が測った3つの解像度のどれでも最下位だったのは、反射する金属のうち Can だけである。同じく反射する金属に分類された Sheet Metal は、原寸の半分では8対象の中位まで持ち直した。正常面のテクスチャのばらつきが大きい対象は、256×256 に縮めた評価では低く、原寸の半分では Fabric が8対象中の1位に入った。加えて、検出したい欠陥が画素数にして幾つかも押さえておく。欠陥の見かけの小ささ自体は上下を分けなかったが、モデルへの入力解像度を上げると成績は動く。
金属反射の側に当たるなら、学習時と運用時で照明が変わらないようにそろえる。欠陥が縮小で消える大きさなら、カメラより先にモデルへの入力解像度を見直す。対象別の成績も、入力解像度を上げると成績が動くことも、論文の表と結論部が示している3。載せる計算機のメモリと消費電力も先に決めておく。LiZAD は Jetson NX と Jetson AGX で動作している2。
最後に、数字の比べ方を固定する。ベンダーが示す pixel-AUROC と、難しいベンチマークの AU-PRO を並べてはいけない。89.6% が 60% に落ちた、という読み方は成立しない(前者は画素単位の識別、後者は欠陥領域単位の重なりで、許容の取り方でも倍近く動く)。
出典4件
-
Yuanwei Li, Elizaveta Ivanova, Martins Bruveris, “FADE: Few-shot/zero-shot Anomaly Detection Engine using Large Vision-Language Model”(arXiv:2409.00556, 2024年8月31日投稿)。BMVC 2024 に採択された査読付き論文で、視覚言語モデル CLIP を産業用の異常検知に適応させた。仕組みは多重スケールの画像特徴、テキストプロンプトの自動生成と束ね、参照画像による視覚側の誘導の三つ。ゼロショットの pixel-AUROC は MVTec-AD 89.6%、VisA 91.5%、正常画像を1枚だけ与える 1-normal-shot では MVTec-AD 95.4%、VisA 97.5%。これらは画素単位の位置特定であり、良否判定にあたる画像単位のゼロショット AUROC は MVTec-AD 90.0%、VisA 75.6% と低く、著者らは画像単位(AC)の比較について「ゼロショットの FADE は WinCLIP の再現で新規の追加はない」と明記する(原文
For the zero-shot setting, FADE is a reproduction of WinCLIP without any new additions.。画像単位では WinCLIP 91.8%/78.1% を下回る)。画素単位(AS)は逆である。著者らは逐語Under zero-shot, FADE significantly outperforms other methods on all metrics for both MVTec-AD and VisA.と書く。ゼロショット画素 AUROC は WinCLIP 85.1%/79.6% に対し FADE 89.6%/91.5%。この二つは同じ §4.1 の隣り合う段落にあるので、前者だけを引くと後者を打ち消してしまう。原典 §5 は自ら適用限界を切っている。その逐語はThe vision-guided zero-shot AS constructs the memory bank from its own query image patches. This works well at detecting anomalies in textural images (E.g. leather) that normally contain visually similar patches. However, this works less well and produces false positives for anomaly detection in object images (E.g. transistor) whose patches differ to a greater extent.である。この視覚誘導は §4.1 が 89.6/91.5 の要因として名指しする三部品の一つである。また ChatGPT 生成プロンプトは再現不能と著者らが明記する(逐語the use of text prompts generated by ChatGPT is not reproducible)。さらに同じ Table 4 の行の F1-max は、ゼロショットで 39.8%(MVTec-AD)/16.7%(VisA)である。 pixel-AUROC が9割でも、しきい値を置いた画素判定はこの水準である(1-normal-shot でも 54.6%/42.3%)。https://arxiv.org/abs/2409.00556 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 -
Uzair Khan, Luigi Capogrosso, Muhammad Aqeel, Francesco Setti, Michele Magno, Marco Cristani, “LiZAD: A Lightweight Zero-Shot Anomaly Detection Framework for Industrial Manufacturing”(arXiv:2607.01949, 2026年7月2日投稿)。IEEE COINS 2026 に採択。DINOv3 の密で空間情報を保った視覚特徴と、計算効率の高い MobileCLIP2 のテキスト埋め込みを、学習可能な射影ヘッドで共通の潜在空間に結合する。最先端のゼロショット異常検知6手法と比べ、メモリ平均61.5%減、パラメータ74.6%減、レイテンシ3.02倍速を達成し、精度の代償はデータセットごとの最良値(手法をまたぐ包絡線)に対する平均 P-AUROC の 6.4 ポイント低下(88.05% 対 約94.5%)。比較先は単一の手法ではない。 表の注記は
the best modelsと複数形で、4データセットの最良値のうち MPDD だけが AdaCLIP、残る3つは Bayes-PFL である。実在する単一の最良手法 Bayes-PFL と並べ直すと平均は93.3%、差は5.25ポイントに縮む。この 6.4 は要旨と本文で意味が違う。 要旨はdropping the average P-AUROC by just 6.4% relative to the best state-of-the-art model、本文はrepresenting only a 6.4 percentage point drop compared to the absolute best-performing baselines(本文側も複数形で、包絡線の読みを二重に裏づける)。Table II から再計算すると 94.475−88.05=6.425 で、ポイント差のほうが正しい(相対比なら6.8%にあたる)。効率側と精度側で分母が違う点にも注意したい。Table I のキャプションはIn green the improvements of LiZAD compared to the average of all the models.(平均)、Table II の注記はIn red, the decrease in percentage of LiZAD with respect to the best models.(最良値)。分母を単一最良の Bayes-PFL に揃えると、レイテンシ 338.50÷96.19=3.52倍速、メモリ 1−1.01÷3.30=69.4%減、パラメータ 1−97.44÷456.72=78.7%減となり、代償5.25ポイントと釣り合う組になる。なおレイテンシは要旨が3.02倍速、本文が「平均69.9%減」。両者は同じ量の別表現だが、換算が合わない。 表の6手法の平均レイテンシ290.39ms を LiZAD の96.19ms で割ると3.019倍(=3.02倍速)で、同じ比を削減率で言えば66.9%減、印字の69.9%とは約3ポイントずれる。同じずれはパラメータ側にもある。 メモリの61.5%は6手法平均に対する比(1−1.01÷2.625=61.52%)として小数一桁まで再現するが、同じ規則でパラメータを計算すると 1−97.44÷412.01=76.4%で、印字の74.6%とは1.8ポイントずれる(数字の入れ替わりに見える)。印字の3つのうち再現するのはメモリだけである。データセットは VisA、BTAD、MPDD、MVTec-AD。NVIDIA Jetson NX および Jetson AGX に実装し、ヴェローナ大学 ICE Lab の生産ラインで定性的に試験した(原文 “qualitatively tested”)。そこで著者らが報告するのは精度ではなく速度と電力で、NX が754.6 ms/14.8 W、AGX が554.4 ms/28.5 W。https://arxiv.org/abs/2607.01949 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 -
Lars Heckler-Kram, Jan-Hendrik Neudeck, Ulla Scheler, Rebecca König, Carsten Steger(著者の所属はマシンビジョンの商用ベンダー MVTec Software GmbH である。データセットも評価も作成者自身による), “The MVTec AD 2 Dataset: Advanced Scenarios for Unsupervised Anomaly Detection”(arXiv:2503.21622, 2025年3月27日投稿)。International Journal of Computer Vision に 2026年に掲載された査読付き論文(vol.134 no.4, 2026-03-09, DOI:10.1007/s11263-026-02743-0。arXiv 版の Comments 欄は投稿時点の
paper under reviewのままなので、掲載の確認は DOI 側で取る)。本記事が引く数値と逐語は arXiv 版(2025年3月)のもの。掲載版は arXiv 版のscenarioをcategoryと呼び替え(without scenario-specific tuningはwithout category-specific tuning、eight challenging scenariosはeight object categories)、評価手法に INP-Former(Luo ら 2025)を加えて8手法とした。追加で動くのは AU-PRO(許容0.30)の平均 52.6%→53.1%、許容0.05 の最良 EfficientAD 30.8%→INP-Former 31.6%(Table 7 キャプションはless than 32%)、対象別最良の Vial 63.0%→67.8%・Sheet Metal 18.0%→21.4% で、最良 58.7%・全手法60%未満・Can が最下位・透明と逆光が上位という本記事の読みは掲載版でも変わらない。既存ベンチマーク(MVTec AD、VisA)のセグメンテーション AU-PRO が飽和し、最先端手法が1パーセントポイント未満の範囲で競り合うため意味のある比較ができない、という問題意識で著者らが作った。8つの異常検知シナリオ、8,000枚を超える高解像度画像を含む。評価したのは7手法(PatchCore, RD, RD++, EfficientAD, MSFlow, SimpleNet, DSR)で、いずれも正常画像だけで学習する教師なし手法である(逐語In line with the unsupervised setting, the training and validation sets contain only non-anomalous data.)。ゼロショットの視覚言語モデルは評価に入っておらず、掲載版は Limitations でそれを自ら挙げる(逐語since our primary focus was to develop a challenging dataset for single-modality vision models, assessing vision-language models (VLMs) such as WinCLIP (Jeong et al., 2023) and AnomalyGPT (Gu et al., 2024) could offer valuable insights into their performance on MVTec AD 2.)。付録 D.2 では GPT-4o-mini と Gemini 2.5 Flash を一部の対象の画像に定性的に当て、前者はlags notably behind that of specialized anomaly detection models、後者はthe precision and consistency of the defect localization remain limited compared to dedicated anomaly segmentation approachesと書く。7手法の結果として、AU-PRO(許容0.30)はどの手法も60%に届かない(最良58.7%、平均52.6%)。著者らは許容0.30を「より寛容な設定」と呼び(逐語the more tolerant evaluation setting)、本ベンチマークの主指標である許容0.05では全手法が31%未満(最良 EfficientAD 30.8%)と述べる。Table 7 のキャプションは逐語All methods achieve less than 31% segmentation performance on the TESTpriv of MVTec AD 2.である(なお結論部は同じ事実をeven below approximately 30%と緩く書いており、30.8% を含む言い方としてはキャプション側が正確)。いずれも8対象を平均した手法単位の値である。難条件として要旨は透明・重なり、暗視野・逆光照明、正常データのばらつき、極小欠陥を挙げ、結論部では画像全域・画像端の欠陥も加える。ただし対象別の結果は掲げた難条件と一致しない。 許容0.05・非公開テストの手法横断最良値で Vial 63.0%/Fruit Jelly 54.4%(ともに逆光)が8対象中1・2位、低いのは Can 13.9%(金属反射)、Sheet Metal 18.0%、Wall Plugs 20.3%、Fabric 22.2% である。測った結果の議論で著者らが名指しするのも Can だけ(逐語The object Can is especially challenging for the investigated state-of-the-art models.)。ただし難条件の割り当て自体は8対象すべてにある。 根拠は §3.1 の逐語The bulk goods scenarios (Wall Plugs, Walnuts, Rice) involve overlapping and occluded objects ... Textured objects (Fabric, Sheet Metal) were chosen for the high variability in their normal data. Reflective metal objects (Sheet Metal, Can) and transparent objects (Vial, Fruit Jelly) introduce additional challenges due to reflections and distortions, respectively.と Table 3(main challenges associated with each MVTec AD 2 object)である。本記事の対象と条件の対応はこの §3.1 の割り当てに拠る。著者らはテストデータを3分割し、うち2つは正解データが非公開である。非公開側の一方は照明条件を変えてあり分布のずれへの頑健性も評価できる。https://arxiv.org/abs/2503.21622 本記事が引く対象別 AU-PRO は、論文の既定条件である 256×256 に縮小した評価の値である(逐語images are resized to 256 × 256 pixels)。同論文は原寸の半分での再評価も付録に載せており、そこでは Fabric が 82.9 に達するなど順位が入れ替わる(この表は学習時間の都合で DSR が Rice 以外未評価のため包絡線は6手法ぶん。DSR は 256×256 で Can・Sheet Metal の最良値を出していた手法なので、欠測は最良値を下げる向きにしか効かず結論は変わらない)。結論部の逐語はAlthough performance on MVTec AD 2 can generally be increased by using larger image sizes, we highlighted the necessity of efficiently scaling up current models with respect to runtime and memory consumptionである。解像度を上げれば成績は上がるが、実行時間とメモリの制約が別途かかる、という両面である。ここでの画像サイズはカメラの画素数ではない。2.6〜5 メガピクセルで撮影済みの画像(逐語from 2.6 to 5 megapixels)を、モデルへ入れる前にどこまで縮めるかの設定である(逐語we conducted experiments with an increased input size up to half the original image height and width)。理由は §4.3.3 に著者らの仮説として在る——逐語our dataset design focused on small and low-contrast defects, we hypothesized that certain anomalies simply disappear during the preprocessing to scale the images to the current standard setting of an image size of 256 × 256、代償はthe inference runtime and memory consumption drastically increase by more than an order of magnitude。原寸の半分の表(arXiv 版 Table 11)で最下位に残るのは Can(手法横断の最良 26.6)だけで、§3.1 が同じく反射する金属に分類した Sheet Metal は 72.4 で8対象中5位まで上がる(512×512 の Table 10 でも Can 24.2 が最下位)。ただし Can の通常照明は拡散で(逐語The can is positioned in front of a white paper, which helps to create a diffuse and even illumination.)、鏡面ハイライトはテスト用に足したものである(逐語For the acquisition of the test data, two additional spotlights are directed at the can to generate specular highlights on its metallic surface and its label.)。付録は照明変化を TESTpub と TESTpriv,mix に限ると書き(逐語For inducing lighting condition changes in the test data, i.e., TESTpub and TESTpriv,mix)、TESTpriv は学習と同じ照明である(逐語TESTpriv includes images with the same lighting conditions as the training set.)。Table 3 は Can の難しさをtiny defects on a textured surface・light reflections・high variability in the normal data due to rotation of the cansの3つとする。照明を変えた TESTpriv,mix では、原寸の半分での Can の最良値が 15.8 に下がる。 https://doi.org/10.1007/s11263-026-02743-0 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 -
Yuanting Fan, Jun Liu, Xiaochen Chen, Bin-Bin Gao, Jian Li, Yong Liu, Jinlong Peng, Chengjie Wang, “Towards Fine-Grained Vision-Language Alignment for Few-Shot Anomaly Detection”(arXiv:2510.26464, 2025年10月30日投稿)。査読誌 Pattern Recognition に掲載された(Elsevier, vol.178, 論文番号 113316, DOI:10.1016/j.patcog.2026.113316。Crossref のレコード作成は 2026-02-27、号は2026年10月。DBLP
journals/pr/FanLCGLLPW26も一致し、著者8名まで同じ)。arXiv 版(v1)の Comments 欄は12 pages, 7 figuresのままで採択を示さないため、掲載の確認は DOI 側で取る。本記事が引く数値は arXiv 版のもの。画像の説明文と画素パッチ単位の視覚的異常のあいだの意味的な不一致を問題とし、従来手法は画像全体を指す説明文しか事前定義できず各パッチトークンに突き合わせるため、詳細な記述を欠いて位置特定が最適でなくなると指摘する。原典が言う粒度は欠陥の大きさではなく視覚成分の意味的粒度である。 逐語はthe above methods still stay at a image-level view and fail to dive into the fine-grained perception (e.g., pins, resistors in PCB)およびfail to penetrate to the component-level perceptual granularityである。原典は欠陥の微小さについては述べていない。多段階のテキスト記述を生成する MFSC と、多段階の学習可能プロンプトおよび多段階の意味整合からなる FineGrainedAD を提案し、MVTec-AD と VisA の few-shot 設定で優れた性能を示したとする。要旨に数値は無いが、本文 Table 1 が image/pixel AUROC を報告しており(例: 91.04/95.49、94.51/96.71)、§4.2 は逐語outperforms existing methods on pixel-level AUROC in three few-shot settings without the burden of auxiliary training dataと述べる。優位は画素単位の側である。 https://arxiv.org/abs/2510.26464 ↩ ↩2
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。