[Submitted on 6 Mar 2026 (v1), last revised 23 Jul 2026 (this version, v3)]

View PDF HTML (experimental)

摘要:對開放詞彙物件偵測(OVOD)模型進行量化,可降低其記憶體與運算成本,但極低位元量化會嚴重破壞跨模態(區域-文字)與模態內(區域-區域)對齊。此種多模態退化是先前封閉詞彙偵測器量化方法無法解決的獨特挑戰。為克服此問題,我們提出 QATMA(Quantization-Aware Training with Multimodal Alignment),這是首個專為 OVOD 設計的多模態感知且與架構無關的 QAT 框架。QATMA 整合兩大核心元件:(i) 課程式 QAT(Curriculum QAT),依功能角色分割偵測器並逐步擴大量化範圍,以抑制誤差累積並確保穩定最佳化;(ii) 以文字為錨點的成對相似度蒸餾(Text-anchored Pairwise Similarity Distillation),透過聯合嵌入空間中的成對餘弦相似度,將完整精度教師模型的區域-文字與區域-區域對齊轉移至量化模型。LVIS 與 COCO 零次學習基準的實驗結果顯示,QATMA 在極低位元設定下明顯優於現有 QAT 基線,分別提升最高 4.3 與 7.6 AP。

Submission history

From: Jibum Kim [view email]
[v1] Fri, 6 Mar 2026 06:57:55 UTC (2,515 KB)
[v2] Mon, 9 Mar 2026 07:42:44 UTC (2,515 KB)
[v3] Thu, 23 Jul 2026 06:43:29 UTC (12,042 KB)