[Submitted on 30 Jul 2026]

View PDF HTML (experimental)

Abstract:我們描述 DS@GT 提交至 ImageCLEFmedical Caption 2026 挑戰的作品,該挑戰延續 ROCOv2 資料集的長期基準測試,包含兩項任務:概念偵測(任務 1),為放射影像指定 UMLS 概念唯一識別碼(CUI),以及標題預測(任務 2),生成自然語言標題。對於任務 1,我們的主要提交是 ConvNeXt-V2、BiomedCLIP ViT-B/16 與 DenseNet-169 的三向晚期融合集成,搭配正則化的「誠實閾值調校」程序,旨在避免罕見概念的驗證過擬合;此提交在官方提交中排名第一,主要 $F_1$ 為 $0.5790$,次要 $F_1$ 為 $0.9657$。同時,我們提交了一個在凍結 BiomedCLIP 嵌入上運行的無訓練 KNN 檢索流程,其主要 $F_1$ 達到 $0.5780$,次要 $F_1$ 為 $0.9599$——在主要軌道上基本上與微調集成相當,但成本僅為其一小部分。對於任務 2,我們的提交包含微調的 Gemma-3 27B 模型(整體 $0.3571$,在官方提交中排名第三)、使用自訂 Vizwins 合併的完整微調 BLIP 流程($0.3564$),以及使用 PubMed 風格提示的零-shot MedGemma-4B 運行($0.3186$),涵蓋廣泛的模型規模與訓練成本。程式碼:this https URL

Submission history

From: Bowen Wang [view email]
[v1] Thu, 30 Jul 2026 07:01:49 UTC (4,151 KB)