Future Aview - Beyond Big 3
[!NOTE] 此為演講筆記
Aview 的未來發展方向:從既有 Big 3 量化分析,延伸到更多器官、血管急症、腫瘤 CAD、氣道疾病與多模態報告生成;核心邏輯是先建立穩定可信的影像量化,再把結構化資料累積、搜尋、解讀,最後發展成臨床與病人端的智慧輔助。
- 這套 roadmap 以 「Beyond Big 3」 為主軸,將既有胸部 CT/LDCT 量化能力延伸到更多非傳統目標,包括骨密度與骨折風險篩檢、身體組成分析、主動脈瘤直徑量測與警示、脂肪肝篩檢,以及脊椎神經狹窄的 dural sac 橫截面自動量測;其價值在於把原本附帶於 CT 影像中的資訊轉換成可量化、可追蹤、可臨床使用的風險指標,例如 sarcopenia、代謝風險、steatosis 與骨折風險。
- 在血管與急症領域,系統進一步從篩檢型 LDCT 擴展到 contrast CT、診斷型影像與急症情境,目前研究方向包括肺栓塞疑似區域自動偵測、以肺動脈與心臟結構進行肺高壓風險評估,以及主動脈剝離的 12-zone 自動分類;這代表平台不只做慢性病或篩檢定量,也試圖進入需要快速判讀與優先處理的 emergent territory。
- 目前 R&D 的三大主軸可整理為:
- 第一是 Detection & CAD,包括 incidental pulmonary nodule CAD 與 lung metastasis CAD
- 第二是 Robust Quantification,包括 LDCT denoising、kernel harmonization,以及不受 scanner、dose、reconstruction kernel 影響的可重現定量
- 第三是 Multimodal Model,以影像定量結果作為基礎,進一步支援 multimodal interpretation 與 LLM report drafting。
- 現階段 bench 上的重點包括 denoising、lung metastasis CAD、airway labeling、mucus-plug detection/scoring,以及 multimodal LLM。
- Robust quantification 的基礎是 LDCT denoising 與 kernel conversion,技術方向包括 MTD-GAN 以及 image-to-image Schrödinger Bridge;目標是讓 LAA、LCS、CAC、body composition 等 quantitative biomarkers 在不同廠牌、不同劑量、不同 reconstruction kernel 下仍保持穩定。這一點很重要,因為若 biomarker 會隨掃描條件大幅波動,臨床上就難以作為可信的追蹤或決策依據;因此 harmonization 是所有 Beyond Big 3 biomarker 的底層骨幹。
- 在 oncology 應用中,lung metastasis CAD 的臨床問題是 metastatic nodules 通常數量多、尺寸小,會增加判讀負擔,也容易漏診;系統目標是自動偵測疑似轉移結節,並在 per-nodule 與 per-patient 層級量化 metastatic status,特別適合用於 chest CT 上新發或變大的轉移結節優先判讀。流程上由 AVIEW CAD 先做 nodule detection,再經由 classification engine 判斷 metastatic status,預期效果是降低 workload 並提高 AUC/sensitivity。
- Lung metastasis CAD 的模型訓練策略採用 large-scale weak-label pretraining 再接 small high-quality strong-label fine-tuning;資料設計包括約 30k 以 radiology report 產生的 weak-label dataset,以及約 3k 的 strong-label dataset。結果顯示 weak-label dataset 可達約 48% workload reduction,strong-label dataset 約 54.2%,而 30k weak-label pretraining 接 3k strong-label fine-tuning 可提升至約 62.2% workload reduction,顯示弱標籤大資料加上高品質標註微調,可能兼顧效率與效能。
- Airway labeling 的方向是建立自動化 airway-tree labeling,對兩側肺部 segmental bronchi 產生 30 個 segment-level labels,作為一致且可重現的解剖參照;目前效能約為 precision 0.99、recall 0.81、F1 0.89(n=27)。這項技術不只是單純標記氣道,而是後續 small-airway quantification、airway-wall quantification、COPD/bronchiectasis phenotyping 的基礎,也會作為 mucus-plug detection 與 scoring 的前處理。
- Mucus plug detection & scoring 則是建立在 airway-tree labeling 之上,用於 COPD、bronchiectasis 與 asthma 的黏液栓自動偵測;scoring 採用 segment-based score,也就是計算含有 mucus plug 的 bronchopulmonary segments 數量。其臨床意義在於 mucus score 可反映 airflow obstruction 與 symptom severity,進一步支援 phenotype 分類與治療反應追蹤;目前模型仍處於 lesion-proposal stage,特徵是 recall 高,但 false positives 尚未完全抑制。
- 多模態 LLM 的定位不是直接取代影像偵測,而是 以可信定量為基礎的報告生成。流程上,task-specific CNN 先負責偵測與量化結構化 findings,VLM 再補充較廣泛的影像觀察,兩者形成 structured findings summary,最後由 LLM 產生 draft report。這樣設計的理由是 VLM 單獨用於偵測仍不可靠,因此必須先由已驗證的 specialist CNN 鎖定關鍵量測與結構化結果,再讓 VLM 補足專門模型無法涵蓋的資訊,最後由 LLM 撰寫報告。
- 整體發展方向可以概括為五個階段:Quantify、Accumulate、Search、Interpret、Assist。第一步是從每一次掃描產生 AVIEW quantitative outputs,並以 denoising 與 harmonization 確保穩定性;第二步是在大規模層級累積結構化資料;第三步利用 content-based image retrieval 搜尋相似病例;第四步讓 multimodal LLM 依據偵測與定量結果輔助報告解讀;第五步則發展 screening-result LLM chatbot,作為病人端支持工具,而非取代醫師。
- 總結而言,這組投影片的核心訊息是:先把 CT 影像轉成可靠、可重現、可累積的定量資料,再在此基礎上發展 CAD、風險評估、相似病例搜尋、報告草稿與病人輔助工具。也就是「quantification first, intelligence on top」:CNN 負責把數字做準,VLM 擴大影像理解範圍,LLM 負責生成報告與溝通介面,而每一步都必須建立在可信的影像量化之上。