在真實世界的獸醫分診環境中,單一資訊永遠不足。病患可能表現出症狀、生命徵象、檢驗結果、醫學影像,甚至飼主的自由文字描述。多模態風險評分 將所有這些異質資料類型融合為統一的預測 – 例如,惡化機率或是否需要加護照護。這種方法模擬了專家臨床醫生如何整合多種線索做出最終判斷。
結構化臨床數據 – 生命徵象(心率、呼吸頻率、體溫)、檢驗結果(肌酸酐、白血球計數、白蛋白)和症狀清單。這些是數值或類別資料 – 最容易輸入經典機器學習模型。
醫學影像 – X 光片、CT 掃描、MRI 和超音波。電腦視覺模型提取特徵(例如:「肺炎嚴重程度」或「骨折機率」)作為預測器的輸入。
自由文字敘述 – 飼主描述、轉診紀錄或獸醫臨床病歷。自然語言處理 (NLP) 將原始文字轉換為結構化特徵(例如:「提到嗜睡」、「厭食持續時間」)或直接將句子嵌入為向量。
時間序列數據 – 來自 ICU 設備的連續監測(心率趨勢、血氧飽和度)。遞迴神經網路或變換器捕捉指示惡化的動態變化。
總結:每種模態提供拼圖的不同碎片 – 組合它們能產生比任何單一來源更準確的風險評估。
早期融合(特徵層級): 獨立提取每個模態的特徵,然後串聯成一個長向量再輸入分類器。簡單,但可能無法捕捉跨模態的交互作用。
晚期融合(決策層級): 為每個模態訓練獨立的模型,然後平均或投票決定輸出。模組化好,但忽略模態之間的相關性。
中間融合(混合式): 使用神經網路在不同層級組合表示,讓模型學習一個模態如何影響另一個模態(例如:影像特徵控制文字的重要性)。
圖:三種融合方法 – 早期(特徵層級)、晚期(決策層級)和中間(混合)融合。不同的臨床情況需要不同的融合策略。我們的流程會根據存在的資料模態和分診任務,應用最合適的方法 – 早期、晚期或中間融合。
缺失數據: 某些模態可能無法取得(例如:未進行影像檢查)。解決方案包括插補、為不同輸入子集使用獨立模型,或設計能透過遮罩或注意力機制處理缺失輸入的架構。
可解釋性: 臨床醫生需要信任預測結果。使用 SHAP(適用於表格數據)、注意力圖(適用於影像和文字)或局部解釋等技術,顯示哪些模態驅動了預測。
數據對齊: 確保同一患者在同一時間點的數據正確匹配。建立穩健的 ETL 流程,保留時間戳記和患者 ID。
總結:真實世界的臨床數據是混亂的 – 建立穩健的多模態系統需要在缺失數據、可解釋性和數據對齊方面進行仔細的工程設計。