Research note / AI · 分割 · 评估

视网膜 OCT 分割评估:Dice 之外还要保存什么

从受试者级划分、边界误差、体积偏差和跨设备测试建立分割实验的最小评估集。

2 分钟阅读 版本 0.1

Dice 很适合概括区域重叠,却不足以单独描述 OCT 分割质量。薄层、小液体区域和长边界结构中,相同 Dice 可能对应完全不同的几何错误。

先保证划分没有泄漏

训练、验证和测试必须按受试者划分。来自同一体数据的相邻 B-scan 高度相似,如果按图像随机划分,测试集会包含接近训练样本的切片。

还需要检查:

  • 同一受试者的双眼是否跨集合。
  • 同一检查的重复导出或压缩版本是否重复出现。
  • 文件名、边框、分辨率或厂商标记是否泄漏标签。
  • 人工修订是否使用了测试集预测结果作为提示。

区域指标

Dice 与 IoU 描述预测区域和参考区域的重叠。报告时应给出按病例分布,而不只是把所有像素合并后的一个总体数字。对于大量空白切片,还要明确空预测与空标签如何计分。

边界指标

层分割或薄结构更适合增加平均表面距离、Hausdorff distance 的稳健版本(例如 HD95)或按 A-scan 计算的边界绝对误差。

边界误差需要换算到物理单位。只报告像素误差会把不同轴向采样间隔的设备混在一起。

体积与厚度误差

如果下游分析使用液体体积、层厚或区域面积,应直接评价这些量的偏差和一致性。像素级重叠改善不一定带来体积估计改善。

跨设备与质量分层

至少按设备厂商、扫描协议和图像质量分层报告。一个在混合测试集上表现稳定的模型,可能只是在样本较多的设备上表现很好。

RETOUCH 的价值之一,就是把多厂商数据和统一挑战协议带入评估。它仍不能替代面向目标人群和真实部署流程的外部验证。

最小结果表

建议每次实验至少输出:

  1. 病例级 Dice 或 IoU 分布与置信区间。
  2. 物理单位下的表面或边界误差。
  3. 体积、面积或厚度偏差。
  4. 各设备与图像质量分层结果。
  5. 固定数量的随机失败样本审阅,而不是手工挑选案例。
  6. 阈值、后处理、排除规则和空标签策略。

阅读入口:Bogunovic et al., 2019, RETOUCH benchmark