2026
当前位置: 首页 >> 在线课堂 >> 2026 >> 正文
实验室准确率 90%+,临床上却几乎用不起来:拉曼光谱诊断的真实困境
发布时间:2026-07-29 发布者: 浏览次数:

实验室准确率 90%+,临床上却几乎用不起来:拉曼光谱诊断的真实困境

AN 拉曼光谱学习笔记
2026年6月7日 22:00 2人



一、论文速览

项目
内容
标题
Critical assessment of Raman spectroscopy for clinical diagnostics: progress, limitations, and barriers to translation
作者
Muhammad Mahmoud Abdel Mohsen Abdullah(通讯作者,利比亚班加西医学技术学院诊断与治疗放射学系)等
发表
Clinical Chemistry and Laboratory Medicine(CCLM),2026 年。
关键词
拉曼光谱、表面增强拉曼(SERS)、临床诊断、机器学习、可重复性
  • 问题:拉曼光谱(RS)做疾病诊断在论文里看起来很美,敏感性、特异性动辄 90% 以上,但临床实际几乎没人在用。这中间到底卡在哪?
  • 现状:过去十几年,从肺癌、胃癌、口腔癌到糖尿病、阿尔茨海默病,RS/SERS 的"概念验证"研究一篇接一篇。但绝大多数是单中心、小样本(<100 例)、内部交叉验证。
  • 方法:本文不是新算法、新硬件,而是一篇 critical review。系统梳理了 RS 各变体(spontaneous、SERS、RRS、TERS、CARS、SRS)的原理、临床证据、以及导致"实验室漂亮、临床落地难"的方法学陷阱。
  • 效果:作者明确给出了一份 TRL(技术成熟度)评分表——SERS 还停留在 TRL 4-5(实验室临床研究阶段),TERS 还在 TRL 2-3(基础研究),没有任何模态进入 TRL 7+ 的常规临床应用。
  • 一句话评价:如果你做光谱+机器学习的医学诊断(无论是 RS 还是其他),这篇值得一读,尤其是它点出的spectrum-wise vs patient-wise 数据划分问题——这个坑很多 ML 论文都在踩。

二、研究背景与动机

如果你只看顶刊摘要,会得出一个结论:拉曼光谱马上就要颠覆病理诊断了。胃癌敏感性 89%、特异性 92%;肾癌 AUC 0.97;Mohs 手术中识别基底细胞癌准确率 94%。数字漂亮得让人心动。

但你走进任何一家三甲医院的病理科或检验科,几乎找不到拉曼光谱仪。常规诊断仍然是 H&E 染色、免疫组化、PCR、ELISA。这中间的落差,正是这篇综述要解释的。

前人为什么没做到? 拉曼光谱的物理基础其实早就成熟了——分子振动产生非弹性散射,每种生物大分子(蛋白、脂质、核酸)都有自己的"指纹谱",无需标记就能读出化学组成。这个 idea 太诱人了,所以从 1980 年代起就有人尝试医学应用。但拉曼散射本身信号极弱(每 10⁶~10⁸ 个入射光子才有 1 个发生拉曼散射),加上生物样本里到处都是荧光背景,信号被淹没。后来 SERS(利用金/银纳米结构的局域电磁场增强)把信号放大了 10⁶~10¹⁰ 倍,TERS(针尖增强)甚至做到了纳米级空间分辨。技术上看,路是越走越宽的。

那卡点在哪里? 作者的核心观察是:RS 领域被"准确率指标"绑架了。研究者为了发论文,会反复在小数据集上调模型、做交叉验证,然后报出 90%+ 的指标。但这种数字几乎无法外推到真实临床——因为患者群体不同、仪器不同、样本制备不同、甚至同一台仪器在不同日期测的数据都不同。RS 的所谓"分子指纹",其实极易被实验条件扰动。

本文的切入角度不是技术综述,而是方法学审计。 作者反复追问:你的样本量足够吗?你做的是 spectrum-wise 还是 patient-wise 数据划分?有没有外部验证?有没有跟金标准(病理、分子检测)头对头比较?把这些问题回答清楚,绝大多数高准确率结果就会显著缩水。


三、方法详解

这是一篇综述,没有"新方法"。但它把 RS 临床应用涉及的全流程拆开来批判性审视。我把核心内容重组成三块。

3.1 整体思路

一个完整的 RS 诊断流程是:样本制备 → 光谱采集(选择 RS 变体和激发波长)→ 预处理(去荧光、去噪、归一化)→ 特征提取(PCA、波段积分等)→ 分类/回归模型(化学计量学或机器学习)→ 诊断输出。每个环节都有自己的方差源,串起来就成了"准确率虚高+复现失败"的温床。

3.2 核心创新点(其实是核心批判)

批判一:RS 变体的临床成熟度被严重高估

作者画了一张技术成熟度表(Table 1),这是全文最有冲击力的部分:

模态
TRL(技术成熟度等级)
状态
常规拉曼(Conventional RS)
TRL 4-5
早期临床评估
SERS
TRL 4-5
实验室临床研究
内窥镜 RS
TRL 5-6
试点临床试验
AI 辅助 RS
TRL 3-4
新兴研究
TERS
TRL 2-3
基础研究

作为对照,要进入常规医保和广泛临床使用,一般需要 TRL 8-9。也就是说,没有一个 RS 模态接近临床常规应用。这跟读者从单篇论文里得到的印象是矛盾的。

为什么会这样?作者拆开讲:

  • 常规 RS:信号太弱,单点采集动辄几秒到几十秒,外科医生没法在术中等。
  • SERS:增强机制依赖纳米基底,但基底的形貌、热点分布、化学污染批次间差异大——同一个实验室不同天做的结果都对不上,更别说跨实验室。而且金/银纳米颗粒进入人体的安全性还没过监管这关。
  • TERS:原理上能做纳米级化学成像,但仪器极其精密,对环境振动、温度敏感,临床上根本搬不动。
  • CARS/SRS:成像快,但需要双脉冲激光系统,设备价格和维护成本远超常规病理设备。

批判二:数据划分方式直接决定结果可信度——这是 RS+ML 论文最大的方法学漏洞

这一段是我认为全文最有价值的部分,对所有做生物光谱+机器学习的人都适用。

为什么这个设计很重要? 拉曼光谱诊断里,每个患者通常会采集多张光谱(不同位置、不同重复测量)。如果你把所有光谱混在一起,随机划分训练集和测试集,那同一个患者的光谱很可能同时出现在两边——这就是经典的数据泄漏(data leakage)

会发生什么? 模型不是学到了"疾病的生化特征",而是学到了"这个患者的个体特征"。测试时它认得这个患者,所以分类对了。准确率虚高,到了新患者上就崩。

正确的做法是什么? 作者强调要做patient-wise splitting(按患者划分):训练集和测试集来自完全不同的患者群体。

类比一下:这就像考试时,老师把考题里的一部分先告诉了你(spectrum-wise),然后再考你;而真正的考试应该是用从来没见过的题目(patient-wise)。

更进一步,作者指出k 折交叉验证也只是内部验证——它在同一个数据集内打转。要真正证明模型可用,必须做外部验证(external validation):换一家医院、换一台仪器、换一批患者,看模型还行不行。RS 领域做过外部验证的研究屈指可数

公式角度看一个简化的过拟合估计——若内部 k 折交叉验证误差为 ,真实泛化误差为 ,在小样本()+ 高维特征(拉曼光谱通常 个波数点)的场景下:

差距能到 10-15%。这就是为什么实验室里 95% 准确率的方法,到了多中心验证里掉到 80% 甚至更低。

批判三:SERS 基底的"物理不可重复性"

SERS 信号强度对热点的依赖是高度非线性的。一个分子是否落在金纳米颗粒间隙的"热点"里,决定了它信号强度差几个数量级。这意味着即便是同一片基底的不同区域,测出来的强度都不一样,更别提批次间。

作者列举了几条尝试改进方向:

  • 有序纳米结构(光刻制备)—— 牺牲了 SERS 的随机增强红利,但换来了重现性。
  • SHINERS(壳隔离纳米颗粒) —— 在金/银核外加一层薄壳防止氧化和团聚。
  • AI 辅助纳米结构设计 —— 反向设计纳米几何,把电磁场分布做得更均匀。

但作者也很坦白:这些方案目前只是"工程化思路",没有哪一个真正成为行业标准。

3.3 其他值得提的点

  • 预处理算法:荧光去除常用多项式拟合、非对称最小二乘(asymmetric least squares)、自适应迭代加权惩罚最小二乘(airPLS)、小波滤波;去噪用 Savitzky-Golay、小波、PCA 滤波。**不同预处理可以让同一份数据的最终分类准确率差出 5-10%**——这本身就是可重复性问题。
  • MORE-SERSome:一个新提出的"分子可解析"思路,把复杂 SERS 谱通过谱解构反推到具体代谢物。这是 RS 走向可解释性的有意义尝试。
  • AI-nano-driven SERS:把纳米结构设计、采集参数优化、谱图解释闭环成一个 AI 优化系统。听起来很美,但目前只是概念。

四、实验与结果

这是综述,没有自己的实验。但作者梳理了多个领域的报告性能:

疾病
样本类型
报告敏感性
报告特异性/准确率
肺癌
组织
0.90
0.76(AUC 0.945)
肾癌
组织
0.94
0.92(AUC 0.972)
胃癌
组织
0.89
0.92
食管癌
组织
0.91
0.92
膀胱癌
组织
准确率 90%
口腔癌(OSCC)
唾液 SERS
准确率约 90%
基底细胞癌(Mohs 手术)
术中组织
准确率约 94%

作者关于这些数字的态度非常克制:这些都是单中心、小队列、控制变量下的结果,不能直接推断到日常临床。换句话说,这张表读起来不是"RS 已经很厉害",而是"RS 在最理想条件下能达到这个上限"。

实际差距体现在:

  • 样本量:典型研究 20-100 例。在医学诊断领域,FDA 批准的诊断器械通常需要数千例多中心验证。
  • 金标准对比:很少有研究把 RS 跟病理、分子检测做头对头比较。多数研究只是说"我们的准确率是 X",而不是"在同样的患者上,我们 X,病理 Y"。
  • 健康经济学:拉曼仪 5-20 万美元/台,单次测量耗材成本几乎为零。听起来便宜,但维护、校准、人员培训和工作流改造的成本几乎没人算过。

五、关键图表精读


Figure 1:拉曼光谱基本原理

图片


怎么看:一张能级图,画的是入射光子(incident photon)打到分子上之后,分子从基态被激发到一个"虚能级",然后弛豫到不同振动态时释放出能量不同的光子。横轴可以理解为时间或过程,纵轴是能量。

核心结论:拉曼信号的本质是分子振动能级的"指纹"——每种化学键有特定振动频率,散射光子的能量损失对应这个频率。

关键数据:定性图,无具体数据。


Figure 2:Rayleigh 散射 vs Stokes/anti-Stokes 拉曼散射

图片


怎么看:三种散射的能级跃迁对比。瑞利散射(弹性)入射光子和散射光子能量相同;Stokes 散射(散射光子能量更低);anti-Stokes 散射(散射光子能量更高)。

核心结论:生物医学拉曼几乎都用 Stokes,因为室温下大部分分子在基态,Stokes 信号比 anti-Stokes 强好几倍(玻尔兹曼分布决定)。

值得注意:作者没有解释为什么有些场景(如温度测量)会偏好 anti-Stokes,是个小遗憾。


Figure 3:正常组织与 OSCC 各分期的平均拉曼谱对比

图片


怎么看:四张子图(A-D 对应 T1-T4 期),每张画的是正常组织和某一期肿瘤的平均拉曼谱。横轴是拉曼位移(cm⁻¹,可以理解为分子振动频率),纵轴是相对强度。要关注的是不同波数处两条曲线的高度差。

核心结论:随着 OSCC 进展,蛋白(amide I 区域,约 1650 cm⁻¹)、脂质(约 1440 cm⁻¹)、类胡萝卜素(约 1520 cm⁻¹)等区域强度有阶段性变化。

值得注意:这是一个"无分类器"的展示——光看平均谱就能看到分期差异。但平均谱掩盖了个体差异,真实的患者间方差可能比这些平均差异还大。这是图表呈现常见的乐观偏差。


Figure 4:胃癌拉曼诊断研究中的样本类型分布

图片


怎么看:这是个统计图,展示胃癌 RS 研究里使用的样本类型(组织活检、胃液、血清等)的分布比例。

核心结论:组织样本仍占主导,体液(biofluid)样本数量在增加,反映"非侵入性诊断"的研究趋势。

值得注意:图表展示了趋势,但没有按样本类型分别报告诊断性能差异——这正是综述本身的局限之一。


Table 1:拉曼模态技术成熟度(前文已展示)

图片


最有价值的一张表。把"研究热度"和"临床距离"两件事分开,给读者一个清醒的现实坐标。


Table 2 & Table 3:RS 诊断关键发现汇总 / 主要拉曼技术的临床相关性

图片


怎么看:两张并列的总结表。Table 2 按"进展领域"列出关键证据;Table 3 按"技术变体"列出原理、应用、优势、局限。

核心结论:每种技术都有自己的甜区和盲区。比如 SERS 灵敏度极高但基底不稳定;TERS 空间分辨率最高但不可能用于常规临床;便携式 RS 部署灵活但灵敏度被牺牲。

值得注意:Table 3 把"局限"列出来这件事本身就值得肯定。很多综述只列优点。


Table 4 & Table 5:跨应用和跨疾病的对比汇总

图片


怎么看:Table 4 按应用场景列出(Mohs 手术、糖尿病肾病、精准医学),Table 5 按疾病列出(胃癌、OSCC、阿尔茨海默病)。每行都有"研究结果"和"局限"两列。

核心结论:所有应用都呈现一个共同模式——单中心可行性已证,多中心验证缺失,临床整合未完成。

关键数据:所有"临床准备度评估"列里,没有一项写"已就绪"或"已批准"。


六、评价与讨论

亮点

亮点一:把"为什么 RS 临床用不起来"系统化了。很多读者读了几十篇 RS 论文后都有"为什么没人用"的困惑。这篇文章把答案分解为信号弱、基底不稳、缺少标准化、验证不充分、缺少健康经济学评估、缺少多中心证据这几个具体维度,每个都有论据。这种"解构性综述"对刚入门或准备申请项目的研究者价值很大。

亮点二:明确点出 spectrum-wise 数据划分的方法学陷阱。我个人最欣赏这一点。这个问题在生物医学+ML 领域普遍存在——不只是拉曼,包括病理切片、基因表达、医学影像。能在一篇 RS 综述里把这个问题讲清楚,受众远超 RS 领域本身。

不足

RS 当前所有报告性能都受限于单中心、小样本、缺少外部验证;缺少跟金标准的头对头比较。




海南省生物材料与医疗器械工程研究中心/海南省创伤与灾难救援研究重点实验室版权所有 ©2024

地       址:海南省海口市龙华区学院路3号力行楼C栋1层

联系电话:0898-66892503 

微博

微信扫一扫

扫一扫手机访问