先看全局
逐条拆解
- 任务口径先写死。是分诊提示、报告初筛还是趋势预测,三种任务对错误的容忍度完全不同,混在一起评没有意义。
- 输入必须是真实工作流里的东西。用模板渲染出来的干净文本测出来的分数,换成检验科手写备注、缩写和错别字就会掉。
- 看它错在哪,不只看错多少。儿科阑尾炎那项研究里,端到端 LLM 的敏感度与特异度权衡不稳定,换一下句子顺序结果就变,这类波动在急症分诊里是致命的。
- 要求输出可追溯的证据。有研究用 18 条专家评分表约束模型抽取支持证据,F1 达到 0.774、AUROC 0.934,比零样本 LLM 相对提升 44.4%,关键就在于每条判断都能指回原文。
- 把幻觉率当成硬指标。生物医学事实核查方向的工作显示,经过证据约束的强化学习后,证据幻觉率下降 19.63%,标签准确率提升 9.95%。
- 别只看准确率,看沟通是否得体。面向公众的健康信息,检索到的文献自带学术腔,会盖过你设定的语气要求,这在同伴支持场景里是实打实的问题。
- 行为类任务要单独设计评测。用 LLM 智能体模拟隔离行为的研究发现,感知健康严重程度是最强的预测因子,而只给地理标签并不能让模型产生文化差异化的行为。
- 预测类任务要测冷启动。有系统在真实呼吸道流行季里自主生成并筛选预测模型,在数据稀缺的病原体上也能跑通,这类能力必须单独验证。
- 留一条人工复核通道。LLM 适合当接口,不适合当最终决策者,把自然语言解析和风险推断分开,审计路径才清楚。
| 阶段 | 该问的问题 | 不合格的信号 |
|---|---|---|
| 选型前 | 评测集的任务定义和我们的业务口径一致吗 | 只有通用医学问答分数 |
| 试点中 | 换成真实报告文本,指标掉多少 | 只在清洗过的数据上测过 |
| 上线前 | 错误类型里有没有高危漏判 | 只报总体准确率 |
| 运行中 | 有没有持续抽样复核和漂移监测 | 上线即结束,无人复看 |
最常见的三个误区
参考资料
- arXiv·大模型×公共卫生 · Threat Amplified, Blame Restrained: LLM-Assisted Media Framing Analysis of the 2026 Bangladesh Measles Outbreak(2026-09-23)
- arXiv·大模型×公共卫生 · A Rubric-Guided Large Language Model Solution for Opioid Use Disorder Computable Phenotyping(2026-09-04)
- arXiv·大模型×公共卫生 · Do LLMs Know Your Neighborhood? Auditing LLM Priors for Neighborhood-Level Mobility Prediction and Structural Alignment(2026-08-31)
- arXiv·大模型×公共卫生 · Generating Biomedical Fact-Checking Reports with RL-Enhanced Agentic Search(2026-08-24)
- arXiv·大模型×公共卫生 · TA-RAG: Tone Awareness as a Design Imperative for Retrieval-Augmented Generation(2026-08-07)
- arXiv·大模型×传染病防控 · The Epi-LLM Framework: probing LLM behavioral priors through epidemiological agent-based models(2026-06-01)
- arXiv·大模型×传染病防控 · Prospective multi-pathogen disease forecasting using autonomous LLM-guided tree search(2026-05-15)
- arXiv·AI×临床检验 · Language Models as Interfaces, Not Oracles: A Hybrid LLM-ML System for Pediatric Appendicitis(2026-06-17)
以上内容基于公开信息整理,仅作行业技术交流,不构成任何诊疗建议,所引数据均可在参考资料中核对。