详情

首页手游攻略 从“能检索”到“能训练”:我为科研文献工作流做了两个 Codex Skill

从“能检索”到“能训练”:我为科研文献工作流做了两个 Codex Skill

佚名 2026-08-03 16:29:03

科研文献工作流混乱?作者开发两个Codex Skill,让文献可溯源、训练数据有边界,解决科研证据与数据合规难题。
核心内容:
1. 科研文献管理的核心痛点(资料分散、证据溯源难、训练数据边界问题)
2. 两个Codex Skill的功能与定位(文献RAG解决证据管理,训练数据构建解决数据合规)
3. 目标用户及需求(科研人员、专业团队、开发者的具体场景需求)

副标题:让文献有出处,让训练数据有边界

做科研时,我经常面对一种熟悉的混乱:

硬盘里散落着 PubMed 导出、论文摘要、PDF、Markdown 笔记和审稿资料;需要写文章时,我想快速找到证据;需要构建科研助手时,我又想把这些资料做成本地知识库,甚至进一步整理成领域模型的训练数据。

工具其实不少。PDF 可以解析,向量库可以检索,大模型也可以生成问答。

但真正让我不放心的,并不是“AI 能不能生成”,而是下面这些问题:

• 这段话究竟来自哪篇论文、哪个版本、哪一页?

• 预印本和正式发表版本是否被重复收录?

• RAG 检索到了一段文字,是否真的支持我准备写出的结论?

• 同一篇论文生成的多个问答,会不会分别进入训练集和测试集?

• 摘要、全文和人工标注究竟获准用于内部训练,还是也可以公开发布?

• AI 生成的科学标签由谁复核?审核者意见不一致时,原始判断是否还被保留?

我逐渐意识到:科研文献进入 AI 系统,缺少的往往不是另一个“生成按钮”,而是一条可追溯、可验证、可复现的数据链路。

为此,我开发了两个可以配合使用的 Codex Skill:

• DataFlow Literature RAG Skill

https://github.com/Liangshuntao/codex-dataflow-literature-rag-skill

• DataFlow Training Data Builder Skill

https://github.com/Liangshuntao/codex-dataflow-build-training-data-skill

它们分别负责两个容易被混在一起、但实际上完全不同的问题:

Literature RAG 管“证据”,Training Data Builder 管“训练样本”。

谁会真正需要这两个 Skill?

它们并不是只为专业 AI 工程师准备的。

1. 管理大量论文的科研人员和研究生

你可能正在写综述、准备基金、修改论文,或者回复审稿意见。资料越来越多,但证据仍然依赖手工复制和记忆。

你需要的不是“帮我总结一篇论文”,而是:

• 长期维护一批文献;

• 保留每条结论对应的 PMID、DOI、页码和原始文件;

• 区分预印本、正式发表版和重复记录;

• 在需要引用时能够重新找到原始证据。

2. 生物医学、药学等专业研究团队

专业领域的数据不能只追求数量。错误的证据等级、过度外推的结论以及来源不明的训练样本,都会让后续结果看似漂亮、实际不可用。

这些团队需要:

• 明确科学主张与证据片段;

• 区分直接功能证据、相关性证据和综述性证据;

• 保留独立审核和人工裁决记录;

• 控制未完成授权或科学复核的数据进入下一阶段。

3. 构建本地 RAG 或机构知识库的开发者

向量数据库“能返回内容”,不代表知识库已经可靠。

开发者还需要回答:

• 文本块能否追溯到原始文档?

• 更新索引后,文档和文本块 ID 是否仍然稳定?

• 检索效果有没有独立问题集,而不是只用论文标题自测?

• 检索命中是否被错误当作科学结论?

4. 准备领域模型数据的 LLM 数据工程师

将文献生成问答只是开始。真正困难的是:

• 如何定义训练样本的数据契约;

• 如何保留样本与原始文献的关系;

• 如何避免同源样本跨集合泄漏;

• 如何管理生成、审核、拒绝和裁决;

• 如何发布一个可以复现的数据集版本。

第一个 Skill:把散乱文献变成可追溯的证据库

DataFlow Literature RAG Skill

项目地址:

https://github.com/Liangshuntao/codex-dataflow-literature-rag-skill

它处理的是文献与检索层:

• 盘点 PubMed CSV/XML、PDF、Markdown、SOP 和研究笔记;

• 清洗、标准化和去重;

• 为文档与文本块建立稳定的 doc_id 和 chunk_id;

• 保留 PMID、DOI、页码、来源文件、检索式和文件哈希;

• 指导文档分块、向量索引、混合检索和本地 RAG;

• 使用 Hit@k、MRR 等指标评估检索效果;

• 将检索结果重新追溯到确切原文。

这个 Skill 最重要的规则是:

检索命中只是候选证据,不等于科学结论已经成立。

如果 RAG 找到一段提到“脂肪微环境”和“免疫调节”的摘要,它并不能自动证明“某个脂肪基质细胞亚群直接诱导 CD4⁺ T 细胞无反应”。

从“内容相关”到“可以支持这句话”,中间仍然需要证据等级判断、原文核对和科学审核。

因此,这个 Skill 的目标不是让模型回答得更大胆,而是让证据边界更清楚。

第二个 Skill:把获准使用的资料变成可审计训练数据

DataFlow Training Data Builder Skill

项目地址:

https://github.com/Liangshuntao/codex-dataflow-build-training-data-skill

它处理的是训练数据层,适用于:

• 预训练文本;

• SFT/指令数据;

• 多轮对话数据;

• Preference/DPO 数据;

• 科学问答和推理数据;

• 领域适应数据;

• Trainer-ready JSONL 发布。

它会要求先定义数据契约,包括:

• 模型需要学会什么行为;

• 一条训练样本的基本单位是什么;

• 输入和输出包含哪些字段;

• 来源、许可、隐私和审核状态如何记录;

• 哪些样本可以接受,哪些必须拒绝;

• train、validation 和 test 按什么单位切分;

• 最后交给训练框架的格式是什么。

随后再进入生成、筛选和审核:

• 生成或转换训练样本;

• 保留生成模型、审核者和拒绝原因;

• 进行独立盲审和版本化裁决;

• 按来源组切分数据;

• 检查重复文本和跨集合泄漏;

• 生成数据卡、manifest 和 SHA-256 校验值;

• 冻结一个不可静默修改的数据集版本。

这个 Skill 不负责选择 GPU、学习率、LoRA 参数或训练框架。

它的终点不是模型权重,而是:

一个来源清楚、分组正确、经过审核并可以交给训练流程的数据集发布包。

两个 Skill 如何联合使用?

标准流程可以概括为:

text

PubMed / PDF / 摘要 / 研究笔记

DataFlow Literature RAG Skill

盘点 → 清洗 → 去重 → 分块 → 来源验证 → 检索评估

冻结的 literature-to-training handoff

科学审核、许可证和用途确认

DataFlow Training Data Builder Skill

定义契约 → 生成样本 → 独立审核 → 裁决

→ 分组切分 → 泄漏审计 → 数据集发布

独立的 LoRA / QLoRA / 模型训练流程

两个 Skill 之间不是随手复制一列文本,而是通过正式的 handoff schema 交接。

交接记录会保留:

• corpus_version

• doc_id

• chunk_id

• source_group_id

• 原始文本和证据片段

• PMID、DOI、来源文件和来源哈希

• 许可证审核状态

• 允许的使用范围

• 隐私分类

• 科学审核状态

校验器会阻止以下记录进入训练数据阶段:

• 来源无法追溯;

• 预期用途不在许可范围内;

• 科学审核尚未通过;

• 同一文献对应多个来源哈希;

• 同一文献被错误分配到多个来源组;

• “有条件许可”却没有记录具体条件。

为什么一定要按“原始文献”分组切分?

这是文献训练数据最容易忽略的问题之一。

假设一篇论文生成了 20 条问答。如果直接随机切分,其中 16 条可能进入训练集,另外 4 条进入测试集。

测试问题虽然没有逐字出现在训练集中,但模型已经见过同一篇论文的内容、结论和表达方式。最后得到的测试成绩,很可能高估模型面对真正新文献时的能力。

因此,这套工作流要求:

同一篇论文产生的文本块、问题、回答、改写和负样本,必须共享同一个 source_group_id,并留在同一个数据集合中。

如果多个文档属于同一病例、同一对话、同一题目家族或同一研究项目,还应该使用更严格的家族级分组。

典型使用场景

场景一:建立个人或课题组的文献助手

把 PubMed 导出、PDF 和研究笔记整理成本地知识库,检索结果保留 DOI、PMID、页码与原文件。

这时主要使用 Literature RAG Skill,不一定需要进入训练数据阶段。

场景二:为论文写作建立 claim–evidence ledger

针对 Introduction、Discussion 或审稿意见,将每条科学主张与证据片段、证据等级和允许措辞关联起来。

它可以帮助研究者识别:

• 哪些文献只能作为背景支持;

• 哪些文献具有直接功能证据;

• 哪些结论仍属于相关性或假说;

• 哪些措辞超出了摘要或实验能够支持的范围。

场景三:从文献构建专业 SFT 问答

先在 Literature RAG Skill 中完成来源、版本和权限治理,再将获准使用的文献快照交给 Training Data Builder。

随后完成:

• 问答生成;

• 证据片段绑定;

• 独立审核;

• 人工裁决;

• 来源组切分;

• 泄漏审计;

• 数据集发布。

场景四:构建机构内部的专业知识助手

对于不能上传到公共云端的 SOP、内部文档和研究资料,可以在明确隐私与网络边界后建立本地语料库。

只有经过用途批准的内容,才进入内部训练数据阶段;允许检索并不自动等于允许训练或重新发布。

场景五:微调模型后继续保留 RAG

微调和 RAG 并不是二选一。

• 微调适合学习稳定的回答方式、格式和领域判断规则;

• RAG 适合提供不断更新的论文、精确引用和正式发表状态。

即使完成领域微调,仍然应该保留文献 RAG,避免把容易变化的事实完全固化在模型权重中。

可以怎样开始使用?

建立文献库

text

使用 dataflow-literature-rag,把这些 PubMed CSV 和 PDF

建成一个可追溯的本地检索语料库。

审计已有 RAG

text

检查这个文献 RAG 是否缺少 PMID、DOI、页码、来源哈希,

并使用独立证据问题评估检索效果。

联合构建训练数据

text

把这批文献建立成可追溯语料库,

完成来源、许可和科学审核后,

交接给 dataflow-build-training-data,

生成内部训练用 SFT 数据。

发布冻结版本

text

按原始文献进行来源组切分,

检查 train、validation 和 test 之间的来源与文本泄漏,

生成数据卡、manifest、校验值和 trainer handoff。

它们不能替代什么?

为了避免误解,这两个 Skill 都有明确边界:

• 它们不能代替机构法务或数据授权人员作出许可决定;

• 检索器不能代替科学专家判断证据是否支持某个结论;

• AI 审核不能完全代替关键科学数据的人工复核;

• Training Data Builder 不负责运行 LoRA/QLoRA;

• 两个 Skill 都不用于分析 Seurat、Scanpy 等原始组学对象。

它们做的是把流程中的来源、判断、权限、版本和质量检查显式化,而不是承诺“一键得到正确模型”。

写在最后

现在很多 AI 项目都在追求更大的模型、更多的数据和更复杂的 Agent。

但在科研场景中,我更关心几个朴素的问题:

• 证据从哪里来?

• 这句话究竟能不能这样写?

• 这份资料是否允许这样使用?

• 数据集是怎样生成和审核的?

• 测试结果是否被同源数据泄漏夸大?

• 半年以后,我们还能不能复现今天的数据版本?

这两个 Skill 的目标,就是把这些问题纳入日常 Codex 工作流。

一个让文献“找得到、追得回”,一个让训练数据“能训练、可审核”。

如果你也在构建科研文献库、领域 RAG 或专业训练数据,欢迎试用并提出反馈。

• DataFlow Literature RAG Skill

https://github.com/Liangshuntao/codex-dataflow-literature-rag-skill

• DataFlow Training Data Builder Skill

https://github.com/Liangshuntao/codex-dataflow-build-training-data-skill

这两个项目是独立社区项目,并非 OpenDCAI/DataFlow 或 OpenAI 官方项目。

登录查看剩余 70% 内容

点击查看更多
推荐专题
热门阅读