开云体育数据源来自近 12 万本大学课本-开云·kaiyun体育(中国)官方网站 登录入口

有史领域最大的开源科学推理后历练数据集来了!开云体育
上海创智学院、上海交通大学(GAIR Lab)发布MegaScience。该数据集包含约125 万条问答对过火参考谜底,平常笼罩生物学、化学、计较机科学、经济学、数学、医学、物理学等多个学科领域,旨在为通用东说念主工智能系统的科学推贤达商历练与评估提供坚实的数据。

实考据明,基于 MegaScience 历练的模子在科学推理任务中权贵优于相应的官方 Instruct 模子。此外,MegaScience 展现出精采的可推广性:跟着基础模子领域的莳植,MegaScience 所带来的性能增益愈加权贵。

当今,该团队已竣工开源 MegaScience 过火通盘联系组件,包括数据构建过程源码、科学推理评估系统、数据集实质以及基于该数据集历练的模子,守望为盘问社区提供系统化、高质地的资源复古,进一步鼓励通用东说念主工智能在科学领域的盘问与应用。

△MegaScience 的恢复长度偏低且性能最优,达成了即高效又灵验

为什么需要 MegaScience?
尽管如 o1 和 DeepSeek-R1 等先进推理模子已在数学和编程任务上发扬出接近致使超越东说念主类巨匠的水平,但由于科学推理领域永恒败落大领域高质地的历练数据复古,现时主流模子在科学推理任务中的发扬仍权贵滞后于数学和代码领域。
已有的科学推理后历练数据集还存在一些未惩处的挑战:
不行靠的 Benchmark 评估:好多开源科学基准取舍取舍题样貌,该样貌天然易于达成,却过度简化了科学推理的复杂性。因此,科学领域的后历练数据集不时沿用此样貌,以保持数据散播的一致性。然而,作家的实验标明,历练于此类数据的模子在取舍题评估上发扬优异,但在波及计较任务时发扬显着欠安,反馈出基准评估收尾与真实推贤达商之间存在脱节。
去混浊处理不严谨:现存的去混浊时刻时常依赖于 n-gram 或向量相似度来识别并移除可能的 Benchmark 数据显露。这些样子践诺上较为脆弱,容易被措辞或结构上的眇小变动所逃避,难以确切保证基准评估的平允性。作家发现,大齐已有科学领域的后历练数据集与评估基准之间存在权珍视合。
参考谜底质地低下:好多科学数据聚积的参考谜底开头不行靠,往来往自麇集捏取或由大言语模子径直生成。然而,跟着麇集内容日益被 AI 生成文本充斥,加之 LLM 自己容易产生幻觉,这两种样貌的可靠性不停下落,使得难以确保谜底的事实准确性与科学严谨性。
表层化的常识蒸馏:一种常见作念法是从大型推理模子中蒸馏数据,举例径直取舍 DeepSeek-R1 生成较长的念念维链。尽管该样子直不雅且易于实施,但其践诺上仍停留在表层。所生成的 CoT 数据时时存在"过度念念考"问题,这也在历练(尤其是小模子历练)和推理效率方面带来挑战。这种浅层操作浪漫了常识迁徙的原则性、效率及泛化智商的进一步发展。

为应答上述挑战,MegaScience团队建议了一套系统性的惩处有野心,包括以下四个要津部件:
构建科学推理评估体系:团队滥觞建造了一个面向科学推理任务的评估框架,涵盖 15 个具有代表性的基准测试(Benchmark),题型包括取舍题、计较题、判断题与简答题,笼罩平常任务类型,从而达成对模子科学推贤达商的全面与可靠评估。
基于大模子的数据去混浊处理:针对数据混浊问题,作家对所建议的数据集及所取舍的 baseline 数据集均实施了严格的大模子去混浊过程。实验标明,经过该样子处理后,其他现存开源数据集在疏浚基准下性能显着下落,进一步考据了该去混浊计策在莳植评测简直度方面的灵验性。
高质地数据源构建计策:在数据构造方面,团队以大学阶段的专科教科书算作主要信息开头,系统采集问答内容。比较传统的麇集问答资源,教科书内容具有更高的巨擘性和参考谜底的准确性,为数据质地提供了坚实保险。
优化的数据精粹样貌:不同于以往使用推理模子进行蒸馏的作念法,作家取舍通过聊天模子对初步抽取的数据进行精粹。该样子在莳植数据言语通顺性与问答逻辑一致性的同期,幸免了长推理链样子常见的效率瓶颈问题,从而达成了高质地与高效率的有机结合。
具体来说:
MegaScience 团队滥觞建议了 TextbookReasoning,这是一个面向大学阶段科学推理的开源后历练数据集,包含可靠参考谜底,数据源来自近 12 万本大学课本,共构建了 65 万个涵盖物理、生物、化学、医学、计较机科学、数学和经济学等多个领域的科学推理问题。具体而言,该数据构建过程包括课本数字化、双重问答对抽取、去重、问答对精粹、过滤与基于大模子的去混浊处理。该过程达成了全自动化,借助大言语模子大幅莳植了高质地数据集的可推广获取智商。
为进一步鼓励科学推理标的的开源后历练数据构建,该团队进而建议了 MegaScience,这是一个由高质地开源数据集构成的大领域夹杂数据集,包含 125 万条数据。其滥觞网罗多个公开数据集,并针对不同数据筛选计策进行系统的消融实验,从而为每个数据集筛选出最优子集。此外,除 TextbookReasoning 外,还为所零落据集防备了冉冉的解题过程。
为了复古开源社区在科学推贤达商上的发展,该团队设想并开源了一个笼罩平常学科与多种题型的评估框架,涵盖 15 个代表性 Benchmark。该框架不仅便于复现实验收尾,还通过长入的评测尺度达成模子间的公说念比较。还设想了完善的谜底索求计策,以确保最终评估办法的准确性。
实验标明,所构建数据集不仅达成了高效的历练与推理过程,同期也在科学领域取得了滥觞性能。该团队进一步在 MegaScience 上历练了 Llama3.1、Qwen2.5 与 Qwen3 系列基础模子,其在平均性能上优于官方 Instruct 模子,权贵鼓励了开源社区在科学领域的发展。同期,MegaScience 在更大、更强模子上的效果更为权贵,露馅出其在指示微调时具备精采的推广性上风。该团队将数据构建过程、评估系统、数据集与历练模子一起开源,以复古科学推理盘问的络续发展。
TextbookReasoning 构建过程
该盘问团队建议了一套十足基于大言语模子自动化驱动的数据构建过程,用于构建大领域、具备高质地科学推贤达商的数据集—— TextbookReasoning。该过程从约 12 万本大学及盘问生级别的课本中抽取并精粹生成系数 65 万条问答对,举座过程包含五个阶段:

△TextbookReasoning 数据集构建过程图
1、竹帛网罗与数字化处理
盘问者网罗了系数 12.8 万本涵盖多个科学领域的大学及以表层级课本,并使用 olmOCR 系统对其进行 OCR 处理,调度为结构化文本内容。为严格遵守版权王法,盘问团队结合礼貌匹配和大言语模子时刻对竹帛版权信息进行了全面审查,并剔除了存在版权浪漫的竹帛。此外,该开源数据集均取舍 CC-BY-NC-SA-4.0 许可条约,严格浪漫生意化使用。
2、对偶问答对抽取
盘问者滥觞将每本课本内容按 4096 个 tokens 切分为文档片断,并针对每一学科设想了两种抽取模板:
高尺度抽取:仅保留包含详备推理门径与解释的问答对;
低尺度抽取:保留任何包含明确谜底的问题对。
使用 Llama3.3-70B-Instruct 对通盘文档履行问答抽取,最终赢得 94.5 万条原始问答对。

△每个学科的问答对抽取数目统计
3、问题去重
为了幸免冗余信息,盘问者取舍局部明锐哈希(Locality-Sensitive Hashing, LSH)结合最小哈希(MinHash)时刻,对通盘问题进行语义级别的去重处理。
4、问答对精粹
盘问者使用 DeepSeek-V3 参考原始文档内容,对问答对进行内容精粹,并进一门径用 Llama3.3-70B-Instruct 识别败落念念维链的问题,之后使用 DeepSeek-V3 对其进行补全。此外,为确保数据质地,盘问者再次哄骗 Llama3.3-70B-Instruct 自动过滤存在逻辑矛盾或谜底造作的低质地问答对。
5、基于大模子的问题去混浊处理
为减少与现存评测基准重复带来的历练混浊,盘问者设想了一套大模子驱动的混浊识别机制,过程如下:
a. 关于每个问题,先通过 BGE-large-en-v1.5 履行向量相似度搜索,从 15 个评测系统笼罩的通盘 benchmark 中检索出相似度最高的前 5 个问题;
b. 再使用 Llama3.3-70B-Instruct 对候选问题进行逐个比对,判断是否存在语义高度相似的混浊项;若任一双被判定为重复,则将该问题璀璨为混浊样本并从历练聚积剔除。

MegaScience 构建过程
为进一步促进开源科研推理后历练数据集的发展,作家系统性地整合了多个已有公开数据源,并深远探索了多种数据筛选计策与解题标注样子。最终构建了一个涵盖 125 万个高质地问答对的夹杂数据集MegaScience。该数据集的构建过程包括四个要津门径,确保了数据的万般性、准确性与适用性。

△数据集构建过程
1、公开数据集网罗
作家登科了 NaturalReasoning、Nemotron-Science 以及 TextbookReasoning 三个数据集算作运转语料开头,构建原始数据聚积。
2、问题去重与去混浊
为提高数据质地,作家在 NaturalReasoning 和 Nemotron-Science 数据集上应用了与 TextbookReasoning 疏浚的去重计策,以及基于大言语模子的问题去混浊处理,从而摒除重复项与混浊问题。
3、数据筛选
作家建议了 3 种数据筛选时刻:
(1)基于恢复长度筛选:作家使用 Qwen2.5-72B-Instruct 对问题进行谜底标注,并保留那些生成恢复最长的问题。
(2)基于问题难度筛选:由于高难度问题关于莳植模子推贤达商具有进犯兴味,作家建议了一套两阶段的难度评估与筛选样子:
a. 参考谜底标注:
关于 TextbookReasoning 数据集,作家使用 Llama3.3-70B-Instruct 为每个问题生成高质地的参考谜底;
关于 NaturalReasoning,则径直使用其官方提供的参考谜底;
关于 Nemotron-Science,则从 DeepSeek-R1 的模子输出中的归来段落算作参考谜底。
b. 难度评估:作家取舍 Qwen2.5-7B-Instruct 对每个问题生成 16 个候选恢复,并哄骗 Qwen2.5-32B-Instruct 对这些恢复进行基于参考谜底的 0 – 10 分打分,得分尺度掂量恢复的准确性与竣工性。最终将平均得分算作该问题的难度办法。得分越低代表问题越具挑战性。作家剔除了平均得分高于 9 的过于浅显问题以及低于 1 的高噪声问题。
(3)随即采样筛选:随即取舍问题。

△3 种数据筛选样子在每个数据集上的效果
关于每个数据集,作家滥觞取舍难度取舍样子筛选出 n 个样本,并将恢复长度筛选与随即取舍的样子中所选样本数目也设为 n,以确保公说念对比。随后,作家在 Qwen2.5-7B 模子上进行有监督微调,以选出每个数据集上最优的数据取舍计策。
在 NaturalReasoning 数据集上,随即取舍效果最好;而在 Nemotron-Science 上,难度取舍取得了最优性能。然而,莫得任何一种数据取舍样子大约卓越径直使用竣工 TextbookReasoning 所达到的效果,这标明该数据聚积低质地样本小数。该发现复古作家保留 TextbookReasoning 中一起样本。
4、解题门径标注
关于 TextbookReasoning,作家保留了其精粹后的解答。关于 NaturalReasoning,由于 Llama3.3-70B-Instruct 生成的原始恢复质地较低,作家取舍 DeepSeek-V3 对其进行冉冉解答的标注。关于 Nemotron-Science,DeepSeek-R1 即便靠近相对浅显的问题也会生成过于冗长的恢复,权贵裁汰了推理效率。为应答这一问题,作家雷同使用 DeepSeek-V3 对其进行冉冉解答的标注。随后,他们过滤掉卓越 4096 个 token 的恢复,从数据聚积剔除了约 8 千条样本。

△MegaScience 构建过程数目变化,DC 暗示数据去混浊,DS 暗示数据筛选 MegaScience 评估框架
为莳植评估过程的可靠性、可复现性与公说念性,作家建议了一个开源的科学推理评估框架——Language Model Open Science Evaluation。该框架涵盖了 15 个具有代表性的科学推理基准任务,涵盖多种类型的问题样貌,旨在全面评估言语模子在科学推理方面的智商。

△MegaScience 评估框架所波及 Benchmark 列表
该评估系统有如下特色:
复古 Instruct 模子与 base 模子的评估;
易于集成新的评测基准与建设;
复古多节点与多 GPU 并走运行,达成对多个模子、基准和任务的可推广评估;
提供全面的实例级输出数据,复古对模子预测收尾的细粒度分析。
作家还针对谜底抽取进行了优化,谜底抽取在评估过程中至关进犯,因为抽取的准确性会权贵影响举座收尾。好多科学评估样子仅索求位于 boxed{} 中的内容,不时忽略未取舍该样貌的恢复,并将这些样貌造作造作地归因于准确率的下落。为了莳植抽取精度,作家设想了一套全面的基于礼貌的样子,针对不同类型的问题进行谜底抽取。谜底抽取样子取舍两阶段过程:(1)识别暗示最终谜底存在的请示短语;(2)从各式样貌中索求具体的谜底内容。此外,关于取舍题,要是无法径直抽取选项标签,该系统还会在选项内容中进行匹配,以笃定对应的选项标签。
实验效果

作家滥觞在 Qwen2.5-7B-Base 模子上历练了 TextbookReasoning 与 MegaScience 两个数据集,并将其与现存的科学推理类数据集进行了系统对比。收尾标明,这两个数据集在多个评测办法上均达到了现时开源社区中的最优性能。此外,MegaScience 在科学推理任务上的发扬也超越了 Qwen2.5-7B 官方发布的 Instruct 模子。

为了进一步诠释该数据集的灵验性,作家在 Llama3.1,Qwen2.5,Qwen3 系列基座模子上取舍 MegaScience 进行了微调,与其官方版 instruct 模子进行了对比,得出了以下道理的论断:
禁锢科学领域的性能瓶颈:在历练中引入 MegaScience 权贵莳植了不同模子家眷和领域下的性能。经过 MegaScience 历练的 Qwen2.5-7B、一起 Qwen3 系列模子以及 Llama3.1-8B,在平均性能上均大幅超越其官方 Instruct 版块。这种在多种基础模子上的平常莳植标明,MegaScience 大约灵验鼓励科学领域性能的前沿发展。
更大更强模子的可推广性上风:MegaScience 关于更大领域和更强智商的模子展现出更权贵的效果,标明 MegaScience 指示微调在模子推广性上具有潜在上风。在 Qwen2.5 系列中,产生了非单调变化趋势:尽管 Qwen2.5-1.5B-Instruct 相较于 Qwen2.5-1.5B-MegaScience 逾越 2.99%,但这一差距在 3B 模子上权贵收缩至仅 0.15%,而在 Qwen2.5-7B 上则发生回转,MegaScience 版块相较于 instruct 版块达成了 2.21% 的莳植。此外,性能更优的 Qwen3 系列在通盘领域下,MegaScience 版块均超越官方 Instruct 模子,且性能差距跟着模子领域的加多而缓缓扩大。
数学推贤达商依赖于模子容量:作家发现数学智商的莳植尤为依赖于填塞的基座模子智商,惟有在更强的基础模子(如 Qwen2.5-7B 和 Qwen3-8B)中,MegaScience 在数学推理任务上才智超越官方指示微调模子。作家估量,这一取舍性莳植源于其数据聚积数学题目的高难度特征,其中好多问题波及大学本科及以上水平的专科数学观点。这类复杂的数学推理任务似乎条件模子具备一定的智商门槛,方能从该类具有挑战性的历练数据中灵验学习并受益。
将来瞻望
尽管现时使命东要聚焦于有监督微调,但尚未波及基于强化学习的科学推理盘问。值得一提的是,MegaScience 提供了高质地且可靠的参考谜底,这些谜底可算作强化学习框架中生成精准奖励信号的监督依据。这一秉性为社区提供了精采的盘问基础,激励进一步探索强化学习在科学推理任务中的后劲,看其是否能在已有有监督历练收尾的基础上进一步莳植模子的推贤达商。
该数据集取舍了短念念维链。一个颇具出息的盘问标的是,在此基础上引入强化学习,进一步学习更复杂、篇幅更长的推理链条,并探索该计策是否能以更高效的样貌超越传统中间历练阶段所得模子的性能发扬。若盘问标明这一标的可行,将为强化学习在言语模子中的推广提供新的机会,也阐述基于 MegaScience 的有监督微调可成为中间历练的高效替代旅途。
鉴于计较资源的浪漫,作家当今尚未开展对链式推理压缩计策的系统盘问。将来可进一步接洽,是否将较长的 CoT 推理压缩为更为圣洁的样貌,大约在与 MegaScience 荒谬的响应长度下赢得更优的性能发扬。
论文标题:MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning
论文伙同:https://arxiv.org/abs/2507.16812
开源数据集 & 模子:https://huggingface.co/MegaScience
数据处理代码:https://github.com/GAIR-NLP/MegaScience
评估系统代码:https://github.com/GAIR-NLP/lm-open-science-evaluation
一键三连「点赞」「转发」「小心心」
迎接在辩驳区留住你的想法!
— 完 —
� � 点亮星标 � �
科技前沿进展逐日见开云体育
