长文本推理数据集

本数据集面向当前大语言模型在长文本理解与复杂推理任务中的核心能力短板,系统构建了涵盖中文、英语、韩语三语种、总量7500条的高质量训练数据。每条数据均以长文本(context)为基础,设计需要跨段落、跨文档信息融合与多跳逻辑推理的问题,旨在为模型的长文本感知、信息检索、推理链构建与证据溯源能力提供全面、严谨的评估基准。

数据规格

数据内容
长文本多跳问答推理数据集
数据量
7,500条
数据字段
id、context、file_count、question、answer、reasoning_chain、supporting_evidence、hops
语言
中、英、韩
存储格式
JSON