THUCNews是清华大学自然语言处理与社会人文计算实验室整理发布的中文新闻文本分类数据集[1][2]。它基于新浪新闻 RSS 订阅频道 2005 年至 2011 年的历史数据筛选过滤生成,共收录约 74 万篇新闻文档,总量约 2.19 GB,均以 UTF-8 纯文本格式存储[3][1]。原始数据集在参考新浪新闻原有分类体系的基础上,重新划分出 14 个候选类别[1][4]。该数据集常用于中文文本分类模型的训练与评测[5][6]。
定义
THUCNews是一个面向中文新闻文本分类任务的大规模语料数据集,由清华大学自然语言处理与社会人文计算实验室公开[1][2]。其语料取自新浪新闻 RSS 订阅频道在 2005 年至 2011 年间积累的历史数据,经筛选与过滤后形成[5][1]。数据集收录约 74 万篇新闻文档,总规模约 2.19 GB,全部为 UTF-8 纯文本格式[3][1][7]。在类别设置上,整理方在参考新浪新闻原有分类体系的基础上重新整合,划分出 14 个候选类别,其中包含财经、科技、彩票、房产等类型[1][4]。
背景
中文文本分类研究需要具有一定规模、带有类别标注的真实语料作为实验基础。THUCNews 的语料来自新浪新闻 RSS 订阅频道在 2005 年至 2011 年间发布的新闻内容[5][3]。相关文献指出,该数据集主要面向分类实验的需要,可供多分类任务使用[1][6]。由于新闻标题篇幅短、信息集中,部分研究把新闻标题而非全文当作小批量短文本数据场景的模拟对象,以此开展实验[4]。
内容
THUCNews 的类别数量在不同文献中表述有别,大致可归为原始版本与抽样版本两类。按整理方公开的原始版本,数据集包含 14 个候选类别[1][7][2]。而实验中广泛使用的版本是从中抽取 10 个类别、每类 2 万条,形成总量 20 万条的均衡子集,涉及的类别常包括体育、财经、房产、家居、教育、科技、时尚、时政、游戏和娱乐[3][8],也有文献直接记为该数据集共 10 个类别、每类 2 万条数据[9]。
此外还存在进一步加工的版本。有研究对原始数据做清洗与重新整合,划分出财经、股票、科技、社会、时政、娱乐 6 个候选类别,每类约 1 万条,平均长度约 20[10]。在文本长度方面,从该数据集抽取的新闻标题长度多集中在 20 至 30 个字符之间[8]。全部文本均以 UTF-8 编码保存,可直接用于模型训练与测试[3][1]。
影响与争议
THUCNews 常被中文文本分类研究选作实验语料。有研究在短文本分类任务中把该数据集列为公开数据集之一并加以使用[5]。在跨语种文本研究中,它与新华网、国际文传电讯社、法文门户网站 Linternaute 以及西班牙至上报 Excélsior 的语料被合并,构成包含 1610 篇文本、覆盖 4 种语言的二分类数据集[11]。另有文献以该数据集的新闻标题模拟小批量短文本场景,样本量为 381 条[4]。
在使用方式上,各研究对类别数量的不同表述,主要来自选用原始版本还是抽取子集的区别:原始版本为 14 个候选类别[1][7][2],均衡子集版本多为 10 个类别、每类 2 万条[3][9],清洗后的版本也有 6 个类别、每类约 1 万条的划分[10]。
参见
参考资料
- 解锁文本情感:中文数据集在情感分析中的实践应用 . 百度智能云 [引用日期2026-09-27]
- ting202303141608386 . OpenI - 启智AI开源社区提供普惠算力! [引用日期2026-09-27]
- \[s(i) = \frac{b(i) - a(i)}{\max \{a(i),b(i)\}} \quad (10)\] . nuaa.edu.cn [引用日期2026-09-27]
- acm.org 上的网页 . acm.org [引用日期2026-09-27]
- | sports | 7 | 20,000 | . ieee.org [引用日期2026-09-27]
- rjdk.org.cn 上的 PDF 文件 . rjdk.org.cn [引用日期2026-09-27]
- of BiLSTM at time t . acm.org [引用日期2026-09-27]
- NLP实战三:Pytorch实现FastText文本分类 . Tencent [引用日期2026-09-27]
- tandfonline.com 上的网页 . tandfonline.com [引用日期2026-09-27]
- preview(PDF) . cnki.net [引用日期2026-09-27]
- napstic.cn 上的网页 . napstic.cn [引用日期2026-09-27]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-27T14:58:40Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。