网络舆情分析是围绕互联网上公众表达的信念、态度、意见与情绪展开的信息采集、加工和研判活动,属于网络安全中内容安全方向的一项实践[1]。它通常借助网络爬虫、中文分词、自然语言处理与情感计算等技术,从新闻、论坛、博客、微博等渠道获取并处理数据,为政府、企业等主体的监测、预警与决策提供依据[2][3]。随着社交平台成为舆论主渠道,这一领域逐渐被视为网络安全与信息安全专业的教学和研究方向之一[4]。
定义
网络舆情分析是针对互联网上的舆情进行思维加工和分析研究、进而得出相关结论的过程[1]。其分析对象是网络舆情,也就是公众通过互联网表达和传播的、对自身关心或与自身利益相关的公共事务所持有的多种情绪、态度和意见交错的总和。与之相近的另一个概念是网络舆情研判,指对网络舆情进行定性和定量研究并对趋势作出判断,本身含有在舆论发生之前预先评估、预测的意味[5]。
在学科归属上,有研究认为网络舆情相关工作实质上是一种维护内容安全的实践,因此可以归入网络安全的研究范畴,其重点在于挖掘、评估和处置舆情风险[1]。部分高校已开设相关课程与教材,把网络舆情信息的搜集、分析、编报和舆论引导等内容纳入信息安全、网络安全与执法、新闻传播等专业的教学体系[4][6]。
原理
网络舆情分析的一般流程可分为信息采集、数据预处理、分析与研判、结果呈现几个环节[7]。采集环节依靠网络爬虫等技术完成,分为主动获取和被动获取两类:前者通过向网络注入数据包后的反馈取得信息,接入方式简单、覆盖面较广,但会给网络带来额外负荷;后者在网络出口以镜像或旁路侦听的方式取数,需要网络管理者的配合,获取范围限于进出本地网络的数据流,不会产生额外流量[1]。
预处理环节通常先清除特殊字符、表情符号和网址等噪声,再借助停用词表与分词工具切分文本,把非结构化的内容整理为可供计算的数据[8]。
分析环节是技术含量最高的部分,情感计算与主题挖掘是两条主要技术路线。情感倾向常由情感词典或机器学习模型给出,一种常见做法是对文本中各情感词按极性取正负值,再乘以程度副词的权重后加权求和,最后把得分归入消极、中性、积极区间。主题挖掘多采用潜在狄利克雷分配(LDA)等概率模型,把大量文本聚成若干主题,再由人工为每个主题赋予现实含义[8][9]。
此外还有社会网络分析的方法,通过提及、转发等互动关系计算点度中心性等指标,识别在信息扩散中起关键作用的用户与紧密连接的社群。行业实践中常用 $y=f(x_1,x_2,\dots,x_n)$ 一类的加权指标模型来量化舆情热度,其中转发量、评论量、点赞量等构成基础指标[10]。
发展历程
2004 年,中共中央提出建立舆情汇集和分析机制、畅通社情民意反映渠道,此后网络舆情相关工作在国内发展较快,但学科性质长期未得到充分界定[1]。
2009 年前后,随着网民规模持续扩大,网络论坛、博客等成为公众表达观点和释放情绪的平台,网络舆论的形成与影响开始受到关注,围绕网络舆论危机应急管理的研究随之展开。
2016 年前后,有研究者提出网络安全视角下的网络舆情研究框架,把相关工作归纳为舆情风险的挖掘、评估与处置,并认为网络舆情可以成为网络安全的一个研究方向[1]。同一时期,态势感知等安全概念被引入舆情领域,形成舆情态势感知的思路,强调在监测之外加强对趋势的预测[11]。
2020 年代以来,相关研究转向基于大数据和深度学习的分析系统,分布式爬虫、自然语言处理和分布式存储被组合使用,以应对海量舆情数据的采集、分析与展示需求[12][3]。情感分析与主题挖掘相结合的分析框架也逐渐成为常见做法,用以刻画舆情规模、情感演变和热点主题[9]。
应用
在社会治理与应急管理领域,网络舆情分析用于掌握舆论动态、发现苗头性信息并判断事件走势,帮助相关部门在突发事件中作出决策[5]。有研究提出建立突发信息安全事件网络舆情的情感—主题协同演化模型,以识别舆情生命周期各阶段公众的情感倾向与关注主题。
在校园、城市综合治理等场景中,舆情分析被用于对新闻、论坛、微博等渠道的信息进行实时采集和内容提取,对判定为敏感或应急性质的事件进行跟踪,并生成舆情报告[13][14]。
在企业与行业层面,舆情分析系统常被用于品牌与产品的口碑观察,通过声量计算、褒贬分析和热点聚类,输出传播走势、媒体分布和地区分布等维度的分析结果,并对未来情况作出概率性预测[10]。
在网络安全领域,网络舆情事件数据与网络入侵事件数据、工控系统威胁事件数据一并被纳入安全态势感知系统的采集范围,与其他安全信息融合后进行可视化呈现[13]。
局限
情感计算对语言形式的处理能力有限,反讽、反串、方言、玩梗和行业黑话都可能造成误判。有研究发现,若仅依据文本字段,模型容易把反语或反串内容标注为正向或中立,因此除了文本本身,还需要考虑发布者的社会与政治位置等文本之外的线索[15]。相关实验也显示,大量误判来自反讽与语境歧义。
模型的判断质量受训练数据制约。以西方英语语料为主训练的情感分析模型,容易误读非西方语言或方言所表达的情绪,在部分英语变体上的表现明显低于标准语料[16]。多模态内容检测研究同样指出,模型对文化特定表达和语言线索的把握不足,并倾向于高估有害内容[17]。
数据代表性是另一重限制。社交平台的用户结构相对偏向年轻、城市和高学历群体,其言论中的极化程度也可能高于社会总体,因此平台数据不宜直接外推为整体公众态度[18]。有实践观察也指出,不同平台的评论情绪表现差异较大,各平台的分数不能简单相加,报告需要说明数据来源。
舆情采集与分析还涉及隐私与伦理问题,数字社交研究领域至今缺少公认的伦理规范,知情同意、信息风险管理和隐私保护都需要在方法设计中加以考虑[18]。此外,收集方法本身也有约束:委托专业机构监测可以得到更系统的结果,而自行监测在人员专业背景和数据覆盖面上往往有限[1]。
参见
参考资料
- 网络舆情的网络安全思考 . crggcn.com [引用日期2026-10-04]
- 智能时代的网络舆情分析技术应用-微型电脑应用2023年12期-知网阅读 . cnki.net [引用日期2026-10-04]
- 基于大数据技术网络舆情分析系统 . pku.edu.cn [引用日期2026-10-04]
- 清华大学出版社--图书详情 . tsinghua.edu.cn [引用日期2026-10-04]
- 社会建设 . ccps.gov.cn [引用日期2026-10-04]
- 四、考核内容及要求 . sandau.edu.cn [引用日期2026-10-04]
- 舆情分析 . baidu.com [引用日期2026-10-04]
- [0047] 需要注意的是,这里所使用的术语仅是为了描述具体实施方式,而非意图限制根据本发明的示例性实施方式 . googleapis.com [引用日期2026-10-04]
- 基于情感分类和主题挖掘的网络舆情文本分析 . pku.edu.cn [引用日期2026-10-04]
- CN111461553A(PDF) . googleapis.com [引用日期2026-10-04]
- 从网络舆情监测到全舆论场舆情态势感知-授权发布版(PDF) . nlpir.org [引用日期2026-10-04]
- 基于大数据技术的网络舆情感知系统的分析与实现-南阳理工学院学报2023年04期-知网阅读 . cnki.net [引用日期2026-10-04]
- CN107958322B(PDF) . googleapis.com [引用日期2026-10-04]
- google.com 上的网页 . google.com [引用日期2026-10-04]
- 本研究發現,若僅聚焦 text/message 欄位,模型很容易將反語或反串文標註為正向 . aclanthology.org [引用日期2026-10-04]
- content . ihu.gr [引用日期2026-10-04]
- cnpereading.com 上的文件 . cnpereading.com [引用日期2026-10-04]
- North_THESIS_14_Jan2024_FINAL_(PDF) . bath.ac.uk [引用日期2026-10-04]
浏览次数:1 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-10-03T18:06:26Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。