关于大数据环境下网络舆情分析方法探析
随着大数据时代的到来,我们要不断改进舆情的分析方法,将大数据思维及方法运用到网络舆情分析中去。首先要开始关注大数据分析,其次不再仅仅依靠语义分析,而是求诸于自动化的数据分析,再次要关联不同领域数据进行舆情分析,等等。总之,我們要突破传统,将舆情分析向大数据分析的方向创新。
标签: 网络舆情;大数据;舆情分析方法
如何对网络舆情加以有效的监督和引导,积极化解网络危机,使和谐的互联网环境为维护社会稳定、促进国家发展、构建社会主义和谐社会发挥重要作用,不仅具有重要的现实意义,也已经成为网络舆情工作面临的一个重要课题。基于上述分析,我们认为网络舆情数据越来越呈现出大数据特征。
1 问题与挑战
大数据环境下的网络舆情分析和挖掘方法具有如下挑战:
1.1 为了得到更准确的舆情信息,所需要的数据量大幅膨胀。随着数据生成的自动化以及数据生成速度的加快,自媒体时代的到来,为了获得准确的网络舆情信息需要处理的数据量急剧膨胀。一种处理大数据的方法是使用采样技术,通过采样,把数据规模变小,以便利用现有的技术进行数据管理和分析。
1.2 数据深度分析需求的增长。为了从数据中得到准确的舆情信息进而指导人们的决策,必须对大数据进行深入的分析,这些复杂的分析必须依赖于复杂的分析模型。所以对网络舆情信息的分析还需要路径分析、时间序列分析、图分析、What-if分析等。
1.3 自动化和可视化分析需求的出现。在TB级的复杂舆情信息环境下,网络舆情系统应该能根据网站的内容自动构造查询,自动提供热点推荐,自动分析数据的价值并决定是否需要保存。
2 大数据技术的主要进展
针对传统分析技术的局限性,研究者提出了一些试验性的解决方法和途径。R是开源的统计分析软件,IBM公司研究人员致力于对R和Hadoop进行深度集成,把計算推向数据并且并行处理,使Hadoop获得强大的深度分析能力,为应用开发者提供了丰富的数据分析功能。
针对频繁模式挖掘、分类和聚类等传统的舆情分析方法,研究人员也提出了相应的大数据解决方案。如,Iris Miliaraki等人提出了一种可扩展的在MapReduce框架下进行频繁序列模式挖据的算法,Alina Ene等人用MapReduce 实现了大规模数据下的K-center 和 k-median聚类方法,Kai-wei chang 等人提出了针对线
性分类模型的大数据分类方法。U kang等人使用“BP算法”处理大规模图数据发掘异常模式。Jayanta Mondal等人提出了一个基于内存的分布式数据管理系统来管理大规模动态变化的图以支持低延迟的查询处理方法。Shengqi Yang等人对基于集群上的大规模图数据管理和局部图的访问特征进行研究,为了在图查询处理中减少机器间通讯,提出来分布式图数据环境。Jiewen Huang等人提出了一个多节点的可扩展RDF数据管理系统,比目前系统的效率高出3个数量级。
3 网络舆情分析发展方向
3.1 实现更加复杂和更大规模的分析和挖掘是网络舆情分析未来发展的必然趋势。在大数据新型计算模式上实现更加复杂和更大规模的分析和挖掘是网络舆情分析未来发展的必然趋势,需要进行更细粒度的仿真、时间序列分析、大规模图分析和大规模社会计算等。
这些舆情主体间频繁联系、相互影响,在这个过程中涌现出一些大V,他们左右着其他主体的方向,最终影响整个场。同时,关注点相似的舆情主体间也自觉或不自觉地形成了一些联系相对紧密的子群体,在子群体中信息传播速度更快。要管理和引导网络舆情,就必须对网络舆情主体和子群体进行研究,而社会网络分析方法就是有效的手段。
3.2 网络舆情信息的实时分析和挖掘。面对海量数据,分析和挖掘的效率成为网络舆情分析领域的巨大挑战。尽管可以利用大规模集群并行计算,但在数10TB以上的数据规模上,分析和发掘的实时性受到了严峻的挑战,而查询和分析的实时处理能力,对于舆情运用个体来说及时获得决策信息,做出有效应对是非常关键的前提。
3.3 关联不同领域数据进行舆情分析,非结构化大数据处理分析成为难点和重点。网络上的信息是千千万万的人随机产生的,从事网络舆情研究要从这些看似杂乱无章的数据中寻找有价值的信息。网络大数据有许多不同于自然科学数据的特点,包括多源异构、交互性、失效性、社会性、突发性和高噪音等,不但非结构化数据多,而且数据的实时性强,大量数据都是随机动态产生。网络数据的采集相对科学数据的采集成本较低,网上许多数据是重复的或者没有价值的,价值密度低。一般来说,网络舆情的数据分析及预测,比科学实验的数据分析更困难。所以我们不要一味的追求获取越来越多的数据,而是数据的去冗分类,去粗取精,从数据中挖掘有用信息,减少不必要的数据采集。
3.4 词汇理解的复杂性研究。既考虑词汇的情感倾向性,又权衡语义模式对评论的情感倾向值的影响,能比较全面地分析突发事件网络舆情的态势。但是词典的构建与语义模式的建设需要人工参与,个人的主观性影响比较大,机器学习的能力不强,准确度不高。另外,由于网络语言表达的灵活性,技术的发展速度跟不上社会话语变迁的复杂性。在国内的网络语境中,谐音、暗语是常用的表现手法,借古讽今、借外讽内是常用的叙事手段,隐喻、借代是常见的修辞。现有技术还不能完全准确地判定句子的情感倾向性,机器对词汇的理解能力需要进一步研究。
4 结束语
本文介绍了大数据环境下,网络舆情分析所面临的挑战以及当前大数据技术的主要进展。并建议不断改进网络舆情的分析方法,将大数据思维及方法运用到网络舆情分析中去,最后本文展望了大数据时代网络舆情分析的发展方向。
参考文献
[1]刘焕成.网站化解网络舆情事件的能力研究.知识学习与管理,2016(145),124-129.
[2]王进等.基于政务需求的互联网舆情监测分析研究.电子政务,2016(117),61-76.
因篇幅问题不能全部显示,请点此查看更多更全内容
Copyright © 2019- efsc.cn 版权所有 赣ICP备2024042792号-1
违法及侵权请联系:TEL:199 1889 7713 E-MAIL:2724546146@qq.com
本站由北京市万商天勤律师事务所王兴未律师提供法律服务