|
|
|
题名
|
作者
|
年代
|
出处
|
被引量
|
| 1 | 一种基于特征演变的新闻话题演化挖掘方法显示文摘话题演化挖掘研究可以准确完整地获取新闻话题动态演化各个阶段的话题内容,帮助用户理解新闻话题的来龙去脉以及话题内容之间的相关性和差异性,因此在网络新闻检索、网络舆情监控、互联网突发事件检测与应急管理等方面具有十分重要的作用和应用前景.现有工作由于缺乏对话题特征随时间发展而动态演变的深入分析,仅仅采用均值泛化的思想去增量扩充演化中的话题特征,引入大量话题无关信息,影响了话题关联的准确率,从而导致最终话题演化挖掘结果的偏斜.因此,针对以上问题,文中通过引入话题特征演变特性,提出一种针对话题演化的特征计算模型,在此基础上利用已有话题相关文档和最新文档进行话题信息动态增量扩充,通过对话题特征进行正向融合以及逆向过滤完成对特征信息的抗噪处理,提高话题关联的正确率,有效地解决了话题演化的偏斜问题. | 赵旭剑 杨春明 李波 张晖 金培权 岳丽华 戴文锴 | 2014 | 计算机学报2014,37,4: | 23 |
| 2 | 面向社交媒体文本的话题检测与追踪技术研究综述显示文摘以微博、论坛等为代表的社交媒体已逐渐发展成为网络用户表达和交流观点、获取和传播信息的重要平台.然而,社交媒体文本内容具有的规模庞大、形式多样、传播迅速等特点,对传统的应用在新闻报道、舆情监控、文本挖掘、信息咨询等方面的话题检测与追踪技术提出了新的要求.针对这一背景,本文分别从离线话题检测、在线话题检测和话题演化追踪这三个方面总结当前主要的话题检测与追踪方法,分析在该领域实验中被普遍使用的评估方式,最后提出当前面临的挑战和今后的研究方向. | 彭敏 官宸宇 朱佳晖 谢倩倩 黄佳佳 黄济民 杨绍雄 高望 应称 | 2016 | 武汉大学学报(理学版)2016,62,3: | 14 |
| 3 | 基于知识图谱的网络舆情管理方法与实践研究显示文摘舆情分析是网络空间安全的特殊领域,国内外研究现状阐明人工智能和大数据时代催生研究更为精准、科学的网络舆情管理方法。网络舆情知识图谱(NPOKG)既有鲜明的需求牵引又有亟待解决的关键技术,知识组织下的NPOKG构建是网络舆情管理的重要方法,基于NPOKG的事件抽取和热点发现是舆情管理的重要实践。实践表明,将知识图谱应用于舆情管理,可以简化热点事件的发现过程,提高热点事件的趋势分析能力,提升舆情管理的智能化水平。 | 王兰成 娄国哲 | 2020 | 情报理论与实践2020,43,6: | 12 |
| 4 | 面向中文新闻话题检测的多向量文本聚类方法显示文摘基于多向量模型,给出一种将话题主题信息与话题文本信息相结合的多向量话题表示方式,使用较低的维度来准确表示一个话题.针对传统TFIDF方法在文本分类问题中对特征项在各个类中分布情况考虑不充分的问题,给出了一种TFIDF改进方法.在TDT4的中文语料上,与传统向量空间模型进行了对比实验.实验结果表明,给出的话题表示方法和TFIDF改进算法能够在较低的维度上,使聚类的准确率得到较大提升. | 李欣雨 袁方 刘宇 李琮 | 2016 | 郑州大学学报(理学版)2016,48,2: | 6 |
| 5 | 基于社交媒体的事件脉络挖掘研究进展显示文摘随着Web 2.0的兴起以及移动互联网与智能终端的蓬勃发展,以微博为代表的社交媒体迅速发展壮大。基于社交媒体的事件脉络挖掘技术在突发事件检测、事件走势分析、舆情预测等诸多方面发挥着重要作用,受到学术界的广泛关注。该文在最新研究成果与文献的基础上,以事件脉络挖掘的实现为出发点,概括总结了核心步骤中存在的关键技术,并归纳提出了目前事件脉络挖掘与分析过程中存在的4个关键性的技术问题与挑战,分别如下:多模态信息融合条件下的事件脉络生成、跨媒介异构数据协同下的事件挖掘与事件脉络生成、层次化多粒度复杂事件的关系映射和实时数据条件下动态事件的快速识别与脉络生成。同时,针对上述关键问题与技术挑战进行了理论探讨、工作进展与趋势分析以及实际应用介绍,从而为深入研究和解决基于社交媒体的事件脉络挖掘技术提供了新的研究线索与方向。 | 张晨昕 饶元 樊笑冰 王硕 | 2019 | 中文信息学报2019,33,11: | 5 |
| 6 | 基于词向量的中文事件发现及表示显示文摘已有的事件发现方法主要基于词频-逆文档频率文档表示,维度较高,语义稀疏,效率和准确率都较低,不适用于大规模在线新闻事件发现.因此,文中提出基于词向量的文档表示方法,降低文档表示维度,缓解语义稀疏问题,提高文档相似度计算效率和准确性.基于该文档表示方法,提出动态在线新闻聚类方法,用于在线新闻事件发现,同时提高事件发现的准确率和召回率.在标准数据集TDT4和真实数据集上的实验表明,相比当前通用的基线方法,文中方法在时间效率和事件质量上都有显著提高. | 张斌 胡琳梅 侯磊 李涓子 | 2018 | 模式识别与人工智能2018,31,3: | 5 |
| 7 | 在线社交网络中的新兴话题检测技术综述显示文摘新兴话题检测是社交网络研究的热点问题之一。在线社交网络特别是微博的开放性,给话题的流行和爆发提供了前所未有的便利条件。新兴话题是即将流行或爆发的话题,往往伴随着重大的事件或新闻的发生,会产生重大的社会影响,如何在早期识别此类话题,是新兴话题检测研究的主要内容。该文回顾了近年来在新兴话题检测方面的主要进展,分析了新兴话题检测领域面临的挑战,阐述了相关的概念、方法和理论,重点从内容突发特征和信息传播模型两个方面对影响新兴话题检测的方法进行了分析和讨论,并对新兴话题检测的前景做了展望。 | 笱程成 杜攀 刘悦 程学旗 | 2016 | 中文信息学报2016,30,5: | 5 |
| 8 | 大规模短文本的快速话题发现方法与评价研究显示文摘传统的话题发现研究主要针对于长文本及新闻数据集,大规模短文本具有稀疏、无结构、多噪等特点,传统方法很难有效发现话题。提出了一个融合词共现与加权GN(CW-WGN)算法的快速话题发现方法,描述了CW-WGN方法的详细过程,给出方法的具体算法。采集了sina微博、新闻网站的标题真实的短文本数据,构建了基础测试数据集,采用LDA与K-means方法作为对比进行了大量对比实验。实验结果表明CW-WGN比LDA和K-means方法能够多发现20%以上的正确话题,而且发现的话题纯度也高于LDA与K-means。此外,CWWGN消耗的时间最少,能够有效地从实际大规模短文本上发现话题。 | 韩忠明 张慧 张梦 黄今慧 | 2015 | 计算机应用研究2015,32,3: | 3 |
| 9 | 基于短文本信息流的回顾式话题识别模型显示文摘近几年来,短文本信息流广泛应用于一些全民媒体,它在公开传递信息同时携带了丰富且具有极大价值的信息资源。该文提出了一种回顾式话题识别模型,改进了权值计算方法,有效提取了具有较强分辨话题能力的关键词,在聚类过程中将BIC值作为话题类别合并依据,提高了聚类的准确率。通过进行时间段分隔和去掉孤立点信息提高了算法的效率。实验结果表明,该方法有效地提高了短文本信息流的话题检测准确率和效率。 | 周泓 刘金岭 王新功 | 2015 | 中文信息学报2015,29,1: | 3 |
| 10 | 改进的话题检测和跟踪算法研究显示文摘话题检测可以及时发现互联网舆情热点和突发性事件,并可对话题进行持续跟踪,从而实时掌握舆情事件动向。文中提出了一种基于聚类的改进话题检测和跟踪算法。首先,对文本的特征向量进行改进,增加了基于句子主干的主干向量。然后对每个检测到的话题提取两个中心向量,一个是基本中心向量,另一个是基于主干向量提炼的主干中心向量。在此基础上再通过计算每个文本与中心向量之间的距离进行聚类分析,保证话题中各个文本之间的内聚性。同时基于主题词抽取,在主题词的基础上计算话题之间的主题相关性,有效地实现了子话题检测功能,从而提高了话题检测和跟踪的准确性。通过对10大网站5个频道超过两周数据量的测试,结果表明此方法在一定程度上提高了话题检测和跟踪的正确率,并具有一定的适应性和推广性。 | 肖红 许少华 | 2014 | 计算机技术与发展2014,24,9: | 3 |
| 11 | 结合时序和语义的中文微博话题检测与跟踪方法显示文摘微博文本具有短小快捷、主题多变等特点,社交话题检测与跟踪研究面临新的挑战。结合微博的话题时序性和短文本语义相似度等特点,提出了基于微博聚类的话题检测与跟踪系统方法。首先,通过定义微博文本的时序频繁词集,给出面向热点话题的特征词选择方法;然后,根据时序频繁特征词集,利用最大频繁项集获得微博初始聚类;针对初始簇间存在文本重叠情况,提出基于短文本扩展语义隶属度的簇间重叠消减算法,获得完全分离的初始簇;最后,根据簇语义相似度矩阵,给出凝聚式话题聚类方法。通过新浪微博完成实验测试,表明所提方法可用于中文微博热点话题检测与跟踪。 | 陈铁明 王小号 庞卫巍 江颉 | 2016 | 网络与信息安全学报2016,2,5: | 3 |
| 12 | 一种基于TF·IEF模型的在线新闻事件探测方法显示文摘为了提升在线新闻事件探测的性能,提出一种基于TF.IEF模型的在线新闻事件探测方法。该方法受TF.IDF思想的启发,直接计算特征词表征事件的权重,建立新的增量事件模型,并将探测过程分为两个阶段:第一阶段利用Single-Pass将一定时段内收集到的报道聚成微簇;第二阶段将微簇与已有事件进行相似性匹配,然后通过重新计算事件向量实现模型更新。实验结果表明,该方法运算速度快,特征信息丢失少,提高了探测的效率和准确率。 | 张辉 李国辉 贾立 孙博良 | 2013 | 国防科技大学学报2013,35,3: | 3 |
| 13 | 基于TDT技术的新冠肺炎疫情文献主题演化研究显示文摘[目的/意义]探究在新冠肺炎疫情期间的文献主题演化规律,不仅可以细粒度地揭示疫情在各领域的热点话题和演化路径,还可以为政府应急响应提供决策支持。[方法/过程]文章引入话题检测及跟踪技术(TDT)对文献主题进行自动检测和跟踪,挖掘文献中的主题分布及演化路径。融合自动编码器和Word2vec进行文本特征提取,并利用K-means和余弦相似度计算进行主题演化研究,同时结合LDA模型优化话题模型。[结果/结论]实验结果证明,文献主题词随时间变化较为明显,且与实际较为相符,疫情初期集中在“武汉市”,逐渐从“远程劳动”过渡到“疫苗”,研究集中在疫情防控、经济舆情和医疗卫生3个方面。TDT技术的引入能够系统地完成新冠肺炎疫情文献主题检测和跟踪任务,多维度话题模型能较好适应研究主题不断变化的情况。 | 赵新琴 吴鹏 | 2022 | 科技情报研究2022,4,2: | 3 |
| 14 | 基于FSD模型的政府资助项目新兴主题探测与分析显示文摘如何捕捉科技领域发展趋势并高效准确地追踪科研活动动态演变一直是研究人员关注的焦点。以美国国家科学基金会政府资助项目文本为分析数据源,综合运用主题模型及指标构建方法,探索文本结构特征并从资助金额、布局强度等多个维度分析,分析主题生命周期提出基于FSD模型的项目文本新兴主题探测方法。结果表明,该方法能够快速前瞻识别出新兴主题,形成主题—主题词—项目序列号的混合分布聚态集群,从新兴主题探测数量、探测质量及探测时间3个维度对比验证了新兴探测模型的优越性。 | 徐路路 靳杨 | 2019 | 科学学与科学技术管理2019,40,2: | 3 |
| 15 | 基于TF* PDF的热点关键短语提取显示文摘传统的TF* PDF方法提取的关键短语可精确地描述话题并进行新闻报道的追踪,但存在误将噪声数据识别为关键短语的情况。提出了一种基于位置权重TF* PDF的两段式关键短语提取方法滤除噪声数据。该方法将传统的TF* PDF算法与位置权重相结合,计算词汇与短语的权重,获取候选关键短语列表,关键短语的脉冲值则用于过滤列表中的噪声。通过关键短语识别进程根据位置信息、频率信息等将热点词汇组合成短语。TF* PDF位置权重算法同时也用于为短语分配权重,排名前K的短语被认为是热点关键短语。以真实网络数据为基础的实验结果表明,该提取方法与传统的TF* PDF提取方法相比,可更好地去除关键词短语中的绝对噪声,较好地改善了热点话题检测的准确度。 | 马佩勋 高琰 | 2013 | 计算机应用研究2013,30,12: | 3 |
| 16 | 基于LDA模型和T-OPTICS算法的中文新闻话题检测显示文摘给出了一种针对大量新闻数据的话题检测方法.首先通过LDA(latent dirichlet allocation)模型从语义层面抽取新闻数据主题,有效降低数据分析维度,更合理地体现新闻主题特征.然后改进OPTICS(ordering point to identify the cluster structure)密度聚类算法,基于新闻话题的时间延续性给出了T-OPTICS算法.该算法继承了OPTICS算法对参数不敏感的特性,降低了参数选择对聚类结果的影响.改进了OPTICS算法中文本间相似度的计算方法,体现了话题的时间延续性.基于TDT4数据集的实验表明,该方法能够快速有效地发现新闻中的话题. | 李琮 袁方 刘宇 李欣雨 | 2016 | 河北大学学报(自然科学版)2016,36,1: | 3 |
| 17 | 基于改进Single-Pass的农产品安全事件在线检测方法显示文摘农产品安全事件在网络上快速传播,容易造成较大的社会影响或导致网络舆情事件,需要及时识别出农产品安全危机事件。提出了基于改进Single-Pass的农产品安全事件在线检测方法。通过将文本进行分块和动态更新特征词的文档频率,改进了特征词权重计算方法;通过引入时间距离,改进了Single-Pass算法聚类时的相似度度量方法。相对于改进前,系统的漏检率和误检率有明显降低;可有效进行农产品安全事件的在线检测,可用于网络上农产品安全危机事件的动态监测。 | 潘守慧 王开义 王书锋 刘忠强 | 2018 | 科学技术与工程2018,18,13: | 2 |
| 18 | 基于网络社交媒体的子话题检测技术综述显示文摘在当前多种平台崛起的互联网背景下,与传统媒体相比,网络社交媒体中的数据具有传递速度快、用户参与度高、内容覆盖全等特点,其中存在着人们关注并发布评论的众多话题,而一个话题的相关信息中可能存在更深层次、更细粒度的子话题,针对该问题进行基于网络社交媒体的子话题检测技术的研究,这是一个新兴且不断发展的研究领域。通过社交媒体获取话题及子话题信息并参与讨论,这一方式正全方位、深层次改变着人们的生活,但是该领域技术还不成熟,且相关研究在国内尚处于起步阶段。首先,简述网络社交媒体中子话题检测的发展背景和基本概念;其次,将子话题检测技术分为七大类,对每类方法均加以介绍、对比和总结;然后,将子话题检测方式分为在线检测和离线检测两种方式,并将这两种方式进行对比,列举通用技术及两种方式下的常用技术;最后,概括了该领域当前不足及未来发展趋势。 | 理姗姗 杨文忠 王婷 王丽花 | 2020 | 计算机应用2020,40,6: | 2 |
| 19 | 词性对新闻和微博网络话题检测的影响显示文摘针对新闻和微博2组有代表性的语料开展实验研究,旨在发现不同词性特征及其组合对2种通用网络平台话题检测的作用及其影响.研究表明:在选择单一词性特征时,名词特征可得到最好的检测结果,命名实体可在保证准确率的情况下大大降低聚类的特征维度.在选择词性组合作为特征时,名词或命名实体、数词、时间短语、形容词以及量词的组合特征可提升新闻网络话题检测的准确率,而名词或命名实体、形容词、量词、数词以及特殊符号与网址的组合特征可在微博语料上获得较好的检测结果. | 冀俊忠 贝飞 吴晨生 柴鹰 宋辰 | 2015 | 北京工业大学学报2015,41,4: | 2 |
| 20 | 基于Hadoop的航天网络舆情监测系统的设计与实现显示文摘大数据时代,舆情监测和分析越发重要。针对单机爬虫效率低、可扩展性差、存储管理困难及信息展示不友好等问题,设计并实现了一套基于Hadoop的航天网络舆情监测系统,系统首先利用基于Map Reduce的分布式网络爬虫进行数据抓取,以HDFS作为底层存储系统,在其上构建基于HBase的分布式数据库对舆情信息进行统一存储管理;通过提供定制化查询功能及相关辅助功能协助舆情分析人员实时监测舆情。测试结果表明,系统可以有效地实现对网络舆情的监测并实现定制化展示,达到了设计要求。 | 齐钢雷 潘坚 | 2017 | 科技创新导报2017,14,16: | 1 |