|
|
|
题名
|
作者
|
年代
|
出处
|
被引量
|
| 1 | 电力变压器故障诊断的k值自适应加权KNN算法研究显示文摘为对变压器故障进行更有效的诊断,针对变压器故障数据数值范围广且分布不均的特点,提出了k值自适应加权K近邻算法。首先,为避免离群样本对分类结果造成影响,利用局部异常因子对样本数据进行了离群点检测,并剔除了显著离群的样本;其次,为弥补传统KNN算法k值固定的缺陷,提出根据待测样本近邻点单位面积密度来对k进行自适应取值;最后,在对待测样本进行分类时,综合考虑各近邻点到待测样本之间的欧式距离,以及待测样本与各类别样本的分布相似度来确定各近邻点权重,并应用到最终的变压器故障分类决策之中。实验结果表明:研究提出的k值自适应加权KNN算法能对变压器故障进行有效诊断,诊断准确率达91.7%,相比改良三比值法以及BPNN、SVM和传统KNN三种分类器分别提高了19.7%、12.1%、6.5%和7.4%。 | 张彼德 梅婷 王涛 | 2020 | 湖北电力2020,44,2: | 7 |
| 2 | Spark on Yarn模式的电信大数据处理平台显示文摘为了提高电信大数据处理的性能,提出了一种Spark on Yarn模式的电信大数据处理平台SY-TPP(Spark on Yarn Telecommunication Big Data Processing Platform)。SY-TPP平台的实现采用Hadoop2.0的Yarn规范,运用了Spark分布式内存计算框架,使SY-TPP平台数据集的处理尽量在内存中进行。以分级聚类算法为案例分析了SY-TPP平台的编程步骤;测试结果表明:电信运营商的上GB级的用户数据能够半个工作日内完成,32物理节点的SY-TPP平台比同等配置的MapReduce平台的加速比从9.5提升10.25。 | 杨玉 张远夏 | 2019 | 福建电脑2019,35,3: | 6 |
| 3 | 基于极限学习机的中文文本分类方法显示文摘针对当前中文文本分类方法难以平衡分类精度和学习效率的问题,提出了一种基于极限学习机(ELM)的中文文本分类方法,该方法包括预处理模块、文本特征提取模块、特征融合模块和基于极限学习机的分类模块。在分类模块中,提出采用单隐层神经网络作为分类器并使用ELM算法来训练分类器,有效地平衡模型性能和学习效率。同时分别针对不同的特征训练分类器,集成不同分类器的输出得到最后的分类结果,有效提高了平衡分类精度,并在电网档案管理系统的档案归类任务中对该模型进行应用评估。实验结果表明,该模型不仅有较高的分类精度,而且在训练和测试两个阶段模型的计算都具有较低的代价。所提方法适用于海量数据下的中文文本分类场景,具有重要的研究意义和推广价值。 | 程东生 范广璐 俞雯静 伍飞 曾伟波 | 2018 | 重庆理工大学学报(自然科学)2018,32,8: | 5 |
| 4 | 基于Spark大数据处理框架的逆时偏移成像技术研究显示文摘基于双程波动方程的逆时偏移成像技术是当前高精度地震偏移成像的主流手段,可实现地下复杂构造的精确成像。近年来,随着高密度地震采集技术的不断发展,日益增长的海量地震数据对偏移成像过程中数据的存储和高效计算提出了更高的要求。提出了一种基于Spark大数据处理框架的逆时偏移成像技术,该技术充分利用了Spark框架分布式内存计算及其分布式文件存储系统支持海量数据读写的优势。采用数据均衡服务实现了分布式存储数据的均衡分布并利用数据动态分块算法实现了计算资源的充分利用和并行粒度的合理分配,从而保证了并行作业的负载均衡。与MPI及MapReduce两种并行方式下的实际数据偏移测试对比分析结果表明,所提出的基于Spark大数据处理框架的逆时偏移成像技术能够在保证成像精度的前提下实现计算效率的提升并满足海量数据存储的要求。 | 蒋楠 | 2020 | 石油物探2020,59,4: | 5 |
| 5 | 云计算下Spark并行Apriori算法林业病虫害防治研究显示文摘林业病虫害防治一直是林业领域的头等大事,缺乏行之有效的决策处理是现阶段正待解决的问题之一。随着可获取的林业数据量急剧增加,数据处理难度逐渐加大,单台机器处理已无法满足当前需求。云计算作为新型计算机模式将极大提高林业病虫害防治水平。本文将基于Spark并行化框架的Apriori算法提出病虫害资源数据的云存储模式,设计林业病虫害处理过程,满足云计算环境下林业病虫害防治需求,用以解决病虫害与树种之间获取信息困难以及关联规则处理效率问题。设计多组实验,通过改变数据集大小与集群节点个数计算出集群处理时间,从而评估算法性能。结果表明,云计算环境下该并行化算法不仅在海量数据存储以及可扩展性上具有良好性能,还能高度提取出树种与虫害的关联规则,提升挖掘效率。将该方法运用于林业领域,具有极高的前瞻性和有效性,为林业梳理物种之间关系以及防治林业病虫害提供很好的决策支持。 | 孙广婷 李丹 周唯唯 张俊杰 牛萌 邹佳旭 | 2018 | 森林工程2018,34,4: | 4 |
| 6 | 一种基于Yarn云计算平台与NMF的大数据聚类算法显示文摘为了改进Map Reduce早期版本在大数据聚类算法方面的性能,文章提出了基于Yarn(Yet Another Resource Negotiator)云计算平台与非负矩阵分解NMF(Nonnegative Matrix Factorization)的大数据聚类方法。文章讨论了高维数据相似性聚类与非负矩阵分解的结合及其面向Map Reduce的数据聚类的任务划分方式。该方法的实现采用Hadoop2.0的Yarn平台,利用Hadoop的HDFS(Hadoop Distributed File System)来存储大容量的外部数据;描述了基于NMF的大数据相似性聚类方法的编码与实现过程,并以电信运营商的大数据作为案例程序进行了测试。实验结果表明,Yarn云平台比传统用于数据聚类的非负矩阵方法具有更好的运行时间与加速比,能够在可以接受的时间范围内完成电信运营商的大数据处理。 | 冯新扬 沈建京 | 2018 | 信息网络安全2018,,8: | 4 |
| 7 | 云环境下NB算法的垃圾邮件过滤研究显示文摘朴素贝叶斯算法在解决垃圾邮件分类领域内具有较高的准确性,能够很好的将邮件区分开来,但是在分类前期的训练阶段却会大量耗用系统和网络资源,严重影响分类效率.为此引入spark平台.以并行的思想去解决邮件分类问题,利用spark计算平台RDD的血缘关系合理的安排NB邮件分类的各个过程.实验结果表明,与其他传统的分类方法对比而言,朴素贝叶斯在精确率,召回率等方面具有很好的效果,并且与传统单机下的邮件分类,本次实验因引入分布式的思想,利用spark集群的优势大大加快了分类的速率. | 刘月峰 张亚斌 苑江浩 | 2018 | 微电子学与计算机2018,35,8: | 4 |
| 8 | 基于Spark机器学习实现医疗保险关联频繁模式的欺诈行为挖掘技术探讨显示文摘医疗保险基金在社会稳定与人民健康生活水平提高中所承担的作用日益重要。基金审计所面对的是医疗机构几何级增长的“知识密集型”各类医学数据,传统的骗保行为甄别统计分析方法无法适用此类多样性与非结构化数据应用场景,必然导致探索以机器学习理论为基础的大数据分析方法的研究应用。围绕电子病历文本关联规则挖掘问题,探索利用Spark机器学习技术对关联规则挖掘算法在电子病历文本表达数据中的应用进行深入研究,在此基础上构建医疗保险欺诈行为审计系统的核心逻辑,用以深层次分析医疗机构和患者双维度挖掘效果。 | 刘鹏 | 2019 | 中国数字医学2019,14,5: | 3 |
| 9 | 基于Yarn云平台的生物基因多序列比对并行算法显示文摘为了解决生物信息学中基因多序列比对的计算速度慢和软件陈旧的问题,提出了基于Yarn(Yet Another Resource Negotiator)云平台的生物基因多序列比对并行计算方法Yarn_clustalW。分析了clustalW算法的数学模型及其面向MapReduce的任务划分方式,Yarn_clustalW中综合考虑了基因的长度和数目,采用一种基于阈值刻度的任务划分方式。利用NCBI的GenBank生物基因数据作为案例程序进行了测试。实验结果表明:Yarn_clustalW比起多序列比对clustalW串行计算方法具有更快的运行时间与加速比,可以使生物科研人员节省很多时间与精力,方便对于药物靶标的发现,缩短生物药物的开发周期。 | 邓小燕 徐胜超 | 2019 | 基因组学与应用生物学2019,38,7: | 3 |
| 10 | 基于Spark和DN-gram模型的定义抽取研究显示文摘从互联网海量文本中抽取出词语的定义对知识库的自动构建具有重要意义。针对定义抽取研究中N-gram语言模型携带的语义信息有限、容易产生大量稀疏数据的问题,提出了一种DN-gram语言模型。在N-gram基础上融入上下文词语间的语法依赖关系,能表达更为丰富的语言学特征;采用词形和词性的组合代替只用词形的特征选取方法来降低稀疏数据的影响;引入TF-IDF定义隶属度进行特征降维;在Spark大数据平台下采用并行定义抽取管道将互联网文本转换成特征向量,使用随机森林分类器进行学习和训练,在实验中取得了较好效果。 | 于洁 | 2017 | 北京信息科技大学学报(自然科学版)2017,32,4: | 2 |
| 11 | Knn算法在互联网涉警舆情分析系统的应用研究显示文摘在社会发展进程中,特别是当今信息畅通度极高的时代,新技术的出现必然引起社会的广泛关注,甚至改变着社会发展的动向。基于此,本文将前浅析涉警舆情与Knn算法的基本概念、特征等内容,简要分析涉警舆情产生的原因,结合具体案例,探寻Knn算法在涉警舆情中的应用策略,仅供参考。 | 陈来 | 2019 | 通讯世界2019,26,12: | 2 |
| 12 | 基于spark框架的DBSCAN文本聚类算法显示文摘针对DBSCAN算法性能上的瓶颈以及内存和I/O上的消耗严重,提出了一种大数据计算框架的并行聚类方案.选用Spark计算框架对DBSCAN算法进行并行化改进,利用SNN相似度图解决DBSCAN算法对高维数据密度定义模糊的问题,并且将DBSCAN算法运行在spark计算平台上,缓解了内存的不足.实验结果证明,该解决方案相对于单机的DBSCAN算法,聚类精度没有下降,并且通过横向的添加节点增加了运行内存,在缓解内存紧张的前提下降低了算法运行时间,和基于Hadoop的DBSCAN算法相比也有较好的加速比. | 宁建飞 | 2018 | 汕头大学学报(自然科学版)2018,33,2: | 2 |
| 13 | 面向云环境的蛋白质折叠模拟计算并行化算法显示文摘提出了面向云环境Yarn(yet another resource negotiator)规范的蛋白质折叠模拟计算并行化算法Yarn_PERM。分析了蛋白质折叠的格点模型PERM算法的运行流程及其面向MapReduce的子任务划分方式。Yarn_PERM算法实现采用Hadoop2.0的Yarn框架作为工作平台,其资源的分配与调度、应用子任务的申请和子任务的具体执行都由Yarn来透明地完成;描述了Yarn_PERM算法的Map程序与Reduce程序及主控程序的功能实现。实验结果表明:在相同的时间内Yarn_PERM比PERM串行计算、MapReduce的PERM计算在能量最低寻优的吞吐量上明显增加,加速比和可扩展性上也有明显的优势。 | 宋华 闫会峰 | 2018 | 科学技术与工程2018,18,5: | 1 |
| 14 | 基于粒子群聚类的KNN微博舆情分类研究显示文摘基于数据挖掘的微博情感分类是网络舆情监控的重要方法,其中KNN算法具有简单有效、无需估计参数等优点,适用于微博舆情分类。微博舆情分类实质上是对微博上的负面情感及时监控,KNN会因在情感分类时处理大量的计算影响算法效率。因此,采用粒子群聚类算法在情感分类前裁剪微博训练样本空间,以减少分类时的计算量。实验结果表明,基于粒子群聚类的KNN算法能够有效提高微博情感分类的性能。 | 林伟 | 2017 | 中国刑警学院学报2017,,5: | 1 |
| 15 | 基于深度学习的教材德目分类方法显示文摘德目教育是个人发展的基石,也是学校的重要职责之一,而教材作为进行德目教育的重要载体,德目指标自然也就成为修订教材的重要标准之一。利用深度学习来实现教材德目指标的自动分类具有更高的效率和可靠性,但是教材文本数据集具有文本信息丰富、特征表现不明显、样本分布不均衡等特点,针对这些问题,结合一种新颖的数据增强方法,并根据词向量对分类结果的贡献度,通过注意力机制计算得到其注意力矩阵,然后结合词向量矩阵一同输入到模型中去,从而提出一种结合注意力机制的文本分类模型IoMET_A,利用IoMET_A对上海市中小学教材文本进行深度学习。实验结果表明,与原始的IoMET文本分类器相比,IoMET_A有效提升了评测效果。 | 郭书武 陈军华 | 2021 | 计算机与现代化2021,,9: | 0 |
| 16 | Spark框架下均值漂移算法对舆情聚类的分析显示文摘为提高对舆情信息的分析能力,设计并实现基于Spark框架的均值漂移算法。使用Ansj分词、Word2vec算法对舆情信息进行特征提取,然后基于Spark并行计算框架和均值漂移算法原理进行聚类分析。实验结果显示,均值漂移算法在Iris和Wine两组数据集下的准确率均超过90%,聚类结果明显优于K-means算法,具有较好的适应性。性能实验结果表明,增加运行程序的并行化程度可以提高均值漂移算法的运行效率。基于Spark框架的均值漂移算法能有效提高舆情信息的分析能力,助力建立健康的网络环境。 | 张京坤 王怡怡 | 2022 | 软件导刊2022,21,6: | 0 |
| 17 | 基于聚类的文本分类算法框架研究显示文摘KNN算法因其易于理解、理论成熟等优点而被广泛应用于文本分类。由于KNN需遍历样本空间计算距离,当训练集样本规模较大或维数较高时,计算开销是巨大的。针对此问题,首先将遗传算法适应度函数设计部分与K-medoids算法思想相融合形成K-GA-medoids,其次将其与KNN相结合形成用于文本分类的算法框架,在分类过程中,采取先聚类,再分类的步骤,以实现对训练集样本的缩减,从而降低计算开销。实验表明,K-GA-medoids相较于传统K-medoids而言在聚类效果上有较为明显的提升,且将其与KNN相结合形成的文本分类算法框架与传统KNN算法相比在保证分类精确率的前提下,有效提升了文本分类的效率。 | 黄细凤 | 2021 | 计算机与数字工程2021,49,1: | 0 |
| 18 | Spark日志整合与FCM-DNN的网络流量分析算法显示文摘提出一种基于内存计算引擎(Spark)日志集成与模糊c均值聚类-全连接神经网络(FCM-DNN)的流量分析算法.首先,使用Spark集成会话日志来获取可分析的结构化数据;然后,对同一网站的行为数据进行聚类,提取网站的多类簇特征集合,以解决单个会话连接特征维度较少、特征相似且不平衡的问题;最后,构建全连接神经网络(DNN),将统一化后的聚类特征与原始特征结合并进行训练,从聚类分组长度和损失函数等多个方面进行算法优化.仿真实验结果表明,对于特征较少的会话日志数据,该算法可有效提高网站分类的准确性.同时,在保留学生上网特征的前提下,将日志压缩约7000倍,从而节省存储开销. | 李腾 郭晓东 胡宇鹏 李振 | 2023 | 福州大学学报(自然科学版)2023,51,5: | 0 |