前言:我们精心挑选了数篇优质挖掘技术论文文章,供您阅读参考。期待这些文章能为您带来启发,助您在写作的道路上更上一层楼。
[关键词]数据挖掘数据挖掘方法
随着信息技术迅速发展,数据库的规模不断扩大,产生了大量的数据。但大量的数据往往无法辨别隐藏在其中的能对决策提供支持的信息,而传统的查询、报表工具无法满足挖掘这些信息的需求。因此,需要一种新的数据分析技术处理大量数据,并从中抽取有价值的潜在知识,数据挖掘(DataMining)技术由此应运而生。
一、数据挖掘的定义
数据挖掘是指从数据集合中自动抽取隐藏在数据中的那些有用信息的非平凡过程,这些信息的表现形式为:规则、概念、规律及模式等。它可帮助决策者分析历史数据及当前数据,并从中发现隐藏的关系和模式,进而预测未来可能发生的行为。数据挖掘的过程也叫知识发现的过程。
二、数据挖掘的方法
1.统计方法。传统的统计学为数据挖掘提供了许多判别和回归分析方法,常用的有贝叶斯推理、回归分析、方差分析等技术。贝叶斯推理是在知道新的信息后修正数据集概率分布的基本工具,处理数据挖掘中的分类问题,回归分析用来找到一个输入变量和输出变量关系的最佳模型,在回归分析中有用来描述一个变量的变化趋势和别的变量值的关系的线性回归,还有用来为某些事件发生的概率建模为预测变量集的对数回归、统计方法中的方差分析一般用于分析估计回归直线的性能和自变量对最终回归的影响,是许多挖掘应用中有力的工具之一。
2.关联规则。关联规则是一种简单,实用的分析规则,它描述了一个事物中某些属性同时出现的规律和模式,是数据挖掘中最成熟的主要技术之一。关联规则在数据挖掘领域应用很广泛适合于在大型数据集中发现数据之间的有意义关系,原因之一是它不受只选择一个因变量的限制。大多数关联规则挖掘算法能够无遗漏发现隐藏在所挖掘数据中的所有关联关系,但是,并不是所有通过关联得到的属性之间的关系都有实际应用价值,要对这些规则要进行有效的评价,筛选有意义的关联规则。
3.聚类分析。聚类分析是根据所选样本间关联的标准将其划分成几个组,同组内的样本具有较高的相似度,不同组的则相异,常用的技术有分裂算法,凝聚算法,划分聚类和增量聚类。聚类方法适合于探讨样本间的内部关系,从而对样本结构做出合理的评价,此外,聚类分析还用于对孤立点的检测。并非由聚类分析算法得到的类对决策都有效,在运用某一个算法之前,一般要先对数据的聚类趋势进行检验。
4.决策树方法。决策树学习是一种通过逼近离散值目标函数的方法,通过把实例从根结点排列到某个叶子结点来分类实例,叶子结点即为实例所属的分类。树上的每个结点说明了对实例的某个属性的测试,该结点的每一个后继分支对应于该属性的一个可能值,分类实例的方法是从这棵树的根结点开始,测试这个结点指定的属性,然后按照给定实例的该属性值对应的树枝向下移动。决策树方法是要应用于数据挖掘的分类方面。
5.神经网络。神经网络建立在自学习的数学模型基础之上,能够对大量复杂的数据进行分析,并可以完成对人脑或其他计算机来说极为复杂的模式抽取及趋势分析,神经网络既可以表现为有指导的学习也可以是无指导聚类,无论哪种,输入到神经网络中的值都是数值型的。人工神经元网络模拟人脑神经元结构,建立三大类多种神经元网络,具有非线形映射特性、信息的分布存储、并行处理和全局集体的作用、高度的自学习、自组织和自适应能力的种种优点。
6.遗传算法。遗传算法是一种受生物进化启发的学习方法,通过变异和重组当前己知的最好假设来生成后续的假设。每一步,通过使用目前适应性最高的假设的后代替代群体的某个部分,来更新当前群体的一组假设,来实现各个个体的适应性的提高。遗传算法由三个基本过程组成:繁殖(选择)是从一个旧种群(父代)选出生命力强的个体,产生新种群(后代)的过程;交叉〔重组)选择两个不同个体〔染色体)的部分(基因)进行交换,形成新个体的过程;变异(突变)是对某些个体的某些基因进行变异的过程。在数据挖掘中,可以被用作评估其他算法的适合度。
7.粗糙集。粗糙集能够在缺少关于数据先验知识的情况下,只以考察数据的分类能力为基础,解决模糊或不确定数据的分析和处理问题。粗糙集用于从数据库中发现分类规则的基本思想是将数据库中的属性分为条件属性和结论属性,对数据库中的元组根据各个属性不同的属性值分成相应的子集,然后对条件属性划分的子集与结论属性划分的子集之间上下近似关系生成判定规则。所有相似对象的集合称为初等集合,形成知识的基本成分。任何初等集合的并集称为精确集,否则,一个集合就是粗糙的(不精确的)。每个粗糙集都具有边界元素,也就是那些既不能确定为集合元素,也不能确定为集合补集元素的元素。粗糙集理论可以应用于数据挖掘中的分类、发现不准确数据或噪声数据内在的结构联系。
8.支持向量机。支持向量机(SVM)是在统计学习理论的基础上发展出来的一种新的机器学习方法。它基于结构风险最小化原则上的,尽量提高学习机的泛化能力,具有良好的推广性能和较好的分类精确性,能有效的解决过学习问题,现已成为训练多层感知器、RBF神经网络和多项式神经元网络的替代性方法。另外,支持向量机算法是一个凸优化问题,局部最优解一定是全局最优解,这些特点都是包括神经元网络在内的其他算法所不能及的。支持向量机可以应用于数据挖掘的分类、回归、对未知事物的探索等方面。
事实上,任何一种挖掘工具往往是根据具体问题来选择合适挖掘方法,很难说哪种方法好,那种方法劣,而是视具体问题而定。
三、结束语
目前,数据挖掘技术虽然得到了一定程度的应用,并取得了显著成效,但仍存在着许多尚未解决的问题。随着人们对数据挖掘技术的深人研究,数据挖掘技术必将在更加广泛的领域得到应用,并取得更加显著的效果。
关键词:挖掘机;维修;保养
随着科技的进步,现代挖掘机一般都采用了机电液一体化控制模式,我们在排除一些故障时,解决的多是发动机、液压泵、分配阀、外部负荷的匹配问题。一般在挖掘机作业中,这几方面不能匹配,经常会表现为:发动机转速下降,工作速度变慢,挖掘无力以及一些常见问题。
一、发动机转速下降
首先要测试发动机本身输出功率,如果发动机输出功率低于额定功率,则产生故障的原因可能是燃油品质差、燃油压力低、气门间隙不对、发动机的某缸不工作、喷油定时有错、燃油量的调定值不对、进气系统漏气、制动器及其操纵杆有毛病和涡轮增压器积炭。如果发动机输出动力正常,就需要查看是否因为液压泵的流量和发动机的输出功率不匹配。
液压挖掘机在作业中速度与负载是成反比的,就是流量和泵的输出压力乘积是一个不变量,泵的输出功率恒定或近似恒定。如果泵控制系统出现了故障,就不能实现发动机、泵及阀在不同工况区域负荷优化匹配状态,挖掘机从而将不能正常工作。此类故障要先从电器系统入手,再检查液压系统,最后检查机械传动系统。
二、工作速度变慢
挖掘机工作速度变慢主要原因是整机各部磨损造成发动机功率下降与液压系统内泄。挖掘机的液压泵为柱塞变量泵,工作一定时间后,泵内部液压元件(缸体、柱塞、配流盘、九孔板、龟背等)不可避免的产生过度磨损,会造成内漏,各参数据不协调,从而导致流量不足油温过高,工作速度缓慢。这时就需要整机大修,对磨损超限的零部件进行修复更换。
但若不是工作时间很长的挖掘机突然变慢,就需要检查以下几方面。先查电路保险丝是否断路或短路,再查先导压力是否正常,再看看伺服控制阀-伺服活塞是否卡死以及分配器合流是否故障等,最后将液压泵拆卸进行数据测量,确认挖机问题所在。
三、挖掘机无力
挖掘无力是挖掘机典型故障之一。对于挖掘无力可分为两种情况:一种为挖掘无力,发动机不憋车,感觉负荷很轻;第二种为挖掘无力,当动臂或斗杆伸到底时,发动机严重憋车,甚至熄火。
①挖掘无力但发动机不憋车。挖掘力的大小由主泵输出压力决定,发动机是否憋车取决于油泵吸收转矩与发动机输出转矩间的关系。发动机不憋车说明油泵吸收转矩较小,发动机负荷轻。如果挖掘机的工作速度没有明显异常,则应重点检查主泵的最大输出压力即系统溢流压力。如果溢流压力测量值低于规定值,表明该机构液压回路的过载溢流阀设定值不正确,导致该机构过早溢流,工作无力。则可以通过转动调整螺丝来调整机器。②挖掘无力,发动机憋车。发动机憋车表明油泵的吸收转矩大于发动机输出转矩,致使发动机超载。这种故障应首先检查发动机速度传感系统是否正常,检查方法与前文所述发动机检查方法类似。经过以上细致的检查与排除故障,发动机速度传感系统恢复正常功能,发动机憋车现象消失,挖掘力就会恢复正常。
四、挖掘作业过程中的常见故障
挖掘机在施工作业中经常出现的一些普遍的故障,如:挖机行走跑偏,原因可能为行走分配油封(又称中心回转接头油封)损坏;两个液压泵流量大小不一;一边行走马达有问题。液压缸快速下泄则可能为安全溢流阀封闭不严,或缸油封严重损坏等等。
五、挖掘机的日常保养
为了防止挖掘机的故障发生,在日常使用过程中需要十分注意对挖掘机的保养。日常保养包括检查、清洗或更换空气滤芯;清洗冷却系统内部;检查和拧紧履带板螺栓;检查和调节履带反张紧度;检查进气加热器;更换斗齿;调节铲斗间隙;检查前窗清洗液液面;检查、调节空调;清洗驾驶室内地板;更换破碎器滤芯(选配件)。清洗冷却系统内部时,待发动机充分冷却后,缓慢拧松注水口盖,释放水箱内部压力,然后才能放水;不要在发动机工作时进行清洗工作,高速旋转的风扇会造成危险;当清洁或更换冷却液时,应将机器停放在水平地面上。
同时在启动发动机前需要检查冷却液的液面位置高度(加水);检查发动机机油油位,加机油;检查燃油油位(加燃油);检查液压油油位(加液压油);检查空气滤芯是否堵塞;检查电线;检查喇叭是否正常;检查铲斗的;检查油水分离器中的水和沉淀物。
挖掘机在日常工作中遇到的故障还有很多,这里只是介绍了较为常见的几类故障的维修方法,并且为了减少故障的发生,对挖掘机的日常保养是很重要的。只有做到保养和维护的双重保障,才能保障挖掘机更好的正常工作。
参考文献:
[1]钟陈添.挖掘机液压系统的常见故障分析及排除.科技资讯,2007,(22).
[关键词]数据挖掘数据挖掘方法
随着信息技术迅速发展,数据库的规模不断扩大,产生了大量的数据。但大量的数据往往无法辨别隐藏在其中的能对决策提供支持的信息,而传统的查询、报表工具无法满足挖掘这些信息的需求。因此,需要一种新的数据分析技术处理大量数据,并从中抽取有价值的潜在知识,数据挖掘(DataMining)技术由此应运而生。
一、数据挖掘的定义
数据挖掘是指从数据集合中自动抽取隐藏在数据中的那些有用信息的非平凡过程,这些信息的表现形式为:规则、概念、规律及模式等。它可帮助决策者分析历史数据及当前数据,并从中发现隐藏的关系和模式,进而预测未来可能发生的行为。数据挖掘的过程也叫知识发现的过程。
二、数据挖掘的方法
1.统计方法。传统的统计学为数据挖掘提供了许多判别和回归分析方法,常用的有贝叶斯推理、回归分析、方差分析等技术。贝叶斯推理是在知道新的信息后修正数据集概率分布的基本工具,处理数据挖掘中的分类问题,回归分析用来找到一个输入变量和输出变量关系的最佳模型,在回归分析中有用来描述一个变量的变化趋势和别的变量值的关系的线性回归,还有用来为某些事件发生的概率建模为预测变量集的对数回归、统计方法中的方差分析一般用于分析估计回归直线的性能和自变量对最终回归的影响,是许多挖掘应用中有力的工具之一。
2.关联规则。关联规则是一种简单,实用的分析规则,它描述了一个事物中某些属性同时出现的规律和模式,是数据挖掘中最成熟的主要技术之一。关联规则在数据挖掘领域应用很广泛适合于在大型数据集中发现数据之间的有意义关系,原因之一是它不受只选择一个因变量的限制。大多数关联规则挖掘算法能够无遗漏发现隐藏在所挖掘数据中的所有关联关系,但是,并不是所有通过关联得到的属性之间的关系都有实际应用价值,要对这些规则要进行有效的评价,筛选有意义的关联规则。
3.聚类分析。聚类分析是根据所选样本间关联的标准将其划分成几个组,同组内的样本具有较高的相似度,不同组的则相异,常用的技术有分裂算法,凝聚算法,划分聚类和增量聚类。聚类方法适合于探讨样本间的内部关系,从而对样本结构做出合理的评价,此外,聚类分析还用于对孤立点的检测。并非由聚类分析算法得到的类对决策都有效,在运用某一个算法之前,一般要先对数据的聚类趋势进行检验。
4.决策树方法。决策树学习是一种通过逼近离散值目标函数的方法,通过把实例从根结点排列到某个叶子结点来分类实例,叶子结点即为实例所属的分类。树上的每个结点说明了对实例的某个属性的测试,该结点的每一个后继分支对应于该属性的一个可能值,分类实例的方法是从这棵树的根结点开始,测试这个结点指定的属性,然后按照给定实例的该属性值对应的树枝向下移动。决策树方法是要应用于数据挖掘的分类方面。
5.神经网络。神经网络建立在自学习的数学模型基础之上,能够对大量复杂的数据进行分析,并可以完成对人脑或其他计算机来说极为复杂的模式抽取及趋势分析,神经网络既可以表现为有指导的学习也可以是无指导聚类,无论哪种,输入到神经网络中的值都是数值型的。人工神经元网络模拟人脑神经元结构,建立三大类多种神经元网络,具有非线形映射特性、信息的分布存储、并行处理和全局集体的作用、高度的自学习、自组织和自适应能力的种种优点。
6.遗传算法。遗传算法是一种受生物进化启发的学习方法,通过变异和重组当前己知的最好假设来生成后续的假设。每一步,通过使用目前适应性最高的假设的后代替代群体的某个部分,来更新当前群体的一组假设,来实现各个个体的适应性的提高。遗传算法由三个基本过程组成:繁殖(选择)是从一个旧种群(父代)选出生命力强的个体,产生新种群(后代)的过程;交叉〔重组)选择两个不同个体〔染色体)的部分(基因)进行交换,形成新个体的过程;变异(突变)是对某些个体的某些基因进行变异的过程。在数据挖掘中,可以被用作评估其他算法的适合度。
7.粗糙集。粗糙集能够在缺少关于数据先验知识的情况下,只以考察数据的分类能力为基础,解决模糊或不确定数据的分析和处理问题。粗糙集用于从数据库中发现分类规则的基本思想是将数据库中的属性分为条件属性和结论属性,对数据库中的元组根据各个属性不同的属性值分成相应的子集,然后对条件属性划分的子集与结论属性划分的子集之间上下近似关系生成判定规则。所有相似对象的集合称为初等集合,形成知识的基本成分。任何初等集合的并集称为精确集,否则,一个集合就是粗糙的(不精确的)。每个粗糙集都具有边界元素,也就是那些既不能确定为集合元素,也不能确定为集合补集元素的元素。粗糙集理论可以应用于数据挖掘中的分类、发现不准确数据或噪声数据内在的结构联系。
8.支持向量机。支持向量机(SVM)是在统计学习理论的基础上发展出来的一种新的机器学习方法。它基于结构风险最小化原则上的,尽量提高学习机的泛化能力,具有良好的推广性能和较好的分类精确性,能有效的解决过学习问题,现已成为训练多层感知器、RBF神经网络和多项式神经元网络的替代性方法。另外,支持向量机算法是一个凸优化问题,局部最优解一定是全局最优解,这些特点都是包括神经元网络在内的其他算法所不能及的。支持向量机可以应用于数据挖掘的分类、回归、对未知事物的探索等方面。
事实上,任何一种挖掘工具往往是根据具体问题来选择合适挖掘方法,很难说哪种方法好,那种方法劣,而是视具体问题而定。
三、结束语
目前,数据挖掘技术虽然得到了一定程度的应用,并取得了显著成效,但仍存在着许多尚未解决的问题。随着人们对数据挖掘技术的深人研究,数据挖掘技术必将在更加广泛的领域得到应用,并取得更加显著的效果。
关键词:数据挖掘电子商务应用
当今,国内外电子商务类网站日益兴起。许多电子商务类网站都提供了一定程度的个性化服务,比如提供商品推荐服务。而构成这些个性化服务的基础就是数据挖掘技术。
一、数据挖掘分析
1.数据挖掘的定义。数据挖掘(datamining,DM)是从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的但又是潜在有用的信息和知识的过程。包括存储和处理数据,选择处理大数据集的算法、解释结果、使结果可视化。
2.数据挖掘的方法。从商业的角度来看,数据挖掘是一种新的商业信息处理技术,其主要特点是对商业数据库中的大量业务数据进行抽取、转换、分析和其他模型化处理,从中提取辅助商业决策的关键性数据。数据挖掘的方法大致可以分成4类:关联分析、概括分析、分类分析、聚类分析。(1)关联分析:分析表面上不相关数据之间的内在联系,揭示各事之间的依赖性和相关性,分析范围包括简单关联、因果关联等。在电子商务中,用数据挖掘找到隐藏的关联规则,当客户浏览、搜索关联规则中的某种商品时,就可以在页面中以推荐商品的形式显示关联规则中的其它商品。在进货计划和促销计划中,也可以将这个因素考虑进去。(2)概括分析:即提取数据库中指定的数据集合的一般特性,找出遍性规律。(3)分类分析:设置分类规则,把各个事务或实体按照性质和特征不同进行归类,把数据层次化和规整化,从而建立数据的分类模型。(4)聚类分析:通过分析和归纳实体之间的特征差异,选出具相识特征的实体聚合成为一个类,并用某种规则来描述该类的相同属性,形成一种聚类规则,实际上,它是与分类分析法互逆的过程。
3.数据挖掘的过程。该过程从大型数据库中挖掘先前未知的、有效的、可实用的信息,并使用这些信息做出决策或丰富知识。(1)确定业务对象:清晰地定义出业务问题,认清数据挖掘的目的是数据挖掘的重要一步。挖掘的最后结构是不可预测的,但要探索的问题应是有预见的,为了数据挖掘而数据挖掘则带有盲目性,是不会成功的。(2)数据准备。数据的选择:搜索所有与业务对象有关的内部和外部数据信息,并从中选择出适用于数据挖掘应用的数据。(3)数据挖掘:对所得到的经过转换的数据进行挖掘。除了完善从选择合适的挖掘算法外,其余一切工作都能自动地完成。(4)结果分析:解释并评估结果。其使用的分析方法一般应作数据挖掘操作而定,通常会用到可视化技术。(5)知识的同化:将分析所得到的知识集成到业务信息系统的组织结构中去。
二、数据挖掘与电子商务的关系
在电子商务企业中,数据挖掘运用于客户行为分析,企业从中受益体现在以下四个方面:(1)可以发现客户和访问者的爱好、生活模式。(2)可以争取新顾客,怎样使产品适销对路、怎样给产品定价、怎样吸引单个客户、怎样优化Web网站。(3)可以用相应的信息确定顾客的消费周期,针对不同的产品制定相应的营销策略。(4)可以确定客户细分,为每一个客户的独特需求设计“量身定制”的产品。三、数据挖掘技术在电子商务中的应用
1.面向电子商务的数据挖掘系统设计。本系统电子商务平台采用基于三层体系结构构建,服务器端采用先进的J2EE平台构架,有完整的体系框架组成,具有很好的可扩展性、互联性和可维护性。因此面向电子商务的数据挖掘系统由数据库服务器、应用服务器和客户端三层组成,整个体系结构是以J2EE企业级的构建技术为基础。对数据挖掘过程中产生的数据,采用独立的数据挖掘库表存放,这样既不影响也不依赖数据挖掘的数据源。应用服务器完成所有的数据挖掘运算,通过接受客户端的设置,完成所有对数据进行探索、转换、挖掘的工作。数据挖掘系统的每个功能模块都以EJB的形式进行封装,以实现分布式计算和负载平衡等分布式计算的要求,把具有繁重计算任务的模块和用户交互模块分开。客户端要负责数据挖掘流程的创建工作、所有功能模块参数的设定以及各种可视化结果的显示。用户可以根据自己的要求任意创建各种形式的挖掘流程,同时按照需要执行某部分流程,获取相应的可视化分析结果,其系统体系结构如图所示。
面向电子商务的数据挖掘系统体系结构图
2.面向电子商务的数据挖掘系统功能设计。面向电子商务的数据挖掘系统主要以下几大功能模块:(1)用户信息分析。运用分类和聚类挖掘方法对用户的信息分析,可以得到用户的些特征。对用户分类相当于对具有某些公共属性的用户群体建立了概要特征描述,这些特征可以用来对新增的用户进行分类,可以发现未来的潜在用户并开展有针对性的商务活动,如自动给一类特定的用户发送销售邮件,当属于同一类的用户再次访问站点时为其动态地改变站点的内容等。通过这些举措使商务活动能够在一定程度上满足用户的要求,实现目标营销。(2)商品信息分析。运用关联规则挖掘发现商品访问中所有关联和相联系的规则,可以从交易事务数据库中发现商品间的相互联系。这对电子商务公司组织站点网页结构、开展有效的营销策略非常有帮助。(3)物流信息分析。采用神经网络预测技术,根据各物流配送点接到的网站用户订单来预测其库存数量。预测信息可以给物流配送中心以参考,用来合理地确定各配送点仓库的库存量,使各配送点的补货能更加合理有序,降低物流成本,节约库存费用。
四、结束语
数据挖掘是一个新兴的领域,具有广阔应用前景,目前,电子商务在我国正处于快速发展和应用阶段,利用数据挖掘技术,能够强化对客户的服务、促进市场最优化、加速资金周转、实现企业的创新发展。电子商务平台上的数据挖掘技术有待人们去进行更深入的研究工作,这将不断的推动数据挖掘技术的深入发展和广泛应用,创造出更多的社会和经济价值。
参考文献:
[1]张云涛龚铃:数据挖掘原理与技术.北京,电子工业出版社,2004年1月
[2]方真等:电子商务教程[M].北京:清华大学出版社.2004
常见数据挖掘技术包括:分类树技术、关联发现技术、聚类技术、人工神经网络、最优集合规约技术以及可视数据挖掘技术等。软件度量数据往往具有多维度、高耦合性,软件工程数据挖掘中会采用一些特殊处理技术,包括统计分析、回归建模、分类树以及神经网络等。在具体软件工程实践中,选择何种挖掘技术,其决定性因素为想要达成的目标。
2数据挖掘实现过程
通常,数据挖掘过程包括4个步骤,即选择数据、预处理、实施挖掘以及吸收数据。数据挖掘整个过程具有交互性,有时数据需要重新选择,有时也要对数据预处理进行改进,也可能出现算法反复被调整现象,基于这种特征,数据挖掘时要设置反馈环。挖掘数据第1步是将管理和目标反映到1个(或多个)挖掘任务中,整个过程可主要划分成为六种:1)评估、预测。评估包括对软件产品、过程以及资源的属性进行相应检查就是整个评估过程,同时也需要根据这些属性,赋值给未知属性,当然这些未知属性需要进行量化。评估工作完成后,要对属性值进行预测。2)分类。检查1个特定实体属性,根据结果将其划分到另1个类别或范畴(事先定义好)中。3)关联发现。关联发现能够识别出特定内容中互相存在关联某些属性。如,可将找出在软件开发属性和产品属性相互关联的内容找出来。4)聚类。将1个结构不相同的群体划分到另1个具有相同结构的子群集合中,这个过程叫做聚类,它的划分依据是成员之间具有高度相似性。5)数据可视化。数据可视化是利用可视化描述方法来定义复杂信息。6)可视数据探察。可视化数据探察是对描述工作的相应拓展,可利用数据可视化交互控制来分析和检视海量数据[3]。它应用具有可视化功能和数据挖掘技术来对数据进行处理。
3挖掘技术在软件工程中应用
上文提及到软件工程度量,部分可利用信息已在海量数据中被提取出来,但普遍认为更为有效且数量众多的数据依然在软件工程相关数据库中隐藏,而没有被发现。实际上,数据挖掘就是1种被公认为提升软件工程度量的技术。图1为数据挖掘在软件工程中的应用。
3.1数据挖掘繁荣原因1)计算机硬件系统和软件系统的基础设施建立具备发现驱动、分析数据等功能;2)每种技术都在实际应用中不断得到改进,其使用能力不断提升。如,模式识别、神经网络等有明显进步趋势;3)数据存储、贮藏、集成成本不高,海量数据可轻松获得。数据挖掘技术被人们认识,并在实践中逐渐被重视,同时也给研究和进一步提高数据挖掘技术提供了便利条件。
3.2面临挑战软件工程自身存在很多数据上的特殊性,给数据挖掘领域研究工作带来制约和影响,主要表现在以下三个方面:1)数据复杂。软件工程数据主要分为两个组成部分,即结构化数据、非结构化数据。结构化数据主要包括缺陷报告、版本信息等内容,而非结构化数据则包含数据代码、相应注释以及文档等内容。结构化数据、非结构化数据并不能同时适用一种算法,而且两种数据间还存在对应联系。如,1个缺陷报告中往往包括缺陷代码段。而结构化数据里常常涵盖部分非结构化信息,非结构化数据中亦是如此,这也是今后工作中需要重点解决的问题之一。2)非传统分析存在局限。数据挖掘最终想实现的目标就是将转化而来的信息传达给用户,实现信息共享。传统数据挖掘技术在使用过程中,信息手段比较单一,如文字、图表等表达形式。其实,软件开发商对信息的要求很高,1个统计结果根本不能满足其工作需求。为促进软件开发不断向上发展,开发人员需要相关信息作为参考依据,包括开发实际案例、编程所需模板、系统缺陷定位以及软件结构设计等。研究数据挖掘技术,提升其实际使用功能,需要不断提交新信息、新知识,并改进相应手方法。3)挖掘结果评价标准不够具体。软件工程数据挖掘尚未形成完善的结果表示体系,其评价体系也有待加强。人员在软件开发过程中需要大量信心,这些信息非常具体且复杂,表示方法不尽相同,互相之间难以做出对比,也很难用定量方法去分析挖掘结果。
4结束语
(1)确定业务对象:做好业务对象的明确是数据域挖掘的首要步骤,挖掘的最后结构是不可预测的,但是探索的问题必须是有预见的,明确业务对象可以避免数据挖掘的盲目性,从而大大提高成功率。
(2)数据准备:首先,对于业务目标相关的内部和外部数据信息进行查找,从中找出可以用于数据挖掘的信息;其次,要对数据信息的内容进行全面细致分析,确定需要进行挖掘操作的类型;然后,结合相应的挖掘算法,将数据转化称为相应的分析模型,以保证数据挖掘的顺利进行。
(3)数据挖掘:在对数据进行转化后,就可以结合相应的挖掘算法,自动完成相应的数据分析工作。
(4)结果分析:对得到的数据分析结果进行评价,结合数据挖掘操作明确分析方法,一般情况下,会用到可视化技术。
(5)知识同化:对分析得到的数据信息进行整理,统一到业务信息系统的组成结构中。这个步骤不一定能够一次完成,而且其中部分步骤可能需要重复进行。
二、数据挖掘技术在水利工程管理中的实施要点
水利工程在经济和社会发展中是非常重要的基础设施,做好水利工程管理工作,确保其功能的有效发挥,是相关管理人员需要重点考虑的问题。最近几年,随着社会经济的飞速发展,水利工程项目的数量和规模不断扩大,产生的水利科学数据也在不断增加,这些数据虽然繁琐,但是在许多科研生产活动和日常生活中都是不可或缺的。例如,在对洪涝、干旱的预防以及对生态环境问题的处理方面,获取完整的水利科学数据是首要任务。那么,针对日益繁杂的海量水利科学数据,如何对有用的信息知识进行提取呢?数据挖掘技术的应用有效的解决了这个问题,可以从海量的数据信息中,挖掘出潜在的、有利用价值的知识,为相关决策提供必要的支持。
1.强化数据库建设
要想对各类数据进行科学有效的收集和整理,就必须建立合理完善的数据库。对于水利工程而言,应该建立分类数据库,如水文、河道河情、水量调度、防洪、汛情等,确保数据的合理性、全面性和准确性,选择合适的方法,对有用数据进行挖掘。
2.合理选择数据挖掘算法
(1)关联规则挖掘算法:关联规则挖掘问题最早提出于1993年,在当前数据挖掘领域,从事务数据库中发现关联规则,已经成为一个极其重要的研究课题。关联规则挖掘的主要目的,是寻找和挖掘隐藏在各种数据之间的相互关系,通过量化的数据,来描述事务A的出现对于事务B出现可能产生的影响,关联规则挖掘就是给定一组Item以及相应的记录组合,通过对记录组合的分析,推导出Item间存在的相关性。当前对于关联规则的描述,一般是利用支持度和置信度,支出度是指产品集A、B同时出现的概率,置信度则是在事务集A出现的前提下,B出现的概率。通过相应的关联分析,可以得出事务A、B同时出现的简单规则,以及每一条规则的支持度和置信度,支持度高则表明规则被经常使用,置信度高则表明规则相对可靠,通过关联分析,可以明确事务A、B的关联程度,决定两种事务同时出现的情况。
(2)自顶而下频繁项挖掘算法:对于长频繁项,如果采用关联规则挖掘算法,需要进行大量的计算分析,不仅耗时耗力,而且影响计算的精准度,这时,就可以采用自顶而下频繁项挖掘算法,这种算法是一种相对优秀的长频繁项挖掘算法,利用了事务项目关联信息表、项目约简、关键项目以及投影数据库等新概念与投影、约简等新方法,在对候选集进行生成的过程中,应该对重复分支进行及时修剪,提升算法的实际效率,从而有效解决了长频繁项的挖掘问题。结合计算机实验以及算法分析,可以看出,这种方法是相对完善的,同时也是十分有效的。不过需要注意的是,当支持度较大、频繁项相对较短时,利用关联规则挖掘中典型的Apriori方法,可以起到更好的效果。
(3)频繁项双向挖掘算法:这种算法是一种融合了自顶向下以及自底向上的双向挖掘算法,可以较好的解决长频繁项以及段频繁项的挖掘问题,主挖掘方向是利用自顶向下挖掘策略,但是结合自底向上方法生成的非频繁项集,可以对候选集进行及时修剪,提升算法的实际效率。
三、结语
国外很多大学都开设了数据挖掘类课程,波士顿大学的“数据管理与商务智能”课程主要包括基础、核心技术、应用三部分。授课方式包括理论内容讲授、案例教学,以及学生以团队合作方式完成项目并进行课堂演讲。从麻省理工学院开放性课程资料(斯隆管理学院)中可以看出,在每章讲解一种算法之后都尽可能地安排了商务实例的分析,并在课程后期安排了客座讲座的形式。国内对于数据挖掘的教学类研究成果也很多,主要集中在三类问题的研究上,较为普遍的是根据专业建立大纲的研究,例如针对电子商务专业进行大纲设计;另外也有专注研究某一种或多种适合数据挖掘或商务智能的教学方法,如专题研讨法;还有的讨论算法理解与程序设计、软件应用的关系。
2、基于模块化方法的课程内容分析
模块化教学模式是按照程序模块化的构想和原则来设计教学内容的一整套教学体系,它是在既定的培养目标指导下,将全部教学内容按照一定标准或规则进行分解,使其成为多个相对独立的教学模块,且各教学模块之间可以按照一定的规则有选择性的重新组合。该方法在20世纪70年代,由国际劳工组织引入教学之中,开发出以现场教学为主,以技能培训为核心的模块化教学模式,在很多国家得到广泛应用。由于该教学法具有针对性、灵活性、现实性等特点,越来越受到教育界的关注。模块化教学本质上是以知识点与实践的细化为出发点研究,本课程的知识点细化分为两个层次:一是从宏观角度,参考ACM的SIGKDD的数据挖掘课程建设建议,设计课程的基础内容模块和高级主题模块;二是从微观角度,针对较为复杂的算法进行的知识点划分。课程内容的一至五章属于基础内容模块,介绍本课程的基础理论和入门的数据挖掘技术;六至第八章介于基础内容与高级主题之间,介绍数据挖掘的核心算法,可以根据学生情况进行灵活处理,可强调应用,也可深化算法介绍;第九、十章为高级主题模块,可以作为扩展材料介绍应用,或为感兴趣同学提供算法介绍;课程实践模块包含数据仓库建设与数据挖掘算法的应用,难度居中,可以在引导学生思考的前提下给出实验步骤,并引导学生使用类似的方法处理不同的数据。
3、基于模块化方法进行重要知识点的模块化分析
重要知识点内涵较为丰富,一般体现在经典数据挖掘算法上,通常一大类算法下还分有多个算法,不同算法的在难度上有渐进层次,同一种算法也有很大改进研究空间,讲授弹性比较大。因此,适合使用模块化方法进行处理,并且需要在课程设计中明确一定课时量所要达到的内容和难度。基础部分为必选内容,介绍基本概念和基本原理;决策树作为数据挖掘分类算法的最基础算法也是必选内容,决策树算法有多种分类,需要进行按照难易程度进行选择;最后要根据难度选择其他分类算法进行介绍。
4、结论
1.1结果优化中遗传算法的应用遗传算法由达尔文进化论与孟德尔遗传变异论进行模拟后得到,该算法所采用的算法因子具有随机性,故设备故障的出现往往不会受到常规故障规则的限制,但是遗传算法在实际应用过程中,其对故障的整合分析,并不是盲目式的,而是针对机械设备状态运行情况,以设备最优化为基本原则进行不断完善计算进行的。若设备状态监测和故障诊断当中,直接采用了与设备情况相应的参数进行适值计算,但又不需要对优化参数进行明确计算,在针对部分无法明确计算得到的设备参数时,即可采用遗传算法对结果进行优化。遗传算法的智能性与并行性较强,利用该方法,可以对设备故障当中还未得到有效解决的部分复杂问题进行妥善处理。目前,遗传算法在设备运行函数的优化、设备模式的识别以及设备运行信号的整合处理等相关工作当中有着较为全面的应用,在将复杂的运行数据进行优化时,遗传算法具有较为良好的性能。综合其相关特点,在建立设备状态监测和故障诊断的模型时,可采用该技术使得模型更为合理化,使得设备状态监测与故障诊断的结果更为准确。以滚动轴承的状态监测与故障诊断为例。在实际工作当中,运用各类运算符集,对滚动轴承的原始性特征向量进行测量后,采取最优的组合方式获得新型向量,配合采用遗传算法得到最终的滚动轴承参数,并利用分类法,对各项间距进行了调整,使得滚动轴承的诊断参数更为准确。此外,利用该方法,还有效区分了滚动轴承的不同工作状态,测量结果较为全面,效果显著。
1.2模糊集理论的应用要点该方法通过模糊集合与模糊推理两种方法,其研究测试的对象是各类不确定性因素,属于传统集合理论的创新。模糊集理论在设备状态监测和故障诊断中的应用,主要包含了两个方面。一方面,是在相关数据概念的形成时,采用不准确和较为模糊的语言变量,根据人们习惯,对设备状态的变化及变量变化状态进行描述。具有较强的直观性,且相关人员在接受该类概念时,也可以更方便的理解接受;另一方面,该方法通过提炼模糊性规则,在建模时模糊化,使得机械设备的控制、预测以及故障诊断等过程拥有更为广阔的空间。
1.3基于实例分析的方案优化及调整该种方法拥有较为简单的思路,在对设备未来运行情况进行预测时,系统会匹配与设备目前情况相似的实际案例,并从以往的解决方法中选出最佳的解决方案,再结合设备实际情况进行相应调整。此类方法的应用范围较广,且得到的计算结果也相对准确,但同时也具有一定缺陷,即无法全面整合以往设备数据及解决规律,缺乏充足的继承性。该方法进行故障诊断的基本理念是,在选红枣解决方法的过程中,利用历史诊断方法成功案例为奠基,进行全面的推理工作,并采用类比和联想法,较为全面的对故障进行诊断。
1.4多种数据挖掘法的联合应用除上述几种数据挖掘技术外,实际工作中还涵盖了以传统数据统计为基础的统计分析方法、人工神经网络元技术、等多种方法,考虑到每一种方法或多或少具有局限性,故为了有效提高各类方法的应用效果,可以将各类方法进行配合使用,代表性的算法组合类型如表1所示。
以遗传算法和模糊集理论的配合采用为例。由于模糊算法,主要是利用了最大隶属原理和阀值原理,故可以按照不同故障的发生原因以及故障征兆的相互联系,在综合考虑的基础上对机械设备故障的可能原因进行全面分析。而该方法在运用的过程中,会对各类故障征兆进行约简化从而得到较为普遍的规律,但是所得到的规律也可能存在不可靠问题。故在实际应用模糊集理论的同时,配合采用遗传算法,通过对模糊集理论所得到的结论及规则进行全面优化,使得诊断的结果更为准确与高效。上述案例方法在涡轮机故障诊断过程中进行应用时,可先建立完善的涡轮机故障集,在此基础上采用模糊集理论对涡轮机故障进行诊断,配合遗传算法对涡轮机故障规律进行优化,使得最终故障诊断结果更为准确。除遗传算法与模糊集理论课进行配合使用外,其他各类方法也可以根据设备实际情况进行搭配,使得最终诊断结果更为准确有效。
2结束语
1.1云计算
云计算是并行计算和分布计算以及网格计算的发展,是一种在海量数据大规模的集合中能动态处理各种服务器数据资源的一类计算平台,在电子商务、商业金融、科研开发等领域能得到广泛的应用。它具有大规模、虚拟化、高效率、通用性、廉价等特点,能针对不同的用户的不同需求,动态透明地提供其所需的虚拟化计算和资源储存,并能及时动态回收当前用户暂不利用的数据资源以提供给其他用户,而其廉价、通用的特点,使得一般用户实现大规模的数据操作成为可能。目前来说,云计算的平台已得到良好的发展,日益成熟,基于云计算的应用已经可以相当方便的部署和操作其数据资源。
1.2数据挖掘
数据挖掘技术是现代知识发现领域的一个重要技术,它是指一个从随机的大量而不完整的模糊的实际数据中提取其中某些隐含着的具有潜在价值的实用知识与信息的过程。其具体技术有特征化、聚类、关联和预测分析等等,涉及到的高级技术领域有统计学、机器学习、模式识别、人工智能等方面。
2基于云计算的数据挖掘平台构架
网络云的发展给数据挖掘提出了新的问题和时代的挑战,同时,也为数据挖掘提供了新的计算平台和发展机遇。基于云计算的数据挖掘系统平台的发现,解决了传统的数据挖掘技术出现的时代滞慢、效率较低、功能落后、成本高昂等问题。云计算是一种商业计算模式,是网格计算与并行计算及分布式计算在一定程度上的商业实现,其动态、可伸缩的计算基于云计算的数据挖掘平台架构及其关键技术探讨文/张瑶刘辉云计算是一种在互联网时代中应运而生的新兴的网络技术,具有高效率、高容量、动态处理的特点,在社会的商业领域和科研领域表现出了其相当高的应用价值。将云计算应用于数据挖掘平台的构架之中后,将能在很大程度上为现代社会中越来越海量的数据挖掘提供一个高效率的技术平台。本文将结合云计算和数据挖掘的基本概念和现代意义,对数据挖掘的平台构架和相应的关键技术做出简要的分析探讨。摘要能力使得进行高效的海量数据挖掘的目标不再遥远。同时,云计算SaaS功能日益被理解和标准化,使得基于云计算SaaS化的数据挖掘有了理论和技术的指导,并具有了企业化与大众化的发展趋势。
2.1数据挖掘平台构架
建立在关系型数据库之上的传统的数据挖掘技术构架在现时代数据急剧膨胀和分析需求渐增的发展下已经难以应付社会的数据处理问题。而云计算的分布式存储与计算形式则接受了当代的数据挖掘难题,促成了适应时代的云计算数据挖掘平台构架的形成。其包含了面向组件的设计理念和分层设计的思想方法。其构架自下向上总共分为3层,分别为底层的云计算支撑平台层、中间的数据挖掘能力层和上层的数据挖掘云服务层。
2.2基于云计算的数据挖掘平台构架各层意义
云计算支撑平台层:顾名思义,该平台层是云计算数据挖掘平台的基础处理平台,其主要具有的功能是对分布式文件存储与数据库提供资源存储,以及实行对数据的有关处理和计算功能。数据挖掘能力层:该平台结构层主要是提供挖掘的基础能力,是数据挖掘的核心支撑平台,并对数据挖掘云服务层提供能力支撑。该平台层包含了算法数据并行处理、调度引起和服务管理的框架,该平台层可以提供系统内部的数据挖掘处理和推荐算法库,亦支持第三方的数据挖掘算法工具的进入。数据挖掘云服务层:数据挖掘云服务层的主要功能是对外提供数据挖掘操作的云服务,同时也能提供基于结构化查询的语言语句访问,提供相关的解析引擎,以便于自动调用云服务。对外数据挖掘云服务能力封装的接口形式多样,包含了基于简单对象访问协议下的Webservice、XML、HTTP以及本地应用程序的编程接口等多种形式。另外,在必要的时候,云服务层的各个业务系统可以进行数据挖掘云服务的调用和组装。
3基于云计算的数据挖掘平台构架的关键技术探讨
基于云计算的数据挖掘平台构架的形成,离不开现代先进的科技技术,其中几项关键的技术应用将在这里进行简要的阐述:
3.1云计算技术
3.1.1分布式储存技术
通过采用分布式存储的方式来存储数据,是云计算技术保证数据处理高可靠性和经济性的重要保证。用可靠的软件来弥补硬件的不足,是分布式存储技术提供廉价而又海量的数据挖掘支持的重要途径。
3.1.2虚拟化技术
在云计算的环境下,数据挖掘能实现对大量的可用的虚拟化技术的应用、整合,发展出一套全面虚拟化的运行战略。云计算和虚拟化的共同组合,使数据挖掘实现了跨系统下的资源调度,将海量的来源数据进行IT资源汇合,动态地实现对用户的虚拟化资源的供给,从而以高效率、海量动态的特点完成服务任务。
3.1.3并行云计算技术
并行云计算技术是一种对于高效执行数据挖掘计算任务极其重要的技术,并且它对云计算的某些技术细节做出了封装,例如任务并行、任务调度、任务容错和系统容错以及数据分布等。该功能代替了用户对这些细节的考虑,使得研发效率得到了提高。
3.2数据汇集调度中心
数据汇集调度中心的功能主要是完成对不同类型的数据进行汇集。它实现了对接入该云计算数据挖掘平台的业务数据收集汇合,能够解决与不同数据的相关规约问题,并能支持多样的源数据格式。
3.3服务调度与管理技术
对于基于云计算的数据挖掘平台,为了使不同业务系统能够使用本计算平台,必须要提供相应的服务调度与管理功能。服务调度解决云服务下的并行互斥以及隔离等问题,以保证安全、可靠的平台的云服务。服务管理功能要实现统一的服务注册与服务暴露功能,并且支持接入第三方的数据挖掘,以更好地扩展平台的服务能力。
4结束语
档案管理对象的数量随着社会的发展而不断增加,仅仅通过传统的管理方式已不能高效管理档案,这就需要充分利用计算机网络技术。在档案管理系统中应用计算机数据挖掘技术可以确保档案信息的安全性,提高管理档案的效率,还能优化档案数据的检索。总之,基于大数据的计算机数据挖掘技术对完善档案管理系统发挥着十分重要的作用。
2基于大数据的计算机数据挖掘技术概述
基于大数据的计算机数据挖掘技术是当代新开发的一种数据处理技术,它可以从大数据中挑选出人们需要的数据。计算机数据挖掘是一个循环往复的过程,如果没有取得预期的效果,计算机数据挖掘信息处理系统就会返回上一层重新工作,直到完成目标任务为止,这种对目标的细化过程可以满足档案数据检索的需要。
3基于大数据的计算机挖掘技术在档案管理系统中的作用
3.1提高档案信息的安全性。无论是文字档案、图片档案还是其他形式的档案,都是一种宝贵的资料。越是意义重大的档案,档案管理人员就越要想方设法将其保存起来。档案的价值随着其保存时间的不断推移而增加,价值越高的档案,被使用的频率就越高,但是如果使用过于频繁的话,就会缩短档案资料的寿命,加大保存难度。除此之外,有的档案信息是保密的,在应用时如果监管不力就会导致机密泄露。由以上可见,档案的保存与使用俨然已互为对立面了。将计算机挖掘技术应用到档案管理中则对档案资料的完整性毫无影响,并且还可以提高档案信息的安全性。3.2提高档案信息管理的效率。在档案管理工作中应用计算机数据挖掘技术,可以极大改变传统档案管理模式低效率的弊端。使用计算机数据挖掘技术,大大提高了工作人员处理档案信息的速度,同样的工作使用的时间极大减少。鉴定档案是档案管理工作中的重要组成部分,传统的鉴定方式是由管理人员根据自己的经验进行主观鉴定,有时会存在有价值的档案丢失的现象。应用计算机数据挖掘技术,档案管理人员就可以利用计算机系统分析档案使用和保存的情况,促进了档案鉴定工作的发展。3.3提高了档案信息的使用效率。大部分档案信息具有一定的机密性,所以档案的借阅并不是向全社会公开的,而是有范围限制的,但是由于档案管理人员和借阅者对档案信息不熟悉,导致双方的沟通存在一定的问题,在借阅者提出申请之后,档案管理人员会将档案资料调出来,有时调出来的资料不是借阅者所需要的,还得重新调阅,类似的过程就严重浪费了双方的时间。应用计算机数据挖掘技术可以促进档案管理人员和借阅者之间的交流,让档案管理者明确借阅者需要的具体档案信息,从而形成专门的档案提供渠道,这就大大提高了档案信息的使用效率。3.4增强档案信息的服务性。加密档案信息会严重缩小它的适用范围,受当代信息化的影响,很多档案信息自身会出现一些问题,并且只能为一小部分人服务。将计算机数据挖掘技术应用到档案信息管理中,可以具体分析档案的使用情况,通过研究发现未来使用档案信息的人群,在此基础上提高档案信息的服务性。
4基于大数据的计算机数据挖掘技术在档案管理中的实际应用
4.1在档案分类管理中的应用。档案管理的基础工作就是将档案进行分类。传统的分类方法既费时又费力,工作效率极低。计算机数据挖掘技术中有一种决策树算法,它可以在最短的时间内按照一定的规则将不同属性的档案信息进行分类和整理,大大提高了档案分类工作的效率。计算机数据挖掘技术在档案分类工作中的具体流程是:从大量不同种类的数据集中选择一些数据组合成训练集,然后应用到没有进行分类的档案管理中,这样可以帮助管理者根据借阅者对档案信息的需求来对档案进行分类,同时还可以根据借阅者的需求为其推荐其他档案信息。通过这些针对性强的数据分析,可以极大缩短借阅者获取档案信息的时间,档案数据的利用价值就能充分发挥出来。4.2在档案收集管理中的应用。计算机数据挖掘技术可以根据数据库内部的数据信息描述来构建一个相应的数据模型,然后比较计算机数据样本和数据模型之间的差异,如果这二者互相吻合,就需要档案管理人员使用测试样本模型来对档案信息进行分类处理。计算机数据挖掘技术需要全面分析档案数据信息库中的数据,建立一个对已知数据有详细描述的概念模型,并与测试样本进行对比,如果一个模型测试通过,就证明这个模型可以应用在档案收集管理中。
5结语
综上所述,在科技技术不断进步的时代背景下,在档案信息管理中应用基于大数据的计算机数据挖掘技术已成为一种必然趋势,它可以极大提高档案信息管理的工作效率,促进档案管理的高效发展。除了在档案信息存储和利用上确保基本的信息查询服务外,还需要应用计算机数据挖掘技术整合档案信息,建立众多档案管理服务数据之间的关联,这样才能为档案信息管理提供更好的服务。
作者:陈皓颖 单位:昆明理工大学津桥学院
参考文献
[1]高燕飞,陈俊杰.试析计算机数据挖掘技术在档案信息管理系统中的运用[J].内蒙古师范大学学报:哲学社会科学版,2012(4):44-46.
[2]曾雪峰.计算机数据挖掘技术开发及其在档案信息管理中的运用研究[J].科技创新与应用,2016(9):285.
[3]李国强,曹巧莲,辛正宇,等.浅谈数据处理的新技术———数据挖掘[J].科技创新与生产力,2010(6).
[4]周碧珍.浅析计算机数据挖掘技术在档案信息管理系统中的应用[J].黑龙江科技信息,2009(1).
在熔炼机组优化运行的过程中,机组的运行性能指标与人员的操作水平、负荷及运行参数之间有着复杂的相互关系,这种关系在大量的生产历史数据中与机组各数据项之间关联,因此可以通过数据挖掘的方式把其中的关联关系定量的反映出来,最终反馈到实际运行中。本文结合工厂的实际情况,分析由工厂的DCS系统采集的实时运行数据,来得到用户期望的相关参数间定量的关联规则。
2交互式关联规则挖掘算法
关联规则挖掘算法在数据库的记录或对象中抽取关联性,展示了数据间位置依赖关系,其目的是寻找在大量的数据项中隐藏着的联系或相关性。其优越性在于能将用户的定制信息整合到挖掘过程中,以一种友好的方式引入约束,使挖掘出更加符合用户需要的信息,并且提高了挖掘的效率和有效性。
2.1目标数据库的确定
数据挖掘应熟悉对象的背景知识,明确挖掘的目标,根据目标确定相关数据,以此作为目标数据库,来完成对数据的预处理、挖掘和规则评价。
2.2交互式关联规则挖掘算法
表示A成立则B成立,其中给出了可信度C和支持度S。可信度C是对关联规则准确度的衡量,即在出现A的情况下出现B的概率;支持度S是对关联规则重要性的衡量,即A和B同时出现的概率。
3熔炼机组数据挖掘的实现
本文采用的是冀某工厂于2013年5月运行的数据,采样频率为2~3秒/次,采样模式为实时监测值,得到7595组数据。在分析阶段,对影响机组的主要可控参数进行了提取及预处理,参数主要包括:转速、有功功率、主蒸汽压力、调节级压力、中压缸排汽压力。以机组转速设计值为3600r/min为例来分析。对各个可控参数数据进行曲线化处理,作为分析它们之间的关联规则的数据表。上述关联规则表示,在三种负荷工况下,工厂熔炼机组有功功率与主蒸汽压力、调节级压力、中压缸排汽压力三者之间最优变化区间的关联。经分析,在机组中应用关联规则的数据挖掘技术与传统方法相比,优点是其可以对不同的可测参数进行挖掘,方法简单有效、可操作性强;运用关联规则进行挖掘,对过程能够较灵活控制,处理后的目标值直观,便于操作指导和提高运行效率。
4结论
高校作为知识密集型组织,具有大量的知识资本,其承担了创造知识、传播知识、使用知识、优化知识等职责。其拥有大量高层次人才和海量信息资源,在相关政策、科研环境方面有着独特的优势,为知识管理的执行提供了可行性。知识管理正在逐渐被各高校所接受,成为了高校改革中的重要组成部分。知识管理既是对人的管理,也是对信息的管理。通过知识管理,将信息技术对信息的处理能力与人的创新能力相结合,能为组织带来巨大的竞争力。数据挖掘技术作为一项新兴的信息技术,可对海量数据进行分析、处理,得出数据中的潜在信息。数据挖掘为知识管理的执行提供了支持,提高了知识管理的效率,有助于组织对知识的获取和共享。
2、国内外文献综述
挑选中国知网数据库,以“知识管理”为主题关键词进行精确检索,共找到 31,324 篇文献,其中 2004 年至2014 年间共发表文献 24,895 篇,近十年是知识管理领域研究的高峰期。以“高校知识管理”或“大学知识管理”为主题关键字进行精确检索,得到 248 篇相关文献,可发现针对高校的知识管理研究较少。针对结果进行二次检索,增加主题关键词“数据挖掘”得到相关文献 3 篇,表明对高校知识管理与数据挖掘技术结合的研究较少,所得文献主要观点包括:1.数据挖掘技术可用于高校知识发现;2.数据挖掘对知识管理体系建设有推动作用;3. 高校知识管理成果可通过数据挖掘技术进行评价。对国外学者的研究情况进行分析,挑选 Web ofScience 数据库。以“knowledge management”为主题关键字进行检索,共得到 62,474 篇文献,以“knowledgemanagement of college”为主题关键字检索,得到 647篇文献,再结合关键词“Data mining”,共得到文献 5 篇。由此可见,国外相关研究比国内多出近一倍,并且研究的程度深、范围广。但关于高校知识管理与具体信息技术结合应用的文献仍较少,且发表日期多为 2010 年后。
3、知识管理与数据挖掘结合的软件要求
知识管理与数据挖掘技术的结合运用对高校相关设备提出了一定的要求,包括对服务器、客户端计算机的硬件要求以及对知识管理平台、数据挖掘工具的软件要求,本文中将重点叙述软件要求。
知识管理平台要求
知识管理平台是高校知识管理的实施基础,它为高校人员提供了可视化的操作界面,其应实现的基本功能包括:1.数据接口;2.工具接口;3.数据挖掘(内置或外接);4.知识仓库;5.知识索引、推荐;6.信息检索;7.组织内交流;8. 管理评价。一个知识管理平台应分为:表现层、服务层、处理层、存储层。表现层是面向用户的可视化界面,用于人机交互,接受用户的任务;服务层对任务进行调度、处理,直接执行无需数据挖掘的任务并反馈至表现层,调度需要数据挖掘的任务至处理层;处理层负责数据预处理、数据挖掘、知识发现等功能;存储层包括校方数据库及知识仓库。具体层次如图 1 所示。根据高校组织的特征,知识管理平台应在实现基本功能的前提下具有以下特点:1. 接口质量高。高校集行政、科研、社会服务等任务于一体,需要处理海量数据,应提供接口以使用专业处理工具处理复杂任务,保证数据处理的效率与深度;2. 内置数据挖掘功能。高校所含数据种类多、范围广,对结构简单、数据量小的数据可直接使用内置数据挖掘功能处理,节省时间;3. 交流功能强。高校为知识密集型组织,其学科、职能间存在交叉,优秀的交流功能保证了知识的共享及创新。4. 完善的激励体系。激励体系不仅体现在平台的评价功能中,更体现在管理人员的管理中,通过提高人员的积极性促进知识管理进程的实施。
数据挖掘工具要求
高校所含知识从相关对象分类可分为两类:1. 管理知识,指高校各部门(教学、后勤部门等)用于高校管理的知识;2. 科研知识,指各学科的专业知识。前者主要与高校行政、管理人员相关,后者则与高校学者、教授关系更大。针对不同的用户,知识管理与数据挖掘的结合运用对数据挖掘软件提出了不同的要求。高校行政、管理人员所面对的数据多来自高校各类信息系统的记录,如:校园卡消费信息、机房上机信息,具有量大、范围广、结构一致等特点。用于该类数据挖掘的挖掘工具可内置于知识管理平台中,便于数据存取,提高挖掘速度。常用功能为预测、分类、评价三项,主要方法可选用回归分析、趋势外推、特征分类、层次分析、模糊综合评价法等。结合使用者特点,该类挖掘工具应提供独立的、具有既定模式的工作界面,减少用户与算法的接触,挖掘结果应具有较强可视性,提供图、表界面,以便用户理解。高校科研知识主要来自于学者、教授的科学研究,包括:实验数据、主观推测描述等,具有专业性强、层次深、结构复杂等特点。针对挖掘要求较低的数据,可使用知识管理平台中的内置挖掘工具,而针对挖掘要求高的数据,可选用专业数据挖掘软件,如:Intelligent Miner、QUEST 等,通过知识管理平台的接口进行对接。
4、知识管理与数据挖掘结合的具体策略
知识管理的基本职能可概括为外化、内化、中介、认知四大部分,其中前三项职能对信息技术的依赖较强,可用数据挖掘技术进行辅助。数据挖掘的过程分为条件匹配、选择、激活、应用四部分,即对数据进行预处理后,选择相关数据记录,根据用户要求选择相应技术进行数据挖掘,得出并解释数据挖掘结果,最终将这些记录应用于实践中。两者的具体结合策略如下:
辅助知识管理体系建设
知识管理本质是一个周期性管理过程,在这一过程中实现组织知识共享、创新等,最终提升组织综合实力,其中知识管理体系建设是实现知识管理的宏观条件。知识管理体系建设是一个系统、全面的工程,包括组织结构调整、确定激励制度、知识管理文化培养、成效评估等任务。数据挖掘技术,可以为知识管理体系建设提供依据,保证相关决策的科学性。数据挖掘对知识管理体系建设的帮助主要体现在以知识主管为主的知识管理部门对高校的管理、决策当中。知识管理部门收集并预处理外校、本校知识管理体系建设的相关数据,完成辅助决策的数据仓库的建设。管理人员可根据要求,从数据仓库中选择数据,利用对应模型完成挖掘,通过挖掘结果对决策做出帮助。以制定激励制度为例,管理人员选择与高校人员喜好相关的数据,如至少包含“部门”、“喜好”、“性别”字段,利用关联算法对其进行计算,即可得出各部门工作人员的喜好,以此为据制定相应激励制度。
知识外化
知识外化是指组织从组织外部获取与本组织相关的知识、发现归集组织内部存在的知识并进行存储以备用的过程。完成知识外化的关键即知识发现,其较为常用的方法包括主观归纳、隐性知识外显等。目前学界中较为认可、使用较普遍的方法即数据知识发现(KnowledgeDiscovery in Database, KDD),指从数据集中识别出表明一定模式的、有效的、潜在的信息归纳为知识的过程。这是数据挖掘与知识管理结合应用的最重要部分。同时,数据挖掘技术只给定挖掘目标,不给出假设、前提,因此在使用数据挖掘的过程中可获取一些计划外的知识,为知识管理提供一个可靠的知识源。此处存在两个前提:第一,知识发现不能仅仅依靠信息技术,更需要人员对挖掘结果进行主观归纳,解释其语义以完成知识的推理;第二,挖掘对象需进行预处理,并转化成逻辑数据。利用数据挖掘技术进行知识发现有多种可用方法:利用分类和聚类分析可提供知识索引和发现特殊情况下的离群值和孤立点,知识索引可细化知识所属领域和确定挖掘范围,离群值和孤立点可为挖掘人员提供归纳的线索,若其存在一定规律则可得出模型、规则;使用模糊技术、统计方法可得出对高校决策的评测分析,判断方案的有效性,并得出模式,用于同类决策处理;使用粗糙集和主成份分析法定义知识发现中的主要特征,结合已有知识库对不确定、不精准的知识进行细化;使用关联规则发现大量数据集各字段中潜在的联系。以关联规则的使用为例,选择 Apriori 算法,挖掘目的是发现学生学习情况中的潜在知识。首先从数据仓库中选出与学生课程成绩相关的数据集,包括姓名、院系、性别、课程号、课程类别、成绩等字段,进行预处理,将字段中的取值转化为逻辑值,代表不同语义,如:性别字段,男设值 1,女设值 2。操作人员设置最小支持度、置信度,通过数据挖掘工具进行挖掘,得出关联规则并进行解释。若结果显示 XX 院系、男生、A 类别 => 成绩优秀构成管理规则,则表示XX院系的男生对于A类别科目较感兴趣,学习成绩优秀,可在归纳后存入知识仓库。
知识内化、中介
知识内化是发现特定人员知识需求,并为其提供相应知识的过程,内化的关键是对知识的聚类、对人员的兴趣挖掘。知识中介是指组织中存在一定量无法编码储存的知识,针对这些知识,通过一定手段,将知识的需求者与知识来源进行匹配,为两者提供交流的途径。数据挖掘在知识内化、中介中所起的作用主要是对高校人员特征的挖掘。在利用数据挖掘技术发现知识后,通过知识管理平台进行分类存储、添加索引,作为备选。对高校人员数据库中数据进行挖掘,可利用聚类分析、预测模型等,得出特定人员的特长领域、兴趣爱好,从而根据先前设置的知识索引为其提供信息。若定期对人员特征数据进行挖掘,并根据结果为高校人员推送相关知识、信息,即可实现个性化推送,其推送内容由人员特征数据决定。高校组织中拥有大量教授、学者,其所拥有的知识是一笔巨大财富,加强相关领域间人员的交流、沟通,可以促进知识共享、创新,提升组织综合实力,这正是知识管理中介职能的作用。通过上文中相同的挖掘方法,在对教授、学者特征进行挖掘后,对他们的研究方向进行聚类分析,由挖掘结果,为相关人员提供合适的建议、利用知识管理平台为特征相似或同一聚类中的教授、学者提供交流的途径,进而促进知识的共享。
数据挖掘技术推动图书馆管理
图书馆是高校组织中的特殊资源,含有大量精确或模糊、成型或不成型的知识,是一种实体的知识仓库。对图书馆的有效管理有助于高校知识管理的实施。目前,已有不少图书馆专家将数据挖掘技术引入图书馆管理,提出了针对图书馆的数据挖掘应用理论。图书馆数据挖掘对象主要包括三个:1.图书信息;2.读者信息 3. 读者借阅信息。通过对三者挖掘结果的综合,可为图书馆资源建设、读者服务、个性化服务提供帮助。根据挖掘结果分析,可做到客观、合理引入资源,做到让数据说话而不是让管理人员说话,减少了管理人员个体的主观影响,使高校图书馆经费发挥最大效用;提升读者服务质量,在读者进行检索时减少等待时间,改变以往被动检索的情况,通过用户数据挖掘为用户提供主动的信息推送;提供个性化服务,以挖掘结果为依据,针对不同用户提供不同服务,比如不同的图书馆系统管理界面。
充分发挥管理职能
知识管理是一个系统工程,包含平台开发、体系构建、文化培养等,其在实践中设计大量的数据操作。数据挖掘技术可在知识管理的实践过程中为各项信息处理工作提供支撑,从而为操作人员提供便利,间接缩短知识管理的周期时间。将高校知识管理与数据挖掘技术相结合可有效促进知识管理具体操作中的工作效率。两者的结合对高校人员管理具有积极作用,数据挖掘与知识管理在实践中相互影响,提升操作人员素养。数据挖掘需要专业人员进行操作,操作人员的综合素养将决定挖掘成果的质量。知识管理可有效促进数据挖掘人员对知识的认知,使操作人员对不同要求所对应的挖掘技术、模型的选择更为准确,提升挖掘成果的质量,使知识更加清晰、独立、可接受。
5、总结
关键词 情报学;硕士论文;关键词
中图分类号G251 文献标识码A 文章编号 1674-6708(2014)114-0013-02
当前,世界各国的许多高等院校和科学研究机构都在加强对图书情报的研究,许多世界一流院校,比如Harvard University(哈佛大学)、Princeton University(普林斯顿大学)、Yale University(耶鲁大学)、Massachusetts Inst. of Technology(麻省理工学院)等都建立了比较完善的情报学教育体系。而比较而言,在我国高等院校与科研院所对图书情报学的相关研究,明显要相对落后,近年来随着改革开放的深入推进,有关情报学的招生和课题研究有所提升,并呈现出较为快速的增长态势,然而由于研究内容相对较为高深,而且研究的靶场显得较为前沿化与多元化。基于关键词对学位论文进行统计、研究与分析是文献计量学的范畴,是图书情报学研究的重要内容。即以学位文献或学位文献的某些特点为标的,以聚集梳理一定数量文献为基础,由此展开对某一时域某一领域科学技术基本状况与基本特征的研究,并由此论述和预测该领域科学技术在今后一段时期的研究趋势与特点规律态势。基于独特关键词进行图书情报领域的硕士学位论文进行分析,是情报学研究的一项重要方法,是一种将文献资料中的众多核心要素关联起来,进行统计分析的引证分析方法,其可以较为科学地评价文献所研究与发展的现状和趋势,揭示学科当时研究的热点,较为准确地评价文献所代表的学术水平。
1 研究对象数据来源
本文研究的对象定位于对国内图书情报领域这一总体框架,并于此基础上将“靶向”集中于硕士学位论文的统计、分析与研究,将“靶标”聚集到硕士学位论文的研究热点、趋势、重点、前沿以及其变化情况,从而更加清晰地梳理出我国情报学研究的发展脉络,从而为我国情报学教育发展提供参考。研究的主要数据来源集中于国内著名的学位论文收集库――中国知网CNKI学术文献总库、维普期刊资源整合服务平台与万方数据知识服务平台“三大论文数据库”,以及国内高等院校图书馆自建特色数据库。其中,中国知网CNKI和万方数据库是国内收录学位论文最为全面的数据库,因此,为了确保分析研究的数据具有较高可信度与代表性,分析研究检索的数据源即来自该两个数据库,着重定位于“学科专业名称”、“学科专业分类”选项进行检索,而检索的时间区域定位于近10年,对于两个数据库检索出来的文献,对于相同的通过采用SQL 语句进行筛选,剔除重复的以及不符合的。
由此,以“情报学”作为检索词,从中国知网CNKI数据库获得1640篇硕士论文,从万方数据库中获致1315篇硕士论文,通过SQL筛选剔除重复的以及不符合的795篇,总共获得有效国内图书情报领域硕士论文2160篇。
2 基于高频关键词的国内图书情报领域硕士学位论文特点
通过对获取到的2160篇国内图书情报领域硕士论文进行研究,综合统计论文的关键词,累计关键词有13976个,经过分析研究,去除不能表达论文主题概念的关键词3645个,共得10331个,平均每篇硕士文献关键词数为4.78个,由此可说明该统计是科学的,与国外科文献资料对关键词的标引规则相符(国内外科技期刊要求的每篇关键词应标出 3-8 个),接着对关键词的词频进行统计分析,将关键词的频度大于60作为标准,将其定义为“高频词”,通过对“高频词”的统计分析,可以非常清晰地看出,有关“知识管理”这一主题的频次最高,多达126次。无疑,这也证实了近些年来,学术界对知识管理这个方向的研究热点。此外,“电子商务”为121次、“信息化”为118次、“信息技术”为112次、“竞争情报”为102次、“信息服务”为98次、“信息检索”为96次、“数据挖掘”为87次、“数字图书”为84次、“信息资源”为79次、“电子政务”为75次、 “知识服务”为71次、“知识共享”为68次、“数据仓库”为63次,从中也反映了我国对信息化建设、知识服务、数字化建设等关注在日益提升,也验证了我国国务院学位委员会重新颁布的《授予博士、硕士学位和培养研究生的学科、专业目录》中“图书馆、情报与档案管理”的实效,表明了情报学与管理学之间渗透和结合日益加强,也可以折射出当前研究的重点、热点仍然集中在情报学基础领域,并预示着今后情报学研究的一个重点将是对网络信息资源的开发、整合与利用。
3 基于聚类共词的国内图书情报领域硕士学位论文特点
通常来说,仅仅通过孤独地察看论文的某一关键词,通常是难以有充足的理由说明该论文所研究的主题,然而通过关注两个或者两个以上的关键词,将可以给予人们更加充分的信息去把握论文的大致内容和论文的主题脉络。通过采取计算机数字高效处理作用,充分发挥Excel的数据透视功能,再次对出现次数高于60的高频出现的关键词进行“聚类性”分析,统计在同一论文中两两同时出现的关键词,从而构建出60 × 60的“聚类共词矩阵”,通过这一矩阵的研究,非常清晰地显示出“聚类共词矩阵”是一个对称矩阵,其中位于矩阵对角线上的数据显示的是某关键词自身一同出现的频次,这个一同出现的现象就实质来说,就是论文之间的相关度,对于非对角线上的数据,则表示不同关键词之间的共现频次。通过这个矩阵可以从另一个侧反题出,关键词分布既有交叉、相互渗透又具有群组分布的独立性。通过Excel的数据透视处理得到共现频次较高的有:“知识管理”为124次,“电子商务”为106次,“竞争情报”为101次,“高校图书馆”为98次,“信息服务”为92次,“数据挖掘”为87次,“数学图书馆”为83次,“信息资源”为81次,“电子政务”为79次,“知识共享”为72次,“数据仓库”为66次。由此可以看出,在国内图书情报领域硕士学位论文的研究主题中,当前基于数字化、信息化、电子化的知识管理与数据挖掘是个热点,同时也说明我国情报学教育研究的领域在不断拓宽。
综合以上,关注独特关键词下国内图书情报领域硕士学位论文研究的学科结构特点,获得了基于高频关键词的国内图书情报领域硕士学位论文特点,以及基于聚类共词的国内图书情报领域硕士学位论文特点,通过对研究结果的比较分析,得出了一些有较为充足理由支撑的结论,那就是从中可以较为清晰地得出,当前以及今后一段时期国内图书情报领域硕士学位论文研究的侧重点在于“数字化、信息化、电子化的知识管理与数据信息挖掘”。
参考文献
[1]曾学喜.网络舆情突发事件预警指标体系构建[J].情报理论与实践,2013(11).
[2]Miao Adam X,Zacharias Greg L.A computational situation assessment model for nuclear power plant operations[J].IEEE Transactions on systems,Man and Cybernetics,2011(9).
有些具有专业技术性的毕业论文写作,的确具有困难性,对于一些工程学科的学生而言,该毕业论文应当是结合设计进行的。
例如,计算机应用或者软件工程学科,就需要进行相关的系统设计,并且完成、能够成功运行才能够符合他们的毕业论文的标准。这样的毕业论文由于要基于真正的系统实现,意味着从一开始的系统框架的搭建以及数据的链接都要非常明了如何实现,才能够不断推动整体设计的进行。所以有很多工科学生因为无法独立完成这样的论文以及毕业设计内容,而尝试用多种方式进行转移。便会去寻找一些愿意有偿代做系统设计,且愿意提供毕业(设计)论文的人,这样做既可以帮助自己完成学业拿到相应的学分得以毕业,还能够学习更多的其他知识丰富人生。
但是在进行该类设计很多知识的工科毕业设计工作中,例如涉及数学小论文的知识内容、通信类相关技术论文等等,就需写作人员在开始构思整个系统的实现之前,进行必要的技术掌握,才能避免在实际研发过程中出现问题及错误。例如,在进行数据挖掘技术相关的系统设计或者模型分析的论文中,在材料准备阶段,就应当结合数据挖掘原理及技术应用的相关理论内容,探讨该类已经在期刊中所提到的相应的预警规则,针对网络安全方面的安全预警模型进行多维度的介绍。【提供】
关键词:中医证侯;研究概况;进展
【中图分类号】R255.2 【文献标识码】A 【文章编号】1672-3783(2012)05-0093-01
1 引言
辨证是中医学的特点与优势之一,也是中医药取得疗效的前提。中医是以传承性为主的实践医学,受生产技术水平的影响,前人在辨证的时候主要靠个人的临诊经验,掺杂了许多主观因素与模糊概念,加上众多的医学流派推崇不同的思辨方式,使证侯的外延与内涵愈加复杂而不可确定。随着计算机、生物技术的进步以及交叉学科的发展,中医证侯的研究开始了新局面,能否从病、证、症、生物学基础等不同层次中挖掘出其固有的规律性的联系,以确定不同证侯的概念范畴、使辨证更具重复性和临床可操作性,这成为大家所探求的方向。众多学者为此开展了不少研究工作,笔者就中医证侯近十年的研究概况进行论述并分析如下。
2 中医证侯近十年的研究概况
2.1 证侯研究成果检索结果与分析:利用“中医”、“证或证侯”、“文献”、“临床” 及“动物(实验)”等主题词检索CNKI数据库从2000-2008年所收录的论文,其中文献研究相关论文272篇,临床研究相关论文5323篇,动物实验相关论文238篇。统计结果如图1所示。从图中可以看出以下特点:1)临床研究是证侯研究的主要方式,这是由中医的临证性所决定的。2)中医古籍资源有限、研究成果转换周期较长,是导致文献研究数量低的主要原因。
2.2 证侯研究主要切入方向的研究成果检索结果与分析:在检索“证”或“证侯”研究论文的基础上,以“四诊规范”、“生物学”、“数据挖掘”等关键词结合手工进一步检索,获得近十年发表的论文中,与四诊规范研究相关的论文227篇,与生物学研究相关论文436篇,与数据挖掘相关论文220篇。其研究态势如图2所示。从图2中可以看出,相关研究论文均有逐年上升的趋势。就近十年而言,证侯生物学研究相关论文最多,数据挖掘类论文数量增长迅速。
2.3 证侯的具体研究概况
2.3.1 四诊的定性与定量研究:通过四诊收集到的症状(主要由患者自己叙述出来)、体征(由患者表现出来,通过望、闻、切可知的,包括舌象、脉象、面色、神志状况)等信息是证侯的构成基础。舌、脉和面色虽客观存在,但易受周围环境、自然光线及医者主观判断的影响,因此利用物理仪器、高分辨率的数码相机结合色彩、图谱分析软件力求量化已成为趋势。就舌象客观化而言,不少学者对舌色、苔色、舌苔的厚度与湿度、齿痕、纹理特征,甚至对舌体的胖瘦、歪斜,舌下络脉的长度、宽度、颜色进行了量化分析[2-5],具有一定的临床符合率。
此外,通过问诊所获取的信息在中医证候分类中起着重要的作用。如何控制和把握这些“软指标”,近年来不少学者也做了很多工作。有学者把社会学中的定性研究引入中医问诊领域[12],建议与患者进行深入交谈,对患者的语气、语言表达方式、神态、言语内容等进行综合分析,以期获取尽可能多的与病症相关的信息,这些信息可能容易被医生所忽视,但对证侯的判别起重要作用,能弥补定量研究的缺憾。
2.3.2 证侯生物学基础的研究:中医证侯的确立是依据表现型组资料得来的,对于现代生命科学而言,一个证候表现型的产生必然有从基因组层次到器官组层次的不同范围的功能异常[13]。从文献检索的结果来看,涉及细胞、基因层面的研究论文较多,技术相对成熟;蛋白、代谢组学层面的论文较少,研究技术有待完善。
就细胞层面而言,研究较多的是细胞因子、细胞外基质及细胞表面标志物在不同证侯下的特异表达。细胞因子的相关性研究趋于热化主要是因为:其介导细胞间相互影响、作用而形成复杂的人体调节网络,这可能是证的实质所在[14];其种类众多,功能各异,如白细胞介素、肿瘤坏死因子、趋化性细胞因子及其细胞膜受体和可溶性受体等,这些指标常见于诸多论文中;检测方法较为便利,且敏感性强。
2.3.3 利用数据挖掘方法的证侯研究:中医辨证的过程是医者凭借个人经验从患者的一系列症状、体征或生物学指征、外界环境等复杂的非线性现象[15]中提取出相互关联的、有内在规律的、特异的组合信息。数据挖掘[16]则是从大量的、不完全的、有噪声的、模糊的、随机的数据集中识别有效的、新颖的、潜在有用的,以及最终可理解的模式的非平凡过程。可以说两者在获取信息的方式与过程上有契合之处。
研究者常依据不同的研究目的及数据的特点选择不同的多元统计方式。如探讨饮食习惯、居住环境、体质因素等不同的致病因素或生物学检测指标或某一疾病下各证型的症状、体征与该证型之间的关联性多采用回归法,如进一步分析哪些症状、体征和生物学指标对区分不同的证侯有较高的贡献度,多通过逐步判别分析。
3 结语
就近年主要的研究成果来看,将宏观与微观、定性与定量的研究方式相结合是证侯研究的可行路径和发展趋势。然而如何将有一定组合规则和重叠涵盖关系的证侯要素进行合理的分解,四诊宏观信息如何定量,生物学微观指标如何定性,二者怎样结合,采用什么样的方式结合才能真正提示或反应、甚而揭示证侯的内涵,这是目前研究的困惑与癥结所在,借鉴现代计算机信息处理技术、生物学技术和多学科交叉的优势互补,可能会有所突破。
参考文献
[1] 郭蕾,王永炎,张志斌.关于证候概念的诠释.北京中医药大学学报,2002; 26(2): 5-7
[2] 卫保国,沈兰荪.舌体胖瘦的自动分析.计算机工程,2004; 30(11):25-58
[3] 卫保国,沈兰荪,蔡轶珩.舌体歪斜的自动分析.计算机工程与应用,2003; 25(10): 22-26
[4] 沙洪,赵舒,王妍,任超世. 中医脉象多信息采集系统的研制.中华中医药杂志,2007; 22(1): 21-24