数据挖掘新人必看：类别与分析步骤的基础知识

调研工厂 • 2022-12-11 06:27:10 • 问卷技巧

数据挖掘旨在从大量的、不完全的、有噪声的、模糊的、随机的数据中, 提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识。还有很多和这一术语相近似的术语，如从数据库中发现知识、数据分析、数据融合以及决策支持等。

基本任务：数据挖掘的任务主要是关联分析、聚类分析、分类、预测、时序模式和偏差分析等。

1. 关联分析 association analysis　　

关联规则挖掘由Rakesh Apwal等人首先提出。两个或两个以上变量的取值之间存在的规律性称为关联。数据关联是数据库中存在的一类重要的、可被发现的知识。关联分为简单关联、时序关联和因果关联。关联分析的目的是找出数据库中隐藏的关联网。一般用支持度和可信度两个阀值来度量关联规则的相关性，还不断引入兴趣度、相关性等参数，使得所挖掘的规则更符合需求。

2. 聚类分析 clustering

聚类是把数据按照相似性归纳成若干类别，同一类中的数据彼此相似，不同类中的数据相异。聚类分析可以建立宏观的概念，发现数据的分布模式，以及可能的数据属性之间的相互关系。

3. 分类 classification

分类就是找出一个类别的概念描述，它代表了这类数据的整体信息，即该类的内涵描述，并用这种描述来构造模型，一般用规则或决策树模式表示。分类是利用训练数据集通过一定的算法而求得分类规则。分类可被用于规则描述和预测。

4. 预测 predication

预测是利用历史数据找出变化规律，建立模型，并由此模型对未来数据的种类及特征进行预测。预测关心的是精度和不确定性，通常用预测方差来度量。

5. 时序模式 time-series pattern

时序模式是指通过时间序列搜索出的重复发生概率较高的模式。与回归一样，它也是用己知的数据预测未来的值，但这些数据的区别是变量所处时间的不同。

6. 偏差分析 deviation

在偏差中包括很多有用的知识，数据库中的数据存在很多异常情况，发现数据库中数据存在的异常情况是非常重要的。偏差检验的基本方法就是寻找观察结果与参照之间的差别。

数据挖掘的过程可以分为6个步骤：

01. 理解业务：从商业的角度理解项目目标和需求，将其转换成一种数据挖掘的问题定义，设计出达到目标的一个初步计划。

02. 理解数据：收集初步的数据，进行各种熟悉数据的活动。包括数据描述，数据探索和数据质量验证等。

03. 准备数据：将最初的原始数据构造成最终适合建模工具处理的数据集。包括表、记录和属性的选择，数据转换和数据清理等。

04. 建模：选择和应用各种建模技术，并对其参数进行优化。

05. 模型评估：对模型进行较为彻底的评价，并检查构建模型的每个步骤，确认其是否真正实现了预定的商业目的。

06. 模型部署：创建完模型并不意味着项目的结束，即使模型的目的是为了增进对数据的了解，所获得的知识也要用一种用户可以使用的方式来组织和表示。通常要将活动模型应用到决策制订的过程中去。该阶段可以简单到只生成一份报告，也可以复杂到在企业内实施一个可重复的数据挖掘过程。控制得到普遍承认。

人工智能研究领域的科学家普遍认为，下一个人工智能应用的重要课题之一，将是以机器学习算法为主要工具的大规模的数据库知识发现。尽管数据挖掘还是一个很新的研究课题，但它所固有的为企业创造巨大经济效益的潜力，已使其很快有了许多成功的应用，具有代表性的应用领域有市场预测、投资、制造业、银行、通讯等。

数据挖掘汇集了来自机器学习、模式识别、数据库、统计学、人工智能以及管理信息系统等各学科的成果，多学科的相互交融和相互促进，使得这一新学科得以蓬勃发展，而且已初具规模。

END

任务广场免费收集样本数据👇

戳“阅读原文”进入官网免费使用~

调研丨2021年清明群众祭扫服务满意度调查

上一篇

百科 | 用户研究的几大误区（上）

下一篇

Demo体验

联系我们

查询中外政府统计权威数据

立即体验

发现全球百家权威智库研究成果

立即体验

感知全球媒体传播态势

立即体验
政企定制
- 客户体验管理CEM
- 医院随访系统
- 样本服务
- 版本介绍
  - App下载
- 调研专栏
使用场景
- 关于我们
  - 我们的服务
  - 关于我们
- 联系我们
  - 客服热线：185-1182-1229
  - 邮箱：contact@survey.work
  - 地址：北京市海淀区北三环中路44号院
  - 企业入驻联系