Python實現決策樹對西瓜進行分類

阿新 • • 發佈：2019-01-04

使用的周志華老師書上的例子，因為習主席講過一切不給資料集的演算法都是耍流氓，所以我這裡先給出資料集：

0,色澤,根蒂,敲聲,紋理,臍部,觸感,密度,含糖率,好瓜    
1,青綠,蜷縮,濁響,清晰,凹陷,硬滑,0.697,0.46,是
2,烏黑,蜷縮,沉悶,清晰,凹陷,硬滑,0.774,0.376,是
3,烏黑,蜷縮,濁響,清晰,凹陷,硬滑,0.634,0.264,是
4,青綠,蜷縮,沉悶,清晰,凹陷,硬滑,0.608,0.318,是
5,淺白,蜷縮,濁響,清晰,凹陷,硬滑,0.556,0.215,是
6,青綠,稍蜷,濁響,清晰,稍凹,軟粘,0.403,0.237,是
7,烏黑,稍蜷,濁響,稍糊,稍凹,軟粘,0.481,0.149,是
8,烏黑,稍蜷,濁響,清晰,稍凹,硬滑,0.437,0.211,是
9,烏黑,稍蜷,沉悶,稍糊,稍凹,硬滑,0.666,0.091,否
10,青綠,硬挺,清脆,清晰,平坦,軟粘,0.243,0.267,否
11,淺白,硬挺,清脆,模糊,平坦,硬滑,0.245,0.057,否
12,淺白,蜷縮,濁響,模糊,平坦,軟粘,0.343,0.099,否
13,青綠,稍蜷,濁響,稍糊,凹陷,硬滑,0.639,0.161,否
14,淺白,稍蜷,沉悶,稍糊,凹陷,硬滑,0.657,0.198,否
15,烏黑,稍蜷,濁響,清晰,稍凹,軟粘,0.36,0.37,否
16,淺白,蜷縮,濁響,模糊,平坦,硬滑,0.593,0.042,否
17,青綠,蜷縮,沉悶,稍糊,稍凹,硬滑,0.719,0.103,否

決策樹的目的就是根據這些特徵分析出哪些因素決定了一個西瓜的好壞，首先讀取資料集，將結果儲存到dataSet,labels中。

def createDataset():
	index = [1,2,3,4,5,6,9] 
	data = pandas.read_csv(r"d:\data.csv",sep=",") 
	data = data.values
	size = len(data)
	dataSet = []
	labels = []
	for i in range(size):
		dataSet.append([])
		for j in index:
			dataSet[i].append(data[i][j])
	labels = ['色澤','根蒂','敲聲','紋理','臍部','觸感']
	return dataSet,labels

然後確定決策樹如何劃分，首先獲得資訊熵：

def calcShannonEnt(dataSet):
	numEntries = len(dataSet)
	labelCounts = {}
	number = 0
	for featVec in dataSet:
		currentLabel = featVec[-1]
		if currentLabel not in labelCounts.keys():
			labelCounts[currentLabel] = 0
		labelCounts[currentLabel] += 1
		number += 1
	shannonEnt = 0.0
	for key in labelCounts:
		prob = float(labelCounts[key])/numEntries
		shannonEnt -= prob * log(prob,2)
	return shannonEnt

利用資訊增益來決定該如何對資料集進行劃分：

def chooseBestFeatureToSplit(dataSet):
	numFeatures = len(dataSet[0]) - 1
	baseEntropy = calcShannonEnt(dataSet)
	bestInfoGain = 0.0
	bestFeature = -1
	for i in range(numFeatures):
		featList = [example[i] for example in dataSet]
		uniqueVals = set(featList)
		newEntropy = 0.0
		for value in uniqueVals:
			subDataSet = splitDataSet(dataSet, i, value)
			prob = len(subDataSet) / float(len(dataSet))
			newEntropy += prob * calcShannonEnt(subDataSet)
		infoGain = baseEntropy - newEntropy
		if infoGain > bestInfoGain:
			bestInfoGain = infoGain
			bestFeature = i
	return bestFeature

當然這裡用到一個方法對資料集進行劃分：

def splitDataSet(dataSet, axis, value):
	retDataSet = []
	for featVec in dataSet:
		if featVec[axis] == value:
			reducedFeatVec = featVec[:axis]
			reducedFeatVec.extend(featVec[axis+1:])
			retDataSet.append(reducedFeatVec)
	return retDataSet

迭代建立決策樹模型：

def majorityCnt(classList):
	classCount = {}
	for vote in classList:
		if vote not in classCount.keys():
			classCount[vote] = 0
		classCount[vote] += 1
	sortedClassCount = sorted(classCount.iteritems(), key=operator.itemgetter(1), reverse=True)
	return sortedClassCount[0][0]
def createTree(dataSet, labels):
	classList = [example[-1] for example in dataSet]
	if classList.count(classList[0]) == len(dataSet):
		return classList[0]
	if len(dataSet[0]) == 1:
		return majorityCnt(classList)
	bestFeat = chooseBestFeatureToSplit(dataSet)
	bestFeatLabel = labels[bestFeat]
	myTree = {bestFeatLabel:{}}
	del(labels[bestFeat])
	featValues = [example[bestFeat] for example in dataSet]
	uniqueVals = set(featValues)
	for value in uniqueVals:
		subLabels = labels[:] 
		myTree[bestFeatLabel][value] = createTree(splitDataSet(dataSet, bestFeat, value),subLabels)
	return myTree

最後計算得到結果：

dataSet,labels = createDataset()
tree = createTree(dataSet, labels)
print(tree)

決策樹畫出來大概是如下圖這個樣子的：

畫完才想起我電腦裡其實有viso氣死我了。

Python實現決策樹對西瓜進行分類

使用的周志華老師書上的例子，因為習主席講過一切不給資料集的演算法都是耍流氓，所以我這裡先給出資料集： 0,色澤,根蒂,敲聲,紋理,臍部,觸感,密度,含糖率,好瓜 1,青綠,蜷縮,濁響,清晰,凹陷,硬滑,0.697,0.46,是 2,烏黑,蜷縮,沉悶,清晰,凹陷,硬滑

python實現決策樹分類（三）

在上一篇文章中，我們已經構建了決策樹，接下來可以使用它用於實際的資料分類。在執行資料分類時，需要決策時以及標籤向量。程式比較測試資料和決策樹上的數值，遞迴執行直到進入葉子節點。這篇文章主要使用決策樹分類器就行分類，資料集採用UCI資料庫中的紅酒，白酒資料，主要特徵包括12

Python實現決策樹應用之判斷隱形眼鏡的型別

程式碼模組一、DecisionTreePlot # -*- coding:utf-8 -*- __author__ = 'yangxin_ryan' import matplotlib.pyplot as plt """ 定義文字框和箭頭格式【 sawtooth 波浪方框, rou

[PyTorch小試牛刀]實戰二·實現邏輯迴歸對鳶尾花進行分類

[PyTorch小試牛刀]實戰二·實現邏輯迴歸對鳶尾花進行分類程式碼使用均方根誤差 import numpy as np import pandas as pd import matplotlib.pyplot as plt import torch as t fr

python實現決策樹程式碼

資料圖片 from sklearn.feature_extraction import DictVectorizer import csv from sklearn import preprocessing from numpy import * import nu

python實現決策樹

# -*- coding: utf-8 -*- """ Created on Thu Sep 27 10:40:47 2018 @author: Administrator """ # de template # Importing the libraries impor

python實現決策樹演算法

1. #!/usr/bin/python3 import numpy as np from sklearn import tree from sklearn.metrics import precision_recall_curve from sklearn.metrics

機器學習經典演算法詳解及Python實現--決策樹（Decision Tree）

（一）認識決策樹 1，決策樹分類原理決策樹是通過一系列規則對資料進行分類的過程。它提供一種在什麼條件下會得到什麼值的類似規則的方法。決策樹分為分類樹和迴歸樹兩種，分類樹對離散變數做決策樹，迴歸樹對連續變數做決策樹。近來的調查表明決策樹也是最經常使用的資料探勘演算法，它

Python實現決策樹並且使用Graphvize視覺化

一、什麼是決策樹（decision tree）——機器學習中的一個重要的分類演算法決策樹是一個類似於資料流程圖的樹結構：其中，每個內部節點表示一個屬性上的測試，每個分支代表一個屬性輸出，而每個樹葉結點代表類或者類的分佈，樹的最頂層是根結點根據天氣情況決定出遊與否的案例二、決策

詳解決策樹、python實現決策樹

決策樹模型定義決策過程決策樹學習特徵選擇資訊增益計算方法 ID3演算法決策樹模型定義分類決策樹模型是一種描述對例項進行分類的樹形結構。決策樹由節點（Node）和有向邊（directed edge）組成。節

Python實現——決策樹實例(離散數據/香農熵)

遍歷 values 最適比例刪除類型取值 val creat 決策樹的實現太...繁瑣了。如果只是接受他的原理的話還好說，但是要想用代碼去實現比較糟心，目前運用了《機器學習實戰》的代碼手打了一遍，決定在這裏一點點摸索一下該工程。實例的代碼在使用上運用了香農熵，並

利用決策樹對微信公眾號文字進行分類

問題背景：公眾平臺的公眾號每天都會發布大量文章，通過群發圖文的形式向用戶每天推送內容。由於公眾號面向的使用者群體、專注的領域不同，圖文內容也差異很大。一些公眾號主要釋出時事政治內容，而另外一些公眾號主要釋出遊戲的視訊與周邊等。識別公眾號的內容對公眾平臺的運營與新場景應用發揮重

利用隨機森林和梯度替身決策樹對titanic資料進行分類，並對結果進行分析

import pandas as pd from sklearn.cross_validation import train_test_split from sklearn.feature_extraction import DictVectorizer from skle

【Python】決策樹的python實現

uia bmp say 不知道 times otto outlook lru bgm 【Python】決策樹的python實現 2016-12-08 數據分析師Nieson 1. 決策樹是什麽? 簡單地理解，就是根據一些 feature 進行分類，每個節點提一個問

python3 簡單實現從csv文件中讀取內容，並對內容進行分類統計

tmp spa writer ict 打開文件 while 類型 spl blog 新手python剛剛上路，在實際工作中遇到如題所示的問題，嘗試使用python3簡單實現如下，歡迎高手前來優化import csv #打開文件，用with打開可以不用去特意關閉file了

R_Studio(cart演算法決策樹)對book3.csv資料用測試集進行測試並評估模型

對book3.csv資料集，實現如下功能：　　（1）建立訓練集、測試集　　（2）用rpart包建立關於類別的cart演算法的決策樹　　（3）用測試集進行測試，並評估模型　　book3.csv資料集 se

python實現周志華西瓜書《機器學習》習題3.4 對比10折交叉驗證和留一法的對率迴歸錯誤率

這道題仍然在抄大神程式碼的基礎上寫註釋，首先感謝原始碼： https://blog.csdn.net/Snoopy_Yuan/article/details/64131129 感想是：sklearn是個好東西，如果沒有現成的驗證方法，光是10折驗證就要造10個表格才行，而用現成的庫，一

利用Python sklearn庫裡的決策樹模型生成決策樹圖片以及測試分類的準確度

本案例利用sklearn自帶的資料集，選取房子經緯度作為特徵引數來對標籤進行分類。也用切分的資料訓練模型來進行特徵引數的選擇得到最好的測試準確度。 Python原始碼： #!/usr/bin/env python # encoding: utf-8 """ @Company：華中科技大

SVM+HOG對影象進行分類（MATLAB實現）

網上看到關於用opencv對影象進行分類的不少，這次用MATLAB做了些嘗試，影象資料集為:，其他MATLAB版本http://blog.csdn.net/libin88211/article/details/19968205 ，點選開啟連結，http://blog.csd

python機器學習實戰2：實現決策樹

1.決策樹的相關知識在之前的接觸中決策樹直觀印象應該就是if-else的迴圈，if會怎麼樣，else之後再繼續if-else直至最終的結果。在上節講的kNN它其實已經可以完成很多工，但是它最大的缺點就是無法給資料集的內在含義，決策樹的主要優勢在於資料形式非常

Python實現決策樹對西瓜進行分類

相關推薦