樸素貝葉斯python程式碼實現（西瓜書）

摘要：

樸素貝葉斯也是機器學習中一種非常常見的分類方法，對於二分類問題，並且資料集特徵為離散型屬性的時候，
使用起來非常的方便。原理簡單，訓練效率高，擬合效果好。

樸素貝葉斯

貝葉斯公式：

樸素貝葉斯之所以稱這為樸素，是因為假設了各個特徵是相互獨立的，因此假定下公式成立：

則樸素貝葉斯演算法的計算公式如下：

在實際計算中，上面的公式會做如下略微改動：

由於某些特徵屬性的值P(Xi|Ci)可能很小，多個特徵的p值連乘後可能被約等於0。可以公式兩邊取log然後變乘法為加法，避免類乘問題。
P(Ci) 和P(Xi|Ci) 一般不直接使用樣本的頻率計算出來，一般會使用拉普拉斯平滑。

上面公式中，Dc為該類別的頻數，N表示所有類別的可能數。

上面公式中，Dc,xi為該特徵對應屬性的頻數，Dc為該類別的頻數，Ni表示該特徵的可能的屬性數。

對應的西瓜書資料集為

色澤  根蒂  敲聲  紋理  臍部  觸感  好瓜
青綠  蜷縮  濁響  清晰  凹陷  硬滑  是
烏黑  蜷縮  沉悶  清晰  凹陷  硬滑  是
烏黑  蜷縮  濁響  清晰  凹陷  硬滑  是
青綠  蜷縮  沉悶  清晰  凹陷  硬滑  是
淺白  蜷縮  濁響  清晰  凹陷  硬滑  是
青綠  稍蜷  濁響  清晰  稍凹  軟粘  是
烏黑  稍蜷  濁響  稍糊  稍凹  軟粘  是
烏黑  稍蜷  濁響  清晰  稍凹  硬滑  是
烏黑  稍蜷  沉悶  稍糊  稍凹  硬滑  否
青綠  硬挺  清脆  清晰  平坦  軟粘  否
淺白  硬挺  清脆  模糊  平坦  硬滑  否
淺白  蜷縮  濁響  模糊  平坦  軟粘  否
青綠  稍蜷  濁響  稍糊  凹陷  硬滑  否
淺白  稍蜷  沉悶  稍糊  凹陷  硬滑  否
烏黑  稍蜷  濁響  清晰  稍凹  軟粘  否
淺白  蜷縮  濁響  模糊  平坦  硬滑  否
青綠  蜷縮  沉悶  稍糊  稍凹  硬滑  否

python實現

#encoding:utf-8

import pandas as pd
import numpy  as np

class NaiveBayes:
    def __init__(self):
        self.model = {}#key 為類別名 val 為字典PClass表示該類的該類，PFeature:{}對應對於各個特徵的概率
    def calEntropy(self, y): # 計算熵
        valRate = y.value_counts().apply(lambda x : x / y.size) # 頻次彙總 得到各個特徵對應的概率
        valEntropy = np.inner(valRate, np.log2(valRate)) * -1
        return valEntropy

    def fit(self, xTrain, yTrain = pd.Series()):
        if not yTrain.empty:#如果不傳，自動選擇最後一列作為分類標籤
            xTrain = pd.concat([xTrain, yTrain], axis=1)
        self.model = self.buildNaiveBayes(xTrain) 
        return self.model
    def buildNaiveBayes(self, xTrain):
        yTrain = xTrain.iloc[:,-1]
        
        yTrainCounts = yTrain.value_counts()# 頻次彙總 得到各個特徵對應的概率

        yTrainCounts = yTrainCounts.apply(lambda x : (x + 1) / (yTrain.size + yTrainCounts.size)) #使用了拉普拉斯平滑
        retModel = {}
        for nameClass, val in yTrainCounts.items():
            retModel[nameClass] = {'PClass': val, 'PFeature':{}}

        propNamesAll = xTrain.columns[:-1]
        allPropByFeature = {}
        for nameFeature in propNamesAll:
            allPropByFeature[nameFeature] = list(xTrain[nameFeature].value_counts().index)
        #print(allPropByFeature)
        for nameClass, group in xTrain.groupby(xTrain.columns[-1]):
            for nameFeature in propNamesAll:
                eachClassPFeature = {}
                propDatas = group[nameFeature]
                propClassSummary = propDatas.value_counts()# 頻次彙總 得到各個特徵對應的概率
                for propName in allPropByFeature[nameFeature]:
                    if not propClassSummary.get(propName):
                        propClassSummary[propName] = 0#如果有屬性滅有，那麼自動補0
                Ni = len(allPropByFeature[nameFeature])
                propClassSummary = propClassSummary.apply(lambda x : (x + 1) / (propDatas.size + Ni))#使用了拉普拉斯平滑
                for nameFeatureProp, valP in propClassSummary.items():
                    eachClassPFeature[nameFeatureProp] = valP
                retModel[nameClass]['PFeature'][nameFeature] = eachClassPFeature

        return retModel
    def predictBySeries(self, data):
        curMaxRate = None
        curClassSelect = None
        for nameClass, infoModel in self.model.items():
            rate = 0
            rate += np.log(infoModel['PClass'])
            PFeature = infoModel['PFeature']
            
            for nameFeature, val in data.items():
                propsRate = PFeature.get(nameFeature)
                if not propsRate:
                    continue
                rate += np.log(propsRate.get(val, 0))#使用log加法避免很小的小數連續乘，接近零
                #print(nameFeature, val, propsRate.get(val, 0))
            #print(nameClass, rate)
            if curMaxRate == None or rate > curMaxRate:
                curMaxRate = rate
                curClassSelect = nameClass
            
        return curClassSelect
    def predict(self, data):
        if isinstance(data, pd.Series):
            return self.predictBySeries(data)
        return data.apply(lambda d: self.predictBySeries(d), axis=1)

dataTrain = pd.read_csv("xiguadata.csv", encoding = "gbk")

naiveBayes = NaiveBayes()
treeData = naiveBayes.fit(dataTrain)

import json
print(json.dumps(treeData, ensure_ascii=False))

pd = pd.DataFrame({'預測值':naiveBayes.predict(dataTrain), '正取值':dataTrain.iloc[:,-1]})
print(pd)
print('正確率:%f%%'%(pd[pd['預測值'] == pd['正取值']].shape[0] * 100.0 / pd.shape[0]))

輸出

{"否": {"PClass": 0.5263157894736842, "PFeature": {"色澤": {"淺白": 0.4166666666666667, "青綠": 0.3333333333333333, "烏 黑": 0.25}, "根蒂": {"稍蜷": 0.4166666666666667, "蜷縮": 0.3333333333333333, "硬挺": 0.25}, "敲聲": {"濁響": 0.4166666666666667, "沉悶": 0.3333333333333333, "清脆": 0.25}, "紋理": {"稍糊": 0.4166666666666667, "模糊": 0.3333333333333333, "清晰": 0.25}, "臍部": {"平坦": 0.4166666666666667, "稍凹": 0.3333333333333333, "凹陷": 0.25}, "觸感": {"硬滑": 0.6363636363636364, "軟粘": 0.36363636363636365}}}, "是": {"PClass": 0.47368421052631576, "PFeature": {"色澤": {"烏黑": 0.45454545454545453, "青綠": 0.36363636363636365, "淺白": 0.18181818181818182}, "根蒂": {"蜷縮": 0.5454545454545454, "稍蜷": 0.36363636363636365, "硬挺": 0.09090909090909091}, "敲聲": {"濁響": 0.6363636363636364, "沉悶": 0.2727272727272727, "清脆": 0.09090909090909091}, "紋理": {"清晰": 0.7272727272727273, "稍糊": 0.18181818181818182, "模糊": 0.09090909090909091}, "臍 部": {"凹陷": 0.5454545454545454, "稍凹": 0.36363636363636365, "平坦": 0.09090909090909091}, "觸感": {"硬滑": 0.7, "軟粘": 0.3}}}}
   預測值 正取值
0    是   是
1    是   是
2    是   是
3    是   是
4    是   是
5    是   是
6    否   是
7    是   是
8    否   否
9    否   否
10   否   否
11   否   否
12   是   否
13   否   否
14   是   否
15   否   否
16   否   否
正確率:82.352941%

總結：

貝葉斯分類器是一種生成式模型，不是直接擬合分類結果，而是擬合出後驗概率公式計算對應分類的概率。
本文只介紹了二分類，也可以用來處理多分類問題。
對於小規模資料集，表現良好。
建立在特徵相互獨立的假設上。
這是我的github主頁https://github.com/fanchy，有些有意思的分享。

樸素貝葉斯python程式碼實現（西瓜書）

樸素貝葉斯python程式碼實現（西瓜書）摘要：樸素貝葉斯也是機器學習中一種非常常見的分類方法，對於二分類問題，並且資料集特徵為離散型屬性的時候，使用起來非常的方便。原理簡單，訓練效率高，擬合效果好。樸素貝葉斯貝葉斯公式：樸素貝葉斯之所以稱這為樸素，是因為假設了各個特徵是相互獨立的，因此假定下

決策樹ID3原理及R語言python程式碼實現（西瓜書）

決策樹ID3原理及R語言python程式碼實現（西瓜書）摘要：決策樹是機器學習中一種非常常見的分類與迴歸方法，可以認為是if-else結構的規則。分類決策樹是由節點和有向邊組成的樹形結構，節點表示特徵或者屬性，而邊表示的是屬性值，邊指向的葉節點為對應的分類。在對樣本的分類過程中，由頂向下，根據特徵或屬性

【樸素貝葉斯】實戰樸素貝葉斯_程式碼實現_訓練演算法

說一下Train函式的實現。在上文中，我提到過，樸素貝葉斯也有兩種模型：貝努力模型和多項式模型。小弟第一次實現樸素貝葉斯，就老老實實按照基本原理做了一個貝努力模型；多項式模型也不難，變通一下就行。不廢話了，直接上程式碼了，有點長，不過很容易看懂： bool Naiv

資料探勘十大演算法（九）：樸素貝葉斯 python和sklearn實現

第三個演算法終於算是稍有了解了，其實當你結合資料瞭解了它的實現原理後，你會發現確實很樸素。這裡對樸素貝葉斯演算法做一個介紹和總結，包括（原理、一個程式碼示例、sklearn實現），皆為親自實踐後的感悟，下面進入正文。原理：首先我們需要了解概率論的一些簡單知識：

機器學習實戰——樸素貝葉斯Python實現記錄

問題：regEx= re.compile('\\W*') 屬於列印錯誤。正確： regEx = re.compile('\W*') regEx = re.compile('\W*') 關於'\W' 和'\w'區別，可參考部落格：https://

【機器學習實戰—第4章：基於概率論的分類方法：樸素貝葉斯】程式碼報錯（python3）

1、報錯：UnicodeDecodeError: ‘gbk’ codec can’t decode byte 0xae in position 199: illegal multibyte sequence 原因：這是檔案編碼的問題，檔案中有非法的多位元組字元。解決辦法：開啟Ch04\

學習筆記——Kaggle_Digit Recognizer (樸素貝葉斯 Python實現）

本文是個人學習筆記，該篇主要學習樸素貝葉斯演算法概念，並應用sklearn.naive_bayes演算法包解決Kaggle入門級Digit Recognizer。貝葉斯定理對於貝葉斯定理的瞭解和學習大部分都是從概率論開始的，但實際貝葉斯

各種機器學習方法（線性迴歸、支援向量機、決策樹、樸素貝葉斯、KNN演算法、邏輯迴歸）實現手寫數字識別並用準確率、召回率、F1進行評估

本文轉自：http://blog.csdn.net/net_wolf_007/article/details/51794254 前面兩章對資料進行了簡單的特徵提取及線性迴歸分析。識別率已經達到了85%，完成了數字識別的第一步：資料探測。這一章要做的就各

基於的樸素貝葉斯的文字分類（附完整程式碼(spark/java）

本文主要包括以下內容： 1）模型訓練資料生成（demo） 2 ) 模型訓練（spark+java）,資料儲存在hdfs上 3）預測資料生成（demo） 4）使用生成的模型進行文字分類。一、訓練資料生成 spark mllib模型訓練的輸入資料格

樸素貝葉斯 python 實現

百度文庫文庫2 機器學習實戰的樸素貝葉斯的程式碼太複雜 """ Created on Thu Aug 10 15:08:59 2017 @author: luogan """ #coding=gbk #Naive Bayes #Calculate

樸素貝葉斯Python實現

貝葉斯定理： from math import * from numpy import * import random 建立資料集和標籤 def loadData(): postingList

機器學習演算法-樸素貝葉斯Python實現

引文：前面提到的K最近鄰演算法和決策樹演算法，資料例項最終被明確的劃分到某個分類中，下面介紹一種不能完全確定資料例項應該劃分到哪個類別，或者說只能給資料例項屬於給定分類的概率。基於貝葉斯決策理論的分類方法之樸素貝葉斯優點：在資料較少的情況下仍然有效

樸素貝葉斯python小樣本實例

else take dataset 核心 inpu lis def hle 模型樸素貝葉斯優點：在數據較少的情況下仍然有效，可以處理多類別問題缺點：對於輸入數據的準備方式較為敏感適用數據類型：標稱型數據樸素貝葉斯決策理論的核心思想：選擇具有最高概率的決策樸素貝葉斯的一般過

樸素貝葉斯分類MATLAB實現

原理：首先將資料分成訓練集和測試集，計算測試集中每個類的先驗概率（就是每個類在訓練集中佔的比例），然後為樣本的每個屬性估計條件概率（就是屬性值相同的樣本在每一類中佔的比例）為了方便理解請看下面的例子：（直接用的周志華機器學習那本書上的資料）現在有一個西瓜，它的屬性值如下，讓判斷

【ML學習筆記】樸素貝葉斯演算法的demo（機器學習實戰例子）

礙於這學期課程的緊迫，現在需要儘快從課本上掌握一些ML演算法，我本不想經過danger zone，現在看來卻只能儘快進入danger zone，數學理論上的缺陷只能後面找時間彌補了。如果你在讀這篇文章，希望你不要走像我一樣的道路，此舉實在是出於無奈，儘量不要去做一個心

基於樸素貝葉斯分類演算法實現垃圾郵箱分類

貝葉斯決策理論在機器學習中，樸素貝葉斯是基於貝葉斯決策的一種簡單形式,下面給出貝葉斯的基本公式，也是最重要的公式：其中X是一個m*n的矩陣，m為他的樣本數，n為特徵的個數，即我們要求的是：在已知的樣本情況下的條件概率。 )表示

4.樸素貝葉斯分類器實現－matlab

實現樸素貝葉斯分類器，並且根據李航《統計機器學習》第四章提供的資料訓練與測試，結果與書中一致分別實現了樸素貝葉斯以及帶有laplace平滑的樸素貝葉斯 %書中例題實現樸素貝葉斯 %特徵1的取值集合 A1=[1;2;3]; %特徵2的取值集合 A2=[4;5;6];%S M L AValue

機器學習之樸素貝葉斯分類器實現

問題如下比如：有如下的需求，要判斷某一句英語是不是侮辱性語句分析思路對於機器來說，可能不容易分辨出某一句話是不是侮辱性的句子，但是機器可以機械的進行分析，何為機械的進行分析，就是判斷某一個句子中侮辱性的單詞是不是達到一定數量（當然這

樸素貝葉斯演算法Java 實現

對於樸素貝葉斯演算法相信做資料探勘和推薦系統的小夥們都耳熟能詳了，演算法原理我就不囉嗦了。我主要想通過java程式碼實現樸素貝葉斯演算法，思想： 1. 用javabean +Arraylist 對於訓練資料儲存 2. 對於樣本資料訓練具體的程式碼如下：package NB

樸素貝葉斯的JAVA實現

現放程式碼，後加註釋 package com.gk.dmMethod; import java.io.BufferedReader; import java.io.FileNotFoundException; import java.io.FileRea

樸素貝葉斯python程式碼實現（西瓜書）

樸素貝葉斯python程式碼實現（西瓜書）

摘要：