資料科學和人工智慧技術筆記五、文字預處理

阿新 • • 發佈：2018-11-15

五、文字預處理

作者：Chris Albon

譯者：飛龍

協議：CC BY-NC-SA 4.0

詞袋

# 載入庫
import numpy as np
from sklearn.feature_extraction.text import CountVectorizer
import pandas as pd

# 建立文字
text_data = np.array(['I love Brazil. Brazil!',
                      'Sweden is best',
                      'Germany beats both' 
])

# 建立詞袋特徵矩陣
count = CountVectorizer()
bag_of_words = count.fit_transform(text_data)

# 展示特徵矩陣
bag_of_words.toarray()

'''
array([[0, 0, 0, 2, 0, 0, 1, 0],
       [0, 1, 0, 0, 0, 1, 0, 1],
       [1, 0, 1, 0, 1, 0, 0, 0]], dtype=int64) 
'''

# 獲取特徵名稱
feature_names = count.get_feature_names()

# 檢視特徵名稱
feature_names

# ['beats', 'best', 'both', 'brazil', 'germany', 'is', 'love', 'sweden']  


# 建立資料幀
pd.DataFrame(bag_of_words.toarray(), columns=feature_names)

	beats	best	both	brazil	germany	is	love	sweden
0	0	0	0	2	0	0	1	0
1	0	1	0	0	0	1	0	1
2	1	0	1	0	1	0	0	0

解析 HTML

# 載入庫
from bs4 import BeautifulSoup

# 建立一些 HTML 程式碼
html = "<div class='full_name'><span style='font-weight:bold'>Masego</span> Azra</div>"

# 解析 html
soup = BeautifulSoup(html, "lxml")

# 尋找帶有 "full_name" 類的 <div>，展示文字
soup.find("div", { "class" : "full_name" }).text

# 'Masego Azra'

移除標點

# 載入庫
import string
import numpy as np

# 建立文字
text_data = ['Hi!!!! I. Love. This. Song....', 
             '10000% Agree!!!! #LoveIT', 
             'Right?!?!']

# 建立函式，使用 string.punctuation 移除所有標點
def remove_punctuation(sentence: str) -> str:
    return sentence.translate(str.maketrans('', '', string.punctuation))

# 應用函式
[remove_punctuation(sentence) for sentence in text_data]

# ['Hi I Love This Song', '10000 Agree LoveIT', 'Right']

移除停止詞

# 載入庫
from nltk.corpus import stopwords

# 你第一次需要下載停止詞的集合
import nltk
nltk.download('stopwords')

'''
[nltk_data] Downloading package stopwords to
[nltk_data]     /Users/chrisalbon/nltk_data...
[nltk_data]   Package stopwords is already up-to-date!

True 
'''

# 建立單詞標記
tokenized_words = ['i', 'am', 'going', 'to', 'go', 'to', 'the', 'store', 'and', 'park']

# 載入停止詞
stop_words = stopwords.words('english')

# 展示停止詞
stop_words[:5]

# ['i', 'me', 'my', 'myself', 'we'] 

# 移除停止詞
[word for word in tokenized_words if word not in stop_words]

# ['going', 'go', 'store', 'park']

替換字元

# 匯入庫
import re

# 建立文字
text_data = ['Interrobang. By Aishwarya Henriette',
             'Parking And Going. By Karl Gautier',
             'Today Is The night. By Jarek Prakash']

# 移除句號
remove_periods = [string.replace('.', '') for string in text_data]

# 展示文字
remove_periods

'''
['Interrobang By Aishwarya Henriette',
 'Parking And Going By Karl Gautier',
 'Today Is The night By Jarek Prakash'] 
'''

# 建立函式
def replace_letters_with_X(string: str) -> str:
    return re.sub(r'[a-zA-Z]', 'X', string)

# 應用函式
[replace_letters_with_X(string) for string in remove_periods]

'''
['XXXXXXXXXXX XX XXXXXXXXX XXXXXXXXX',
 'XXXXXXX XXX XXXXX XX XXXX XXXXXXX',
 'XXXXX XX XXX XXXXX XX XXXXX XXXXXXX'] 
'''

詞幹提取

# 載入庫
from nltk.stem.porter import PorterStemmer

# 建立單詞標記
tokenized_words = ['i', 'am', 'humbled', 'by', 'this', 'traditional', 'meeting']

詞幹提取通過識別和刪除詞綴（例如動名詞）同時保持詞的根本意義，將詞語簡化為詞幹。 NLTK 的PorterStemmer實現了廣泛使用的 Porter 詞幹演算法。

# 建立提取器
porter = PorterStemmer()

# 應用提取器
[porter.stem(word) for word in tokenized_words]

# ['i', 'am', 'humbl', 'by', 'thi', 'tradit', 'meet']

移除空白

# 建立文字
text_data = ['   Interrobang. By Aishwarya Henriette     ',
             'Parking And Going. By Karl Gautier',
             '    Today Is The night. By Jarek Prakash   ']

# 移除空白
strip_whitespace = [string.strip() for string in text_data]

# 展示文字
strip_whitespace

'''
['Interrobang. By Aishwarya Henriette',
 'Parking And Going. By Karl Gautier',
 'Today Is The night. By Jarek Prakash'] 
'''

詞性標籤

# 載入庫
from nltk import pos_tag
from nltk import word_tokenize

# 建立文字
text_data = "Chris loved outdoor running"

# 使用預訓練的詞性標註器
text_tagged = pos_tag(word_tokenize(text_data))

# 展示詞性
text_tagged

# [('Chris', 'NNP'), ('loved', 'VBD'), ('outdoor', 'RP'), ('running', 'VBG')]

輸出是一個元組列表，包含單詞和詞性的標記。 NLTK 使用 Penn Treebank 詞性標籤。

標籤	詞性
NNP	專有名詞，單數
NN	名詞，單數或集體
RB	副詞
VBD	動詞，過去式
VBG	動詞，動名詞或現在分詞
JJ	形容詞
PRP	人稱代詞

TF-IDF

# 載入庫
import numpy as np
from sklearn.feature_extraction.text import TfidfVectorizer
import pandas as pd

# 建立文字
text_data = np.array(['I love Brazil. Brazil!',
                      'Sweden is best',
                      'Germany beats both'])

# 建立 tf-idf 特徵矩陣
tfidf = TfidfVectorizer()
feature_matrix = tfidf.fit_transform(text_data)

# 展示 tf-idf 特徵矩陣
feature_matrix.toarray()

'''
array([[ 0.        ,  0.        ,  0.        ,  0.89442719,  0.        ,
         0.        ,  0.4472136 ,  0.        ],
       [ 0.        ,  0.57735027,  0.        ,  0.        ,  0.        ,
         0.57735027,  0.        ,  0.57735027],
       [ 0.57735027,  0.        ,  0.57735027,  0.        ,  0.57735027,
         0.        ,  0.        ,  0.        ]]) 
'''

# 展示 tf-idf 特徵矩陣
tfidf.get_feature_names()

# ['beats', 'best', 'both', 'brazil', 'germany', 'is', 'love', 'sweden'] 

# 建立資料幀
pd.DataFrame(feature_matrix.toarray(), columns=tfidf.get_feature_names())

	beats	best	both	brazil	germany	is	love	sweden
0	0.00000	0.00000	0.00000	0.894427	0.00000	0.00000	0.447214	0.00000
1	0.00000	0.57735	0.00000	0.000000	0.00000	0.57735	0.000000	0.57735
2	0.57735	0.00000	0.57735	0.000000	0.57735	0.00000	0.000000	0.00000

文字分詞

# 載入庫
from nltk.tokenize import word_tokenize, sent_tokenize

# 建立文字
string = "The science of today is the technology of tomorrow. Tomorrow is today."

# 對文字分詞
word_tokenize(string)

'''
['The',
 'science',
 'of',
 'today',
 'is',
 'the',
 'technology',
 'of',
 'tomorrow',
 '.',
 'Tomorrow',
 'is',
 'today',
 '.'] 
'''

# 對句子分詞
sent_tokenize(string)

# ['The science of today is the technology of tomorrow.', 'Tomorrow is today.']

資料科學和人工智慧技術筆記五、文字預處理

五、文字預處理作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 詞袋 # 載入庫 import numpy as np from sklearn.feature_extraction.text import Coun

資料科學和人工智慧技術筆記四、影象預處理

四、影象預處理作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 影象二值化 # 載入庫 import cv2 import numpy as np from matplotlib import pyplot as plt

資料科學和人工智慧技術筆記六、日期時間預處理

六、日期時間預處理作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 把日期和時間拆成多個特徵 # 載入庫 import pandas as pd # 建立資料幀 df = pd.DataFrame() # 建立五個日期

資料科學和人工智慧技術筆記三、資料預處理

三、資料預處理作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 為 Scikit-Learn 轉換 Pandas 類別資料 # 匯入所需的庫 from sklearn import preprocessing import

資料科學和人工智慧技術筆記二、資料準備

二、資料準備作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 從字典載入特徵 from sklearn.feature_extraction import DictVectorizer staff = [{'name':

資料科學和人工智慧技術筆記一、向量、矩陣和陣列

一、向量、矩陣和陣列作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 轉置矩陣或向量 # 載入庫 import numpy as np # 建立向量 vector = np.array([1, 2, 3, 4, 5, 6

資料科學和人工智慧技術筆記九、模型驗證

九、模型驗證作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 準確率 # 載入庫 from sklearn.model_selection import cross_val_score from sklearn.li

資料科學和人工智慧技術筆記八、特徵選擇

八、特徵選擇作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 用於特徵選取的 ANOVA F 值如果特徵是類別的，計算每個特徵與目標向量之間的卡方（

資料科學和人工智慧技術筆記七、特徵工程

七、特徵工程作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 稀疏特徵矩陣上的降維 # 載入庫 from sklearn.preprocessing import StandardScaler from sklearn.d

資料科學和人工智慧技術筆記十、模型選擇

十、模型選擇作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 在模型選擇期間尋找最佳預處理步驟在進行模型選擇時，我們必須小心正確處理預處理。首先，GridSearchCV使用交叉驗證來確定哪個模型表現最好。然而，在交

資料科學和人工智慧技術筆記十三、樹和森林

十三、樹和森林作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 Adaboost 分類器 # 載入庫 from sklearn.ensemble import AdaBoostClassifier from skle

資料科學和人工智慧技術筆記十五、支援向量機

十五、支援向量機作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 校準 SVC 中的預測概率 SVC 使用超平面來建立決策區域，不會自然輸出觀察是某一類成員的概率估計。但是，我們實際上可以通過一些技巧輸出校準的類概率。

資料科學和人工智慧技術筆記十一、線性迴歸

十一、線性迴歸作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 新增互動項 # 載入庫 from sklearn.linear_model import LinearRegression from sklearn.d

資料科學和人工智慧技術筆記十四、K 最近鄰

十四、K 最近鄰作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 確定 K 的最佳值 # 載入庫 from sklearn.neighbors import KNeighborsClassifier from skl

資料科學和人工智慧技術筆記十二、邏輯迴歸

十二、邏輯迴歸作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 C 超引數快速調優有時，學習演算法的特徵使我們能夠比蠻力或隨機模型搜尋方法更快地搜尋最佳超引數。 scikit-learn 的LogisticRegre

資料科學和人工智慧技術筆記二十一、統計學

二十一、統計學作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 貝塞爾校正貝塞爾的校正是我們在樣本方差和樣本標準差的計算中使用 n

資料科學和人工智慧技術筆記二十、資料視覺化

二十、資料視覺化作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 MatPlotLib 中的雙向條形圖 %matplotlib inline import pandas as pd import matplotlib.py

資料科學和人工智慧技術筆記十八、Keras

十八、Keras 作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 新增丟棄 # 載入庫 import numpy as np from keras.datasets import imdb from keras.pr

資料科學和人工智慧技術筆記十七、聚類

十七、聚類作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 凝聚聚類 # 載入庫 from sklearn import datasets from sklearn.preprocessing import Stan

資料科學和人工智慧技術筆記十六、樸素貝葉斯

十六、樸素貝葉斯作者：Chris Albon 譯者：飛龍協議：CC BY-NC-SA 4.0 伯努利樸素貝葉斯伯努利樸素貝葉斯分類器假設我們的所有特徵都是二元的，它們僅有兩個值（例如，已經是獨熱編碼的標稱分類特徵）。 # 載入庫 import

資料科學和人工智慧技術筆記 五、文字預處理

五、文字預處理

詞袋

解析 HTML

移除標點

移除停止詞

替換字元

詞幹提取

移除空白

詞性標籤

TF-IDF

文字分詞

相關推薦

資料科學和人工智慧技術筆記五、文字預處理