1. 程式人生 > >python正則re模塊

python正則re模塊

爬蟲 匹配 match 也會 推薦 abcd 輸出 顯示 sub()

今日內容:

知識點一:正則
什麽是正則:
就是用一系列具有特殊含義的字符組成一套規則,改規則用來描述具有某一特征的字符串
正則就是用來在一個大的字符串中取出符合規則的小字符串

為什麽用正則:
1.用戶註冊
2.爬蟲程序

如何用:
re.findall

re.findall模塊:

\w取字母、數字、下劃線
print(re.findall(‘\w‘,‘yangzz:age_18 ‘))
\W取非字母、數字、下劃線
print(re.findall(‘\W‘,‘yangzz:age_18 ‘))

\s匹配任意空白字符串,等價於[\t\n\r\f] t是一個table鍵
print(re.findall(‘\s‘,‘\tyangzz\n age_18 ‘))

\S匹配任意非空字符
print(re.findall(‘\S‘, ‘\tyangzz\n age_18 ‘))

\d匹配任意數字
print(re.findall(‘\d‘, ‘\tyangzz\n age_18 ‘))
\D匹配任意非數字
print(re.findall(‘\D‘, ‘\tyangzz\n age_18 ‘))

\n匹配一個換行符
print(re.findall(‘\n‘, ‘\tyangzz\n age_18 aaa bb\nb ‘))

\t匹配一個制表符
print(re.findall(‘\t‘, ‘\tyangzz\n age_18 aaa bb\nb ‘))


^取字符串的開頭 (沒有返回空列表,從開頭第一個匹配)
print(re.findall(‘^yang‘, ‘yangzz\n age_18 yang aaa bb\nb ‘)) #[‘yang‘]

$匹配字符串末尾
print(re.findall(‘b$‘, ‘yangzz\n age_18 yang aaa bb\nb‘)) #[‘b‘]

. 匹配任意字符,除了換行符
print(re.findall(‘.‘, ‘yangzz\n age_18 *%& yang aaa bb\nb‘))

例如2 a.g其實是三位字符, .可以是任意非換行符(後面加re.DOTALL中間也可以取到\n)
print(re.findall(‘a.g‘, ‘yangzz\n age_18 ang *%& yang aaa bb\nb‘)) #[‘ang‘, ‘ang‘]
print(re.findall(‘a.g‘, ‘ya\nngzz\n age_18 a\ng *%& yang aaa bb\nb‘,re.DOTALL)) #[‘a\ng‘, ‘ang‘]

[a,e,b]匹配[]limian
print(re.findall(‘[\n]‘, ‘yangzz\n age_18 yang aaa bb\nb‘))#[‘\n‘, ‘\n‘]
print(re.findall(‘[a,e,b]‘, ‘yangzz\n age_18 yangzhizong aaa bb\nb‘)) #[‘a‘, ‘a‘, ‘e‘, ‘a‘, ‘a‘, ‘a‘, ‘a‘, ‘b‘, ‘b‘, ‘b‘]

print(re.findall(‘y[a-z]n‘, ‘yangzz\n age_18 yan y1n yang aaa bb\nb‘))

取不再括號中的字符
print(re.findall(‘[^z,a]‘, ‘yangzz‘))


*代表左邊的字符出現0次或者無窮次(條件一定要有a,b可有可無)
print(re.findall(‘an*‘, ‘yangzhizong mawenjie annd‘)) #[‘an‘, ‘a‘]


?代表左邊的字符出現0次或者1次(條件一定要有a,b有的話只取一個就行)
print(re.findall(‘an?‘, ‘yangzhizong mawenjie annd‘)) #[‘an‘, ‘a‘, ‘an‘]


+代表左邊的字符出現1次或者無窮次(條件一定要有a,b至少有一個)
print(re.findall(‘an+‘, ‘yangzhizong mawenjie annd‘)) #[‘an‘, ‘ann‘]

#匹配所有包含小數在內的數字
print(re.findall(‘\d+\.?\d*‘,"asdfasdf123as1.13dfa12adsf1asdf3")) #[‘123‘, ‘1.13‘, ‘12‘, ‘1‘, ‘3‘]

思路:\d 找數字 +表示左邊數字出現1次或者無窮次 ???


.*默認為貪婪匹配 (默認取從頭到尾取值)
print(re.findall(‘a.*b‘,‘a1b22222222b‘)) #[‘a1b22222222b‘]

.*?為非貪婪匹配:推薦使用
print(re.findall(‘a.*?b‘,‘a1b22222222b‘)) #[‘123‘, ‘1.13‘, ‘12‘, ‘1‘, ‘3‘]

{n,m}固定取值,碰到有的 取1個 和2個在一塊兒 分開組合
{0,2} 0開始的默認也會把其他打印但是現實為空
print(re.findall(‘a{0,2}‘, ‘yangzzage18yangaaabbb‘)) #[‘‘, ‘a‘, ‘‘, ‘‘, ‘‘, ‘‘, ‘a‘, ‘‘, ‘‘, ‘‘, ‘‘, ‘‘, ‘‘, ‘a‘, ‘‘, ‘‘, ‘aa‘, ‘a‘, ‘‘, ‘‘, ‘‘, ‘‘]
print(re.findall(‘ab{1,}‘,‘abbb‘)) #[‘abbb‘]

print(re.findall(‘a[1*-]b‘,‘a1b a*b a-b‘))


[+-*/] 括號內有加減乘除時,減號要放在左邊或者右邊 放中間的話只能前面加\ [+\-*/]代表將-轉譯為不同字符
print(re.findall(‘a[+\-*/]b‘,‘a12ba a++b a*b a-+b‘))


re.search()模塊
只到找到第一個匹配然後返回一個包含匹配信息的對象,該對象可以通過調用group()方法
得到匹配的字符串,如果字符串沒有匹配,則返回None。

print(re.findall(‘e‘,‘alex make love‘))
print(re.search(‘e‘,‘alex make love‘)) #<_sre.SRE_Match object; span=(2, 3), match=‘e‘>
print(re.search(‘e‘,‘alex make love‘).group()) # e

match從開頭進行查找,沒有的話返回None
print(re.match(‘e‘,‘alex make love‘))


split分割 模塊
[‘‘, ‘‘, ‘cd‘],先按‘a‘分割得到‘‘和‘bcd‘,再對‘‘和‘bcd‘分別按‘b‘分割
print(re.split(‘[ab]‘,‘abcd‘))


替換re.sub()模塊
1.不加參數默認替換所有
print(re.sub(‘a‘,‘A‘,‘abcdeaedaer‘,1)) #Abcdeaedaer

替換subn(輸出可以顯示總共替換的個數)
print(re.subn(‘a‘,‘A‘,‘abcdeaedaer‘))

re.complie()模塊
可以定制編譯,方便直接調用
obj=re.compile(‘\d{2}‘)
print(obj.search(‘ab123ee‘).group()) #12
print(obj.findall(‘ab123ee‘)) #[‘12‘]

python正則re模塊