怎么在Python中利用正則表達式提取搜索結果中的站點地址

發布時間：2021-01-16 10:11:26 來源：億速云閱讀：265 作者：Leah 欄目：互聯網科技

今天就跟大家聊聊有關怎么在Python中利用正則表達式提取搜索結果中的站點地址，可能很多人都不太了解，為了讓大家更加了解，小編給大家總結了以下內容，希望大家根據這篇文章可以有所收獲。

這其中涉及幾個需要解決的問題：

1、獲取搜索的結果文本

為了獲得更多的地址，我使用了Google的高級搜索功能，每個頁面顯示100條結果。

獲得顯示的結果后，可以查看源碼，并保持成文本文件就有了搜索的結果文本

2、分析如何提取站點信息

首先需要分析獲取的頁面，查看以怎樣的方式可以提取出站點信息。

我使用IE8自帶的開發工具（按F12就會彈出來）中的探查器功能查看自己要關心的內容有什么特殊的格式

怎么在Python中利用正則表達式提取搜索結果中的站點地址

從上圖可以看出我需要的站點在標簽<cite></cite>中，所以我使用正則表達式提取這其中的文本是否就可以呢？

3、編寫正則表達式來獲取站點地址

接下來的就是寫表達式了，我使用Python3.2編寫的，方便好用（~_~）

代碼如下，先把搜索結果頁面保持到e:/t3.txt中，在執行如下代碼

import re
p = re.compile(r'<cite>([^<>\/].+?)</cite>')
f = open("e:/t3.txt", encoding='utf-8')
content = f.read()
print ("\n".join(p.findall(content)))

看完上述內容，你們對怎么在Python中利用正則表達式提取搜索結果中的站點地址有進一步的了解嗎？如果還想了解更多知識或者相關內容，請關注億速云行業資訊頻道，感謝大家的支持。

向AI問一下細節

91超碰碰碰碰久久久久久综合_超碰av人澡人澡人澡人澡人掠_国产黄大片在线观看画质优化_txt小说免费全本

怎么在Python中利用正則表達式提取搜索結果中的站點地址

猜你喜歡

91超碰碰碰碰久久久久久综合_超碰av人澡人澡人澡人澡人掠_国产黄大片在线观看画质优化_txt小说免费全本

怎么在Python中利用正則表達式提取搜索結果中的站點地址

猜你喜歡

最新資訊

相關推薦

相關標簽