91超碰碰碰碰久久久久久综合_超碰av人澡人澡人澡人澡人掠_国产黄大片在线观看画质优化_txt小说免费全本

溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點擊 登錄注冊 即表示同意《億速云用戶服務條款》

python爬取準備一 了解HTML

發布時間:2020-08-30 21:00:06 來源:網絡 閱讀:308 作者:薩瓦迪迪卡 欄目:系統運維

網頁源碼

打開網頁,按快捷鍵【Ctrl+U】打開源碼頁面
python爬取準備一 了解HTML

HTML
HTML 是整個網頁的結構,相當于整個網站的框架。帶“<”、“>”符號的都是屬于 HTML 的標簽,并且標簽都是成對出現的

常見的標簽如下:

<html>..</html> 表示標記中間的元素是網頁
<body>..</body> 表示用戶可見的內容
<div>..</div> 表示框架
<p>..</p> 表示段落
<li>..</li>表示列表
<img>..</img>表示圖片
<h2>..</h2>表示標題
<a href="">..</a>表示超鏈接

HTML
html示例
本地超鏈接可以為相對路徑,也可以為絕對路徑。
圖片的地址可以為相對路徑,也可以為絕對路徑。

    <html>
    <head>
          <title>這是HTML測試頁面的主題</title>
    </head>
    <body>
          <div>   
              <h2>這是標題</h2>   
              <p>這是正文</p>   
          </div> 
          <div>    
              <ul>     
                  <li>這是一個列表</li>       
                  <li><a >這是一個網絡超鏈接</a></li>
                  <li><a href='1.html'>這是一個本地超鏈接</a></li>      
                  <li>下面這個是一張圖片</li>           
                  <img src="20120830173930_PBfJE.jpeg" alt="如果圖像無法顯示,將顯示這個" />           
              </ul>        
         </div>      
    </body>
    </html>

輸入代碼后,保存記事本,然后修改文件名和后綴名為"HTML.html",效果如下:

python爬取準備一 了解HTML

爬蟲的合法性

每一個網站都有一個名為 robots.txt 的文檔,當然也有部分網站沒有設定 robots.txt。對于沒有設定 robots.txt 的網站可以通過網絡爬蟲獲取沒有口令加密的數據,也就是該網站所有頁面數據都可以爬取。如果網站有 robots.txt 文檔,就要判斷是否有禁止訪客獲取的數據。

python爬取準備一 了解HTML

允許部分爬蟲訪問它的部分路徑,而對于沒有得到允許的,則全部禁止爬取

向AI問一下細節

免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。

AI

龙川县| 湟源县| 高台县| 基隆市| 阿鲁科尔沁旗| 盘锦市| 仁化县| 旬阳县| 三江| 醴陵市| 抚顺县| 师宗县| 新余市| 澄城县| 长葛市| 三台县| 清河县| 奈曼旗| 沙洋县| 南和县| 苏尼特左旗| 达日县| 乌恰县| 车险| 武陟县| 景宁| 鄂尔多斯市| 星子县| 双城市| 黑龙江省| 邓州市| 佛山市| 逊克县| 宣化县| 定结县| 招远市| 镇江市| 漾濞| 澄迈县| 喀喇| 临武县|