91超碰碰碰碰久久久久久综合_超碰av人澡人澡人澡人澡人掠_国产黄大片在线观看画质优化_txt小说免费全本

溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點擊 登錄注冊 即表示同意《億速云用戶服務條款》

mshtml獲取meta信息

發布時間:2020-06-21 03:45:39 來源:網絡 閱讀:282 作者:木木在路上 欄目:編程語言

為了計算文本與標題相似度,需要用到標題文本。而爬數據的時候將文件名設置為url而沒有用網頁標題來存,所以需要解析網頁提取,工程在.net平臺下利用webbrowser實現的,用到了微軟的mshtml。

用IHTMLDocument2.title倒是可以獲得標題,但是它取得的標題有時會包含網站名如: Colorado shooting suspect sent to trial | World news | guardian.co.uk

為了計算準確,希望只有當前主題網頁中的標題就是只有Colorado shooting suspect sent to trial。觀察html發現一般主題網頁的meta信息中會有不包含網站名的title,在格式如下的一個標簽里<meta property="og:title" content="Colorado shooting suspect sent to trial"/>。于是用正則匹配IHTMLElement的outerhtml,嘗試各種正則都沒匹配到。

原來outerhtml中只有body結點中的html,并不包含meta信息。然后google查有什么方法獲得meta中的內容,發現一個解決方法http://forums.asp.net/p/1455331/3332061.aspx。關鍵代碼貼在這里:

 

  1. foreach (IHTMLElement el in (IHTMLElementCollection)doc.all) 
  2.        { 
  3.            // check to see if all the desired attributes were found with the correct values 
  4.            bool qualify = true
  5.            if (el.tagName == "META"
  6.            { 
  7.                HTMLMetaElement meta = (HTMLMetaElement)el; 
  8.                Response.Write("Content " + meta.content +"<br/>"); 
  9.            } 

利用IHTMLDocument2可以獲得所有標簽信息,包括meta中的。然后再用正則或者字符串匹配在其中找相應的title信息,完成。

向AI問一下細節

免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。

AI

仙桃市| 虎林市| 九江县| 易门县| 灵武市| 托克逊县| 阿坝县| 昭平县| 辉县市| 石林| 广东省| 静海县| 龙川县| 关岭| 乐陵市| 互助| 邳州市| 隆昌县| 盘山县| 大竹县| 长乐市| 临沭县| 南江县| 仁布县| 黄大仙区| 新建县| 宜丰县| 龙南县| 寿宁县| 宜黄县| 郯城县| 阿鲁科尔沁旗| 西平县| 明光市| 内丘县| 朝阳县| 天津市| 宜宾市| 托克托县| 康马县| 丰台区|