91超碰碰碰碰久久久久久综合_超碰av人澡人澡人澡人澡人掠_国产黄大片在线观看画质优化_txt小说免费全本

溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點擊 登錄注冊 即表示同意《億速云用戶服務條款》

如何解決php使用iconv中文截斷問題

發布時間:2021-09-02 11:06:30 來源:億速云 閱讀:105 作者:小新 欄目:開發技術

這篇文章主要為大家展示了“如何解決php使用iconv中文截斷問題”,內容簡而易懂,條理清晰,希望能夠幫助大家解決疑惑,下面讓小編帶領大家一起研究并學習一下“如何解決php使用iconv中文截斷問題”這篇文章吧。

具體分析如下:

今天做了一個采集程序,原理很簡單,使用curl方法把對方頁面的html獲取分析,然后正則提取需要的數據并保存在數據庫。

由于對方頁面是GB2312編碼,而本地使用的是UTF-8編碼。因此在采集后需要進行編碼轉換。

使用了iconv方法進行編碼轉換

iconv — 字符串按要求的字符編碼來轉換 
string iconv ( string $in_charset , string $out_charset , string $str )

將字符串 str 從 in_charset 轉換編碼到 out_charset 。  

轉換的方法很簡單,直接使用iconv方法就可以了

<?php 
$content = iconv('GB2312', 'UTF-8', $content); //$content為采集到的內容 
?>

試驗了幾個頁面,都能正常采集。但在之后的采集中,有幾個頁面采集不完整。
一開始考慮是否正則有錯,檢查后排除此問題。經過排查,發現經過iconv轉碼后的內容比采集的內容少了一大段。
查看apache log,看到提示:Notice: iconv(): Detected an illegal character in input string。

翻查手冊,看到以下說明

如果你在 out_charset 后添加了字符串 //TRANSLIT,將啟用轉寫(transliteration)功能。這個意思是,當一個字符不能被目標字符集所表示時,它可以通過一個或多個形似的字符來近似表達。

如果你添加了字符串 //IGNORE,不能以目標字符集表達的字符將被默默丟棄。 否則, str 從第一個無效字符開始截斷并導致一個 E_NOTICE 。

原來iconv遇到不能識別的內容,會從第一個不能識別的字符開始截斷,并生成一個E_NOTICE。因此后邊的內容被丟棄了。

而在輸出字符集后加上//IGNORE則只丟棄不能識別的內容,而不會截斷和丟棄后面的內容。

修改程序后一切正常

<?php 
$content = iconv('GB2312','UTF-8//IGNORE',$content);//$content為采集到的內容
?>

Tips:使用iconv時,如果要使用UTF-8編碼的,請使用UTF-8而不要使用UTF8,因為UTF8有些服務器會有問題。

以上是“如何解決php使用iconv中文截斷問題”這篇文章的所有內容,感謝各位的閱讀!相信大家都有了一定的了解,希望分享的內容對大家有所幫助,如果還想學習更多知識,歡迎關注億速云行業資訊頻道!

向AI問一下細節

免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。

AI

平谷区| 宝鸡市| 达尔| 内黄县| 六枝特区| 日照市| 合阳县| 高雄县| 上林县| 宜黄县| 新邵县| 垦利县| 阿拉善左旗| 广南县| 荣昌县| 大埔县| 太湖县| 石门县| 千阳县| 长垣县| 沈阳市| 霞浦县| 山丹县| 思南县| 永和县| 木兰县| 石渠县| 胶南市| 当阳市| 济源市| 吉安县| 永春县| 修水县| 牡丹江市| 平罗县| 木里| 临泉县| 日照市| 天水市| 璧山县| 建平县|