python中對URL的編碼與解碼

2019-11-14 08:55:19

字體：大中小

來源：轉載

供稿：網友

url中的query帶有特殊字符（不是url的保留字）時需要進行編碼。當url中帶有漢字時，需要特殊的處理才能正確編碼，以下都只針對這種情形，當然也適用于純英文字符的url。(1) url編碼：

import urlliburl = 'http://test.com/s?wd=哈哈'   #如果此網站編碼是gbk的話，需要進行解碼，從gbk解碼成unicode，再從Unicode編碼編碼為utf-8格式。url = url.decode('gbk', 'replace')PRint urllib.quote(url.encode('utf-8', 'replace'))結果: http%3a%2f%2ftest.com%2fs%3fwd%3d%e5%93%88%e5%93%88(2) url解碼:import urllibencoded_url = 'http%3a%2f%2ftest.com%2fs%3fwd%3d%e5%93%88%e5%93%88'print urllib.unquote(encoded_url).decode('utf-8', 'replace').encode('gbk', 'replace')  #反過來函數調用的參數以及結果都是utf-8編碼的，所以在對url編碼時，需要將參數串的編碼從原始編碼轉換成utf-8，對url解碼時，需要將解碼結果從utf-8轉換成原始編碼格式。依據網站采用的編碼不同，或是gbk或是utf-8，賦賦予不同的編碼，進行不同的url轉碼。GBK格式，一個中文字符轉為%xx%xx，共兩組；utf-8格式，一個中文字符轉為%xx%xx%xx，共三組。>>> import sys,urllib   >>> s = '杭州' >>> urllib.quote(s.decode(sys.stdin.encoding).encode('gbk'))  %BA%BC%D6%DD  >>> urllib.quote(s.decode(sys.stdin.encoding).encode('utf8'))  '%E6%9D%AD%E5%B7%9E'     a = "墨西哥女孩被拐4年接客4萬次 生的孩子成為人質-搜狐新聞"      print urllib.quote(urllib.quote(a))進行兩次編碼轉換后，會變為：%25E5%25A2%25A8%25E8%25A5%25BF%25E5%2593%25A5%25E5%25A5%25B3%25E5%25AD%25A9%25E8%25A2%25AB%25E6%258B%25904%25E5%25B9.................................................................................這樣的形式。同樣需要兩次解碼后才能得到中文。

上一篇：簡單的單鏈表

下一篇：一個菜鳥的java求字謎算法