RSS解析器MagpieRSS筆記
MagpieRSS是一個(gè)不錯(cuò)的RSS抓取/解析工具,我本來(lái)打算自己寫一個(gè)php的RSS解析工具,不過(guò)試了一下MagpieRSS,覺得還不錯(cuò),能滿足需要。
順便看了看代碼,記點(diǎn)筆記。
1.亂碼問題
MagpieRSS過(guò)去時(shí)常出現(xiàn)亂碼問題,從0.7版本解決了這個(gè)問題
Version0.7
support for input and output charset encoding
based on the work in FoF,uses iconv or mbstring if available
0.7之后的版本可以指定輸入和輸出字符編碼,然后使用iconv或mbstring函數(shù)進(jìn)行編碼轉(zhuǎn)換。這個(gè)工作在create_parser函數(shù)里面完成的,如果兩個(gè)函數(shù)都不存在,可以在RSS_fetch.inc中讓MAGPIE_DETECT_ENCODING為false,不檢測(cè)和轉(zhuǎn)換編碼,否則就會(huì)出錯(cuò)。
一切正常的情況下,把RSS_fetch.inc中MAGPIE_OUTPUT_ENCODING定義成你需要的輸出編碼,比如UTF-8:define(‘MAGPIE_OUTPUT_ENCODING’,‘UTF-8’);就可以獲得正確的輸出結(jié)果了。
2.抓取方法
MagpieRSS用了Snoopy作為http客戶端來(lái)抓取RSS。這個(gè)庫(kù)比較完善,支持https,支持gzip。
需要注意的是,Snoopy用exec命令調(diào)用curl,然后返回結(jié)果,而不是使用編譯進(jìn)php的curl函數(shù)。默認(rèn)的路徑是“/usr/bin/curl”,如果這里沒有curl或是沒有執(zhí)行權(quán)限,就可能失敗。不過(guò)只有https需要用到curl,普通的http訪問是用fsockopen的。
同時(shí),Snoopy可以使用代理服務(wù)器,但是MagpieRSS沒有使用,如果需要可以在RSS_fetch.inc中的_fetch_remote_file函數(shù)里面添加$client->proxy_host和$client->proxy_port。
3.緩存
MagpieRSS設(shè)置了一個(gè)默認(rèn)3600秒超時(shí)的緩存。在./cache下放了一堆文件,文件名是md5之后的url+MAGPIE_OUTPUT_ENCODING,格式是php的serialize。
所以cache目錄要可寫。超時(shí)時(shí)間在RSS_cache.inc的var$MAX_AGE=3600;這行設(shè)置,也可以在創(chuàng)建cache對(duì)象的時(shí)候設(shè)置。
綜合起來(lái),這個(gè)庫(kù)還是不錯(cuò)的,優(yōu)點(diǎn)很多,也考慮了主機(jī)的各種情況,兼容性很好。函數(shù)形式的接口,很容易調(diào)用。不過(guò)應(yīng)該先用head來(lái)取RSS的http header,根據(jù)Etag來(lái)判斷是否抓整個(gè)頁(yè)面回來(lái),這樣效率還能再有提高。這個(gè)改動(dòng)之后,cache就可以存在更長(zhǎng)的時(shí)間,而不是一個(gè)固定的3600秒。同時(shí)我比較想把文章保存起來(lái),以便以后用,這就需要數(shù)據(jù)庫(kù)了。
我將來(lái)應(yīng)該會(huì)基于這個(gè)東西發(fā)布一個(gè)新版本,把我想要的功能加進(jìn)來(lái)。
【編輯推薦】