PHP使用三種方法實(shí)現(xiàn)數(shù)據(jù)采集_第1頁(yè)
PHP使用三種方法實(shí)現(xiàn)數(shù)據(jù)采集_第2頁(yè)
PHP使用三種方法實(shí)現(xiàn)數(shù)據(jù)采集_第3頁(yè)
PHP使用三種方法實(shí)現(xiàn)數(shù)據(jù)采集_第4頁(yè)
PHP使用三種方法實(shí)現(xiàn)數(shù)據(jù)采集_第5頁(yè)
已閱讀5頁(yè),還剩3頁(yè)未讀, 繼續(xù)免費(fèi)閱讀

下載本文檔

版權(quán)說(shuō)明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)

文檔簡(jiǎn)介

第PHP使用三種方法實(shí)現(xiàn)數(shù)據(jù)采集目錄什么叫采集?PHP制作采集的技術(shù)1.使用socket技術(shù)采集:2.使用curl_一套函數(shù)3.直接使用file_get_contents(最頂層的)3種方式的選擇數(shù)據(jù)采集

什么叫采集?

就是使用PHP程序,把其他網(wǎng)站中的信息抓取到我們自己的數(shù)據(jù)庫(kù)中、網(wǎng)站中。

PHP制作采集的技術(shù)

從底層的socket到高層的文件操作函數(shù),一共有3種方法可以實(shí)現(xiàn)采集。

1.使用socket技術(shù)采集:

socket采集是最底層的,它只是建立了一個(gè)長(zhǎng)連接,然后我們要自己構(gòu)造http協(xié)議字符串去發(fā)送請(qǐng)求。

例如要想獲取這個(gè)頁(yè)面的內(nèi)容,/spm=a2hww.20023042.topNav.5~1~3!2~A,用socket寫(xiě)如下:

//連接,$error錯(cuò)誤編號(hào),$errstr錯(cuò)誤的字符串,30s是連接超時(shí)時(shí)間

$fp=fsockopen("",80,$errno,$errstr,30);

if(!$fp)die("連接失敗".$errstr);

//構(gòu)造http協(xié)議字符串,因?yàn)閟ocket編程是最底層的,它還沒(méi)有使用http協(xié)議

$http="GET/spm=a2hww.20023042.topNav.5~1~3!2~AHTTP/1.1\r\n";//\r\n表示前面的是一個(gè)命令

$http.="Host:\r\n";//請(qǐng)求的主機(jī)

$http.="Connection:close\r\n\r\n";//連接關(guān)閉,最后一行要兩個(gè)\r\n

//發(fā)送這個(gè)字符串到服務(wù)器

fwrite($fp,$http,strlen($http));

//接收服務(wù)器返回的數(shù)據(jù)

$data='';

while(!feof($fp)){

$data.=fread($fp,4096);//fread讀取返回的數(shù)據(jù),一次讀取4096字節(jié)

//關(guān)閉連接

fclose($fp);

var_dump($data);

打印出的結(jié)果如下,包含了返回的頭信息及頁(yè)面的源碼:

2.使用curl_一套函數(shù)

curl把HTTP協(xié)議都封裝成了很多函數(shù),直接傳相應(yīng)參數(shù)即可,降低了編寫(xiě)HTTP協(xié)議字符串的難度。

前提:在php.ini中要開(kāi)啟curl擴(kuò)展。

//生成一個(gè)curl對(duì)象

$curl=curl_init();

//設(shè)置URL和相應(yīng)的選項(xiàng)

curl_setopt($curl,CURLOPT_URL,"");

curl_setopt($curl,CURLOPT_RETURNTRANSFER,1);//將curl_exec()獲取的信息以字符串返回,而不是直接輸出。

//執(zhí)行curl操作

$data=curl_exec($curl);

var_dump($data);

打印出的結(jié)果如下,只包含頁(yè)面的源碼:

3.直接使用file_get_contents(最頂層的)

前提:在php.ini中設(shè)置允許打開(kāi)一個(gè)網(wǎng)絡(luò)的url地址。

//使用file_get_contents()

$data=file_get_contents("");

var_dump($data);

3種方式的選擇

網(wǎng)絡(luò)之間通信主要使用的是以上三種。其中后兩種用的較多:如果要批量采集大量的數(shù)據(jù)時(shí)使用第二種【CURL】,性能好、穩(wěn)定。

偶爾發(fā)幾個(gè)請(qǐng)求發(fā)的頻繁不密集時(shí)使用第三種。

擴(kuò)展:圖片的防盜鏈如何破?

比如7060網(wǎng)站上的圖片做了防盜鏈:在他的網(wǎng)站中可以看到圖片,把圖片拿到站外就無(wú)法訪問(wèn)。

原理:在HTTP協(xié)議中有一個(gè)referer項(xiàng),代表發(fā)這個(gè)請(qǐng)求的來(lái)源地址,服務(wù)器會(huì)判斷如果這個(gè)請(qǐng)求不是這個(gè)網(wǎng)站發(fā)來(lái)的就會(huì)過(guò)濾掉這個(gè)請(qǐng)求:

解決辦法:發(fā)HTTP時(shí)自己模擬referer即可:

擴(kuò)展:有些要采集數(shù)據(jù)時(shí)時(shí)必須先登錄,可以使用模擬的試模擬在登錄狀態(tài)下的采集:

a.先用瀏覽登錄一下,登錄完,瀏覽器的COOKIE中就會(huì)有SESSIONID

b.發(fā)PHP發(fā)HTTP協(xié)議時(shí),把瀏覽器中的SESSIONID放到PHP的HTTP協(xié)議請(qǐng)求里,這樣就在以登錄的狀態(tài)發(fā)請(qǐng)求。

總結(jié):所有客戶端發(fā)過(guò)來(lái)的數(shù)據(jù)都可以被模擬,所以服務(wù)器上的程序必須要必要的地方過(guò)濾客戶端的數(shù)據(jù)。

什么時(shí)候用以上東西?接口開(kāi)發(fā)時(shí)、采集時(shí)。

數(shù)據(jù)采集

例如我要采集這個(gè)url里的所有美國(guó)電影的信息,

/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html

則先要知道電影所在的節(jié)點(diǎn)的結(jié)構(gòu),我們使用firebug查看。

然后開(kāi)始寫(xiě)代碼:完整代碼如下

*發(fā)一個(gè)GET請(qǐng)求獲取數(shù)據(jù)

functionget($url)

global$curl;

//配置curl中的http協(xié)議-可配置的薦可以查PHP手冊(cè)中的curl_

curl_setopt($curl,CURLOPT_URL,$url);

curl_setopt($curl,CURLOPT_RETURNTRANSFER,TRUE);

curl_setopt($curl,CURLOPT_HEADER,FALSE);

//執(zhí)行這個(gè)請(qǐng)求

returncurl_exec($curl);

//生成一個(gè)curl對(duì)象

$curl=curl_init();

$url='/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html';

$data=get($url);

//匹配電影所在位置

$list_preg='/li.+\/li/Us';

//匹配img標(biāo)簽上的src和alt

$img_preg='/img_src="(.*)"src="(.*)"alt="(.*)"\/

//匹配電影的url

$video_preg='/ahref="(.*)"rel="externalnofollow"title="(.*)"target="(.*)"\/a

//把所有的li存到$list里,$list是個(gè)二維數(shù)組

preg_match_all($list_preg,$data,$list);

//var_dump($list);

foreach($list[0]as$k=$v){//這里$v就是每一個(gè)li標(biāo)簽

/*獲取圖片及電影名稱

preg_match($img_preg,$v,$img);//把匹配到的圖片的信息存到$img里

var_dump($img);

/*獲取電影地址

preg_match($video_preg,$v,$video);//把匹配到的電影的信息存到$video里

var_dump($video);

preg_match($img_preg,$v,$img);

preg_match($video_preg,$v,$video);

echo$img[0].'ahref="'.$video[1].'"rel="externalnofollow"'.$video[2].'/a

}

測(cè)試:

打印$list;

打印$img

打印$video

最終效果:

如果需要把圖片拷貝到硬盤(pán)上,則在foreach循環(huán)里加上以下代碼:

$imgData=get($img[1]);

//把圖片文件寫(xiě)到硬盤(pán)上【下載】

//因?yàn)椴僮飨到y(tǒng)是GBK的,所以要把UTF8轉(zhuǎn)成GBK

is_dir('./youkuimg/')'':mkdir('./youkuimg/');

file_put_contents('

溫馨提示

  • 1. 本站所有資源如無(wú)特殊說(shuō)明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁(yè)內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒(méi)有圖紙預(yù)覽就沒(méi)有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 人人文庫(kù)網(wǎng)僅提供信息存儲(chǔ)空間,僅對(duì)用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
  • 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。

評(píng)論

0/150

提交評(píng)論