泡泡妹妹提示您:看后求收藏(詩鼎小說網網m.gzstf.cn),接著再看更方便。
而幫助搜索引擎完成找這個動作的就是爬蟲。
因為國際互聯網中的信息節點都是相互關聯的,是網狀聯系的,每個節點上都會有很多個URL。所以爬蟲的工作模式就是遍歷,當它開始工作時,它會以一個信息節點為起點,然后挨個訪尋與這個節點相連的所有節點,當下一層節點還有URL鏈接時,它就不斷訪問下去,直到將所有URL遍歷一次才算完。
因為整個互聯網的網狀結構,使它具備網狀互通性,所以等爬蟲將所有URL遍歷了,一般來說它就已經將整個國際互聯網所有鏈接全部訪問了一遍,這注定是一個比環球旅行更加令人嘆為觀止的行為。
而莫回既然想弄這個股神1.0,他想要搜集海量數據,那么他要做的事情其實和搜索引擎要做的事情很像,只不過搜索引擎是所有信息都要搜集,而莫回只需要關注股票相關的信息就行了。
這樣的話,莫回的爬蟲就必須在具備遍歷能力的同時,還得具備篩選的能力。
遍歷的能力解釋起來很簡單,就是你不能走回頭路和冤枉路,游歷過的URL就犯不著再走第二遍了。一條新的URL被發現,首先需要判斷這條URL是否已經走過,其次需要判斷這條URL被安排在什么次序去走。一個是重復性問題,一個是最優化問題,這就需要獨特的遍歷算法來解決。
而篩選功能就是通用爬蟲和專用爬蟲之間的主要區別,莫回的爬蟲需要具備一定的識別能力,能夠辨別某個URL中的內容是否具備相關性,如果不具備那么就跳過,如果具備就將其中的內容復制回來待用。
這個篩選功能同樣需要一大堆的算法來解決,不僅如此,它還需要具備自然語言處理能力,就是說它得具備對語言文字的理解和解析的能力,它得能夠識別哪些文字內容是與股票相關的,哪些是無用的。
僅僅識別文字還是不夠的,它還得能夠識別其他格式的數據,比如它得能夠識別圖案,像是股票相關的各種K線圖、柱狀圖之類的,爬蟲必須能夠將其與風景畫或者自拍照區別開。
除了圖片,其他的像是視頻、音頻、各類數據庫之類的,爬蟲都需要一一辨別出來,確定是否屬于相關內容。
這里面將會有無數個技術難題需要解決,如果這個工作讓莫回一個人來完成,幾乎是不可想象的。
;