前言
網路爬蟲(web crawler)又稱網路蜘蛛(spider)。它是一種自動瀏覽www全球資訊網的網路機器人。其原理相當簡單,即是透過一個種子網址,同時利用網頁中的連結,進一步獲取想要得到的網站數據資料,如此所擷取的數據就慢慢形成一張巨大的蜘蛛網。
談到網路爬蟲的應用就相當廣泛。
例如開發和旅遊相關的網站或App會使用到公車、台鐵或高鐵的時刻表,此時就可以在旅遊網站中加入可自動取得公車、台鐵或高鐵的時刻表的相關網路爬蟲服務。又例如開發個人化的股價查詢App,在系統中可加入自動取得股價的網路爬蟲服務,當股價上漲時即馬上通知相關的使用者進行拋售股票,若股價下跌即馬上通知相關使用者進場。還有美食網站、購物網站比價、漫畫抓取…等,都是常見的網路爬蟲應用。
相關主題與延伸閱讀
- 2. urllib 套件解析網址與擷取網頁:學習使用 Python 內建的
urllib套件解析網址與擷取網頁。 - 3. requests 套件擷取網頁:學習使用更簡便的
requests套件擷取網頁資訊。 - 4. BeautifulSoup 套件解析網頁:學習如何解析擷取到的網頁內容,取出所需資料。
- 5. 網頁爬蟲應用實例:綜合運用擷取與解析技巧的實際應用案例。
- 4. 文字檔資料的寫入與讀取:爬取到的資料常需寫入檔案,以便後續保存與利用。