Selenium爬携程酒店评论+jieba数据分析实战
如果你想使用最少的時間相對客觀的了解一樣事物,那么最好的方式就是快速收集大量的關于它的評價,然后迅速地找出這些評價中的關鍵信息。
而這道題目,有兩個特別大的難點:1.如何快速收集大量的評論;2.如何迅速的從大量評論中抽取關鍵信息。
基于python語言的爬蟲技術和文本分析技術剛好可以克服這兩大困難,幫助我們更快更客觀的了解某樣事物。接下來,我們使用python的Selenium和jieba對攜程某酒店網頁的評論進行抓取和分析。請大家搬好小板凳。
爬取評論數據
Selenium模擬瀏覽器
selenium是python中一個具有模擬瀏覽器操作功能的package。隨著反爬蟲技術日益強大,網頁數據多數通過js和Ajax動態加載,簡單的網頁解析很難拿到關鍵數據。selenium的作用就發揮出來,它可以模擬瀏覽器向服務器發送請求,服務器將數據返回并加載到瀏覽器端后,我們就這樣輕松的繞過了各種復雜的js解析過程,拿到那些動態加載的數據。
下面就是如何通過selenium模擬谷歌瀏覽器的一段代碼,需要強調的是chromedriver的版本(下載地址)一定要和chrome的版本對應,比如筆者的chrome版本是71.0.3578.98(正式版本),則chromedriver對應版本是2.45,而且chromedriver下載完成后,解壓后的chromedriver.exe 需放在chrome的應用文件夾內。
def generate_chrome():chromedrive
總結
以上是生活随笔為你收集整理的Selenium爬携程酒店评论+jieba数据分析实战的全部內容,希望文章能夠幫你解決所遇到的問題。
- 上一篇: Leetcode每日必刷题库第2题,如何
- 下一篇: Leetcode每日必刷题库第3题,如何