selenium最初是一個自動化測試工具,而爬蟲中使用它主要是為了解決requests無法直接執(zhí)行JavaScript代碼的問題,selenium本質(zhì)是通過驅(qū)動瀏覽器,完全模擬瀏覽器的操作,比如跳轉(zhuǎn)、輸入、點擊、下拉等,來拿到網(wǎng)頁渲染之后的結(jié)果,可支持多種瀏覽器,這里只用到谷歌瀏覽器。
1.selenium初始化
方法一:會打開網(wǎng)頁
# 該方法會打開goole網(wǎng)頁
from selenium import webdriver
url = '網(wǎng)址'
driver = webdriver.Chrome()
driver.get(url)
driver.maximize_window() # 實現(xiàn)窗口最大化
方法二:不會打開網(wǎng)頁
# 該方法會隱式打開goole網(wǎng)頁
from selenium import webdriver
url = '網(wǎng)址'
driver = webdriver.ChromeOptions()
driver.add_argument("headless")
driver = webdriver.Chrome(options=driver)
driver.get(url)
driver = webdriver.Chrome()出錯是因為沒有chromedriver.exe這個文件
2.元素定位
在selenium中,可以有多種方法對元素進行定位,個人通常喜歡用Xpath和selector來定位元素,這樣就不用一個一個的去找節(jié)點,直接在網(wǎng)頁上定位到元素復(fù)制就行。
driver.find_element_by_id() # 通過元素ID定位
driver.find_element_by_name() # 通過元素Name定位
driver.find_element_by_class_name() # 通過類名定位
driver.find_element_by_tag_name() # 通過元素TagName定位
driver.find_element_by_link_text() # 通過文本內(nèi)容定位
driver.find_element_by_partial_link_text()
driver.find_element_by_xpath() # 通過Xpath語法定位
driver.find_element_by_css_selector() # 通過選擇器定位
注:若尋找多個元素,要記得用復(fù)數(shù)來選擇(element改為elements)
# 例如
[i.text for i in driver.find_elements_by_xpath()]

3.建立點擊事件
因為有些網(wǎng)站的需求,需建立點擊事件,
如下圖的這種時間選擇,需要設(shè)置點擊和輸入內(nèi)容,設(shè)置的方法也很簡單。

driver.find_element_by_css_selector('').click() # 點擊
driver.find_element_by_css_selector('').send_keys('2021-3-9') # 輸入內(nèi)容
4.切換窗口
有些網(wǎng)站點擊之后會產(chǎn)生新窗口,這時就需要進行窗口的切換才能進行元素定位
win = driver.window_handles # 獲取當(dāng)前瀏覽器的所有窗口
driver.switch_to.window(win[-1]) # 切換到最后打開的窗口
driver.close() # 關(guān)閉當(dāng)前窗口
driver.switch_to.window(win[0]) # 切換到最初的窗口
5.iframe問題
有些網(wǎng)站會采用iframe來編寫頁面,這時就需要進入到iframe才可以獲取元素,一般有多少個iframe就需要進入多少個iframe。

# 有兩個iframe,需逐步進入
iframe1 = driver.find_element_by_xpath('')
driver.switch_to.frame(iframe1)
iframe2 = driver.find_element_by_xpath('')
driver.switch_to.frame(iframe2)
到此這篇關(guān)于python實現(xiàn)selenium網(wǎng)絡(luò)爬蟲的文章就介紹到這了,更多相關(guān)python selenium網(wǎng)絡(luò)爬蟲內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
您可能感興趣的文章:- Python selenium模擬網(wǎng)頁點擊爬蟲交管12123違章數(shù)據(jù)
- python爬蟲之利用Selenium+Requests爬取拉勾網(wǎng)
- python爬蟲selenium模塊詳解
- python爬蟲利用selenium實現(xiàn)自動翻頁爬取某魚數(shù)據(jù)的思路詳解
- Python爬蟲之Selenium實現(xiàn)關(guān)閉瀏覽器
- Python爬蟲中Selenium實現(xiàn)文件上傳
- Python爬蟲之Selenium下拉框處理的實現(xiàn)
- 教你如何使用Python selenium