Selenium的使用

上面讲解了 Ajax 的分析方法，利用 Ajax 接口可以非常方便地爬取数据。只要能找到 Ajax 接口的规律，就可以通过某些参数构造出对应的请求，自然就能轻松爬取数据啦。

但是在很多情况下，Ajax 请求的接口含有加密参数，例如 token、sign 等，示例网址 https://spa2.scrape.center/ 的 Ajax 接口就包含一个 token 参数，如图 7-1 所示。

Figure 1. 图 7-1 包含 token 参数的 Ajax 接口

由于请求 Ajax 接口时必须加上 token 参数，因此如果不深入分析并找到 token 参数的构造逻辑，是难以直接模拟 Ajax 请求的。

方法通常有两种：一种是深挖其中的逻辑，把 token 参数的构造逻辑完全找出来，再用 Python 代码复现，构造 Ajax 请求；另一种是直接模拟浏览器的运行，绕过这个过程，因为在浏览器里是可以看到这个数据的，所以如果能把看到的数据直接爬取下来，当然就能获取对应的信息了。

第一种方法难度较高，我们先介绍第二种方法：模拟浏览器的运行，爬取数据。由于使用的工具是 Selenium，因此先了解一下它的基本使用方法。

Selenium 是一个自动化测试工具，利用它可以驱动浏览器完成特定的操作，例如点击、下拉等，

准备工作

本节以 Chrome 浏览器为例讲解 Selenium 的用法。在开始之前，请确保已经正确安装好了 Chrome 浏览器，并配置好了 ChromeDriver。另外，还需要正确安装好 Python 的 Selenium 库。

::note ChromeDriver 下载 ::

安装方法可以参考 https://setup.scrape.center/selenium ，全部配置完成后，便可以开始本节的学习。

基本用法

首先大体看一下 Selenium 的功能。示例代码如下：

from selenium import webdriver
from selenium.webdriver.chrome.options import Options
from selenium.webdriver.chrome.service import Service
from selenium.webdriver.common.by import By
from selenium.webdriver.common.keys import Keys
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.support.wait import WebDriverWait

chrome_driver_path = r'../chromedriver-win64/chromedriver.exe'
chrome_binary_path = r'C:\Program Files\Google\Chrome\Application\chrome.exe'

# 创建服务对象
service = Service(executable_path=chrome_driver_path)

opt = Options()
opt.binary_location = chrome_binary_path

# 关键修复参数 - 解决 DevToolsActivePort 错误
opt.add_argument('--no-sandbox')  # 禁用沙箱模式
opt.add_argument('--disable-dev-shm-usage')  # 解决共享内存问题
opt.add_argument('--disable-gpu')  # GPU硬件加速有时会引起问题
opt.add_argument('--remote-debugging-port=9222')  # 显式指定调试端口
opt.add_argument('--window-size=1920,1080')  # 设置窗口大小
opt.add_experimental_option('detach', True)

browser = webdriver.Chrome(service=service, options=opt)
try:
    browser.get('https://www.baidu.com')
    input = browser.find_element(By.ID, 'kw')
    input.send_keys('Python')
    input.send_keys(Keys.ENTER)
    wait = WebDriverWait(browser,10)
    wait.until(EC.presence_of_element_located((By.ID,'content_left')))
    print(browser.current_url)
    print(browser.get_cookies())
    print(browser.page_source)
finally:
    browser.close()

运行代码后，会自动弹出一个 Chrome 浏览器。浏览器会跳转到百度页面，然后在搜索框中输入 Python，就会跳转到搜索结果页，如图 7-2 所示。

Figure 2. 图7-2 在搜索框中输入Python

此时控制台的输出结果如下，因为页面源代码过长，所以此处省略其内容:

https://www.baidu.com/s?ie=utf-8&f=8&rsv_bp=0&rsv_idx=1&tn=baidu&wd=Python&rsv_pq=c940d0df9000a72d0&rsv_t=
07099xvvun1zmC0hff6eQvygJ43jUTTU015FCJVPGwG2YREs70Gp1jjH2F%2BC0&rqlang=cn&rsv_enter=1&rsv_sug3=6&rsv_sug2=0
&inputT=87&rsv_sug4=87
[{'secure': False, 'value': '8490B5EBF6F3CD402E515D22BCDA1598', 'domain': '.baidu.com', 'path': '/',
'httpOnly': False, 'name': 'BDORZ', 'expiry': 1491688071.707553}, {'secure': False, 'value':
'22473_1441_21084_17001', 'domain': '.baidu.com', 'path': '/', 'httpOnly': False, 'name': 'H_PS_PSSID'},
{'secure': False, 'value': '12883875381399993259_00_0_I_R_2_0303_C02F_N_I_I_O', 'domain': '.www.baidu.com',
'path': '/', 'httpOnly': False, 'name': '_bsi', 'expiry': 1491601676.69722}]
<!DOCTYPE html></html>

可以看到，我们得到的当前 URL、Cookie 内容和页面源代码都是浏览器中的真实内容。

所以说，用 Selenium 驱动浏览器加载网页，可以直接拿到 JavaScript 渲染的结果，无须关心使用的是什么加密系统。

下面详细了解一下 Selenium 的用法。

初始化浏览器对象

Selenium 支持的浏览器非常多，既有 Chrome、Firefox、Edge、Safari 等电脑端的浏览器，也有 Android、BlackBerry 等手机端的浏览器。我们可以用如下方式初始化浏览器对象：

from selenium import webdriver

browser = webdriver.Chrome()
browser = webdriver.Firefox()
browser = webdriver.Edge()
browser = webdriver.Safari()

这样就完成了浏览器对象的初始化，并将其赋值给了 browser。接下来，我们要做的就是调用 browser，执行其各个方法以模拟浏览器的操作。

访问页面

我们可以使用 get 方法请求网页，向其参数传入要请求网页的 URL 即可。例如，使用 get 方法访问淘宝，并打印出淘宝页面的源代码，代码如下：

from selenium import webdriver

browser = webdriver.Chrome()
browser.get('https://www.taobao.com')
print(browser.page_source)
browser.close()

运行这段代码后，弹出了 Chrome 浏览器并且自动访问了淘宝，然后控制台输出了淘宝页面的源代码，随后浏览器关闭。

通过上面几行简单的代码，就可以驱动浏览器并获取网页源码，可谓非常便捷。

查找节点

Selenium 可以驱动浏览器完成各种操作，比如填充表单、模拟点击等。例如，想要往某个输入框中输入文字，总得知道这个输入框在哪儿吧？对此，Selenium 为我们提供了一系列用来查找节点的方法，我们可以使用这些方法获取想要的节点，以便执行下一步的操作或者提取信息。

单个节点

例如，想从淘宝页面中提取搜索框这个节点，首先就要观察这个页面的源代码，如图 7-3 所示。

图 7-3 淘宝页面的源代码

可以发现，淘宝页面的 id 属性值是 9，name 属性值也是 q。此外，还有许多其他属性，我们可以用多种方式获取它们。例如，find_element_by_name 是根据 name 属性获取，find_element_by_id 是根据 id 属性获取，此外还有根据 XPath、CSS 选择器等的获取方式。

下面我们用代码实现一下：

from selenium import webdriver
from selenium.webdriver.chrome.options import Options
from selenium.webdriver.chrome.service import Service
from selenium.webdriver.common.by import By
from selenium.webdriver.common.keys import Keys
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.support.wait import WebDriverWait

chrome_driver_path = r'../chromedriver-win64/chromedriver.exe'
chrome_binary_path = r'C:\Program Files\Google\Chrome\Application\chrome.exe'

# 创建服务对象
service = Service(executable_path=chrome_driver_path)

opt = Options()
opt.binary_location = chrome_binary_path

# 关键修复参数 - 解决 DevToolsActivePort 错误
opt.add_argument('--no-sandbox')  # 禁用沙箱模式
opt.add_argument('--disable-dev-shm-usage')  # 解决共享内存问题
opt.add_argument('--disable-gpu')  # GPU硬件加速有时会引起问题
opt.add_argument('--remote-debugging-port=9222')  # 显式指定调试端口
opt.add_argument('--window-size=1920,1080')  # 设置窗口大小
opt.add_experimental_option('detach', True)

browser = webdriver.Chrome(service=service, options=opt)
try:
    browser.get('https://www.taobao.com')
    input_first = browser.find_element(By.ID, 'q')
    input_second = browser.find_element(By.CSS_SELECTOR, '#q')
    input_third = browser.find_element(By.XPATH, '//*[@id="q"]')
    print(input_first, input_second, input_third)

finally:
    browser.close()

这里我们使用 3 种方式获取输入框对应的节点，分别是根据 id 属性、CSS 选择器和 XPath 获取。

代码的运行结果如下:

<selenium.webdriver.remote.webelement.WebElement (session="df30c61a403eecafb948b89c9d18baf5", element="f.8AEA43BAA64F2CEE9DF2F7AC63B58BF0.d.80CFE5ADBC1D1D6415337E5133C74047.e.2")> <selenium.webdriver.remote.webelement.WebElement (session="df30c61a403eecafb948b89c9d18baf5", element="f.8AEA43BAA64F2CEE9DF2F7AC63B58BF0.d.80CFE5ADBC1D1D6415337E5133C74047.e.2")> <selenium.webdriver.remote.webelement.WebElement (session="df30c61a403eecafb948b89c9d18baf5", element="f.8AEA43BAA64F2CEE9DF2F7AC63B58BF0.d.80CFE5ADBC1D1D6415337E5133C74047.e.2")>

可以看到，3 种方式的返回结果完全一致。input_first、input_second 和 input_third 都属于 WebElement 类型，是完全一致的。

获取单个节点可以使用 find_element_by_id、find_element_by_name、find_element_by_xpath、 find_element_by_link_text、find_element_by_partial_link_text、find_element_by_tag_name、 find_element_by_class_name、find_element_by_css_selector，这些就是所有的方法。

除了上述方法，Selenium 还提供了通用方法 find_element，使用这个方法需要传入两个参数：查找方式和方式的取值。这个方法其实就是上述那些方法的通用函数版本，不过它的参数更加灵活。例如 find_element_by_id(id) 就等价于 find_element(By.ID, id)，两个方法得到的结果是完全一致的。我们用代码实现一下：

from selenium import webdriver
from selenium.webdriver.common.by import By

browser = webdriver.Chrome()
browser.get('https://www.taobao.com')
input_first = browser.find_element(By.ID,'q')
print(input_first)
browser.close()

多个节点

如果查找的目标节点在网页中只有一个，那么用 find_element 方法就完全可以实现。但如果目标节点有多个，再用 find_element 方法查找，就只能得到第一个节点了，此时需要用 find_elements 方法才能找到所有满足条件的节点。注意，这个方法名称中的 element 后面多了一个 s，注意区分。

例如，要查找淘宝页面左侧导航条的所有条目，就可以这样实现：

from selenium import webdriver

browser = webdriver.Chrome()
browser.get('https://www.taobao.com')
lis = browser.find_elements_by_css_selector('.service-bd li')
print(lis)
browser.close()

运行结果如下:

[<selenium.webdriver.remote.webelement.WebElement (session="c26290835d4457ebf7d96bfab3740d19", element="0.09221044033125603-1")>, <selenium.webdriver.remote.webelement.WebElement
(session="c26290835d4457ebf7d96bfab3740d19", element="0.09221044033125603-2")>,
<selenium.webdriver.remote.webelement.WebElement (session="c26290835d4457ebf7d96bfab3740d19",
element="0.09221044033125603-3")>....<selenium.webdriver.remote.webelement.WebElement
(session="c26290835d4457ebf7d96bfab3740d19", element="0.09221044033125603-16")>]

这里简化了输出结果，省略了中间部分。可以看到，得到的内容变成了列表类型，列表中的每个节点都属于 WebElement 类型。

总结一下，如果使用 find_element 方法查找，只能得到匹配成功的第一个节点，这个节点是 WebElement 类型的。如果使用 find_elements 方法，那么结果是列表类型的，列表中的每个节点都属于 WebElement 类型。

获取多个节点可以使用 find_elements_by_id、find_elements_by_name、find_elements_by_xpath、 find_elements_by_link_text、find_elements_by_partial_link_text、find_elements_by_tag_name、 find_elements_by_class_name、find_elements_by_css_selector，这些就是所有的方法。

同理，我们也可以直接使用 find_elements 方法，这时可以这样写：

lis = browser.find_elements(By.CSS_SELECTOR, '.service-bd li')

得到的结果是完全一致的。

节点交互

Selenium 可以驱动浏览器执行一些操作。比较常见的用法有：用 send_keys 方法输入文字，用 clear 方法清空文字，用 click 方法点击按钮。示例如下：

from selenium import webdriver
import time

browser = webdriver.Chrome()
browser.get('https://www.taobao.com')
input = browser.find_element_by_id('q')
input.send_keys('iPhone')
time.sleep(1)
input.clear()
input.send_keys('iPad')
button = browser.find_element_by_class_name('btn-search')
button.click()

这里首先驱动浏览器打开淘宝，然后使用 find_element_by_id 方法获取输入框，再使用 send_keys 方法输入文字 iPhone，等待一秒后用 clear 方法清空输入框，并再次调用 send_keys 方法输入文字 iPad，之后使用 find_element_by_class_name 方法获取搜索按钮，最后调用 click 方法实现搜索。

通过上面的方法，我们完成了几种常见的节点操作，更多操作可以参见官方文档的交互动作介绍： http://selenium-python.readthedocs.io/api.html#module-selenium.webdriver.remote.webelement 。

动作链

在上面的实例中，交互操作都是针对某个节点执行的。例如，对于输入框，调用了它的输入文字方法 sendkeys 和清空文字方法 clear；对于搜索按钮，调用了它的点击方法 click。其实还有一些操作，它们没有特定的执行对象，比如鼠标拖曳、键盘按键等，这些操作需要用另一种方式执行，那就是动作链。

例如，可以这样实现拖曳节点的操作，将某个节点从一处拖曳至另一处：

from selenium import webdriver
from selenium.webdriver import ActionChains

browser = webdriver.Chrome()
url = 'http://www.runoob.com/try/try.php?filename=jqueryui-api-droppable'
browser.get(url)
browser.switch_to.frame('iframeResult')
source = browser.find_element_by_css_selector('#draggable')
target = browser.find_element_by_css_selector('#droppable')
actions = ActionChains(browser)
actions.drag_and_drop(source,target)
actions.perform()

这里首先打开网页中的一个拖曳实例，然后依次选中要拖曳的节点和拖曳至的目标节点，接着声明一个 ActionChains 对象并赋值给 actions 变量，再后调用 actions 变量的 drag_and_drop 方法声明拖曳对象和拖曳目标，最后调用 perform 方法执行动作，就完成了拖曳操作，拖曳前和拖曳后的页面如图 7-4 和图 7-5 所示。

图7-4 拖曳前的页面

图7-5 拖曳后的页面

更多的动作链操作可以参考官方文档的介绍： http://selenium-python.readthedocs.io/api.html#module-selenium.webdriver.common.action_chains。

运行 JavaScript

还有一些操作，Selenium 没有提供 API。例如下拉进度条，面对这种情况可以模拟运行 JavaScript 此时使用 execute_script 方法即可实现，代码如下：

from selenium import webdriver

browser = webdriver.Chrome()
browser.get('https://www.zhihu.com/explore')
browser.execute_script('window.scrollTo(o,document.body.scrollHeight)')
browser.execute_script('alert("ToBottom")')

这里利用 execute_script 方法将进度条下拉到了最底部，然后就弹出了警告提示框。所以说有了 execute_script 方法，那些没有被提供 API 的功能几乎都可以用运行 JavaScript 的方式实现

获取节点信息

前面我们已经通过 page_source 属性获取了网页的源代码，下面就可以使用解析库（如正则表达式、Beautiful Soup、pyquery 等）从中提取信息了。

不过，既然 Selenium 已经提供了选择节点的方法，返回的结果是 WebElement 类型，那么它肯定也有相关的方法和属性用来直接提取节点信息，例如属性、文本值等。这样我们就不需要用通过解析源代码提取信息了，非常方便。

让我们一起看看怎样获节点信息吧。

获取属性

可以使用 get_attribute 方法获取节点的属性，但其前提是得先选中这个节点，示例如下：

from selenium import webdriver

browser = webdriver.Chrome()
url = 'https://spa2.scrape.center/'
browser.get(url)
logo = browser.find_element_by_class_name('logo-image')
print(logo)
print(logo.get_attribute('src'))

运行代码，它会驱动浏览器打开示例页面，然后获取其中 class 名称为 logo-image 的节点，最后打印出这个节点的 src 属性。

控制台的输出结果如下：

向 get_attribute 方法的参数传入想要获取的属性名，就可以得到该属性的值了。

获取文本值

每个 WebElement 节点都有 text 属性，直接调用这个属性就可以得到节点内部的文本信息，相当于 pyquery 中的 text 方法，示例如下：

from selenium import webdriver

browser = webdriver.Chrome()
url = 'https://spa2.scrape.center/'
browser.get(url)
input = browser.find_element_by_class_name('logo-title')
print(input.text)

这里依然先打开示例页面，然后获取 class 名称为 logo-title 的节点，再将该节点内部的文本值打印出来。

控制台的输出结果如下：

Scrape

获取D、位置、标签名和大小

除了属性和文本值，WebElement 节点还有一些其他属性，例如 id 属性用于获取节点 ID，location 属性用于获取节点在页面中的相对位置，tag_name 属性用于获取标签的名称，size 属性用于获取节点的大小，也就是宽高，这些属性有时候还是很有用的。示例如下：

from selenium import webdriver

browser = webdriver.Chrome()
url = 'https://spa2.scrape.center/'
browser.get(url)
input = browser.find_elementby_class_name('logo-title')
print(input.id)
print(input.location)
print(input.tag_name)
print(input.size)

这里首先获取 class 名称为 logo-title 的节点，然后分别调用该节点的 id、location、tag_name、size 属性获取了对应的属性值。

切换 Frame

我们知道，网页中有一种节点叫作 iframe，也就是子 Frame，相当于页面的子页面，它的结构和外部网页的结构完全一致。Selenium 打开一个页面后，默认是在父 Frame 里操作，此时这个页面中如果还有子 Frame，它是不能获取子 Frame 里的节点的，这时就需要使用 switch_to.frame 方法切换 Frame。示例如下：

import time
from selenium import webdriver
from selenium.common.exceptions import NoSuchElementException

browser = webdriver.Chrome()
url = "http://www.runoob.com/try/try.php?filename=jqueryui-api-droppable"
browser.get(url)
browser.switch_to.frame('iframeResult')
try:
    logo = browser.find_element_by_class_name('logo')
except NoSuchElementException:
    print('NO LOGO')
browser.switchto.parent_frame()
logo = browser.find_element_by_class_name('logo')
print(logo)
print(logo.text)

这里还是以演示动作链操作时的网页为例，首先通过 switch_to.frame 方法切换到子 Frame 里，然后尝试获取其中的 logo 节点（子 Frame 里并没有 logo 节点），如果找不到，就会抛出 NoSuchElementException 异常，异常被捕捉后，会输出 NO LOGO。接着，切换回父 Frame，重新获取 logo 节点，发现此时可以成功获取了。

控制台的输出结果如下：

所以，当页面中包含子 Frame 时，如果想获取子 Frame 中的节点，需要先调用 switch_to.frame 方法切换到对应的 Frame，再进行操作。

延时等待

在 Selenium 中，get 方法在网页框架加载结束后才会结束执行，如果我们尝试在 get 方法执行完毕时获取网页源代码，其结果可能并不是浏览器完全加载完成的页面，因为某些页面有额外的 Ajax 请求，页面还会经由 JavaScript 染。所以，在必要的时候，我们需要设置浏览器延时等待一定的时间，确保节点已经加载出来。

这里等待方式有两种：一种是隐式等待，一种是显式等待。

隐式等待

使用隐式等待执行测试时，如果 Selenium 没有在 DOM 中找到节点，将继续等待，在超出设定时间后，抛出找不到节点的异常。换句话说，在查找节点而节点没有立即出现时，隐式等待会先等待一段时间再查找 DOM，默认的等待时间是 0。示例如下：

from selenium import webdriver

browser = webdriver.Chrome()
browser.implicitly_wait(10)
browser.get('https://spa2.scrape.center/')
input = browser.find_element_by_class_name('logo-image')
print(input)

这里我们用 implicitly_wait 方法实现了隐式等待。

显式等待

隐式等待的效果其实并不好，因为我们只规定了一个固定时间，而页面的加载时间会受网络条件影响。

还有一种更合适的等待方式一一显式等待，这种方式会指定要查找的节点和最长等待时间。如果在规定时间内加载出了要查找的节点，就返回这个节点；如果到了规定时间依然没有加载出点，就抛出超时异常。示例如下：

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

browser = webdriver.Chrome()
browser.get('https://www.taobao.com/')
wait = WebDriverWait(browser, 10)
input = wait.until(EC.presence_of_element_located((By.ID, 'q')))
button = wait.until(EC.element_to_be_clickable((By.CSS_SELECTOR, '.btn-search')))
print(input, button)

这里首先引人 WebDriverwait 对象，指定最长等待时间为 10，并赋值给 wait 变量。然后调用 wait 的 until 方法，传入等待条件。

这里先传入了 presence_of_element_located 这个条件，代表节点出现，其参数是节点的定位元组 (By.ID, 'q')，表示节点 ID 为 q 的节点（即搜索框）。这样做达到的效果是如果节点 ID 为 q 的节点在 10 秒内成功加载出来了，就返回该节点；如果超过 10 秒还没有加载出来，就抛出异常。

然后传入的等待条件是 element_to_be_clickable，代表按钮可点击，所以查找按钮时要查找 CSS 选择器为 .btn-search 的按钮，如果 10 秒内它是可点击的，也就是按钮节点成功加载出来了，就返回该节点：如果超过 10 秒还是不可点击，也就是按钮节点没有加载出来，就抛出异常。

运行代码，在网速较佳的情况下是可以成功加载出节点的。

控制台的输出结果如下：

<selenium.webdriver.remote.webelement.WebElement (session="07dd2fbc2d5b1ce40e82b9754aba8fa8", element="0.5642646294074107-1")>
<selenium.webdriver.remote.webelement.WebElement (session="07dd2fbc2d5b1ce40e82b9754aba8fa8", element="0.5642646294074107-2")>

可以看到，成功输出了两个节点，都是 WebElement 类型的。

如果网络有问题，10 秒到了还是没有成功加载，就抛出 TimeoutException 异常，此时控制台的输出结果如下：

TimeoutException Traceback (most recent call last)
<ipython-input-4-f3d73973b223> in <module>()
      7 browser.get('https://www.taobao.com/')
      8 wait = WebDriverWait(browser, 10)
----> 9 input = wait.until(EC.presence_of_element_located((By.ID, 'q')))

除了我们介绍的这两个，等待条件其实还有很多，例如判断标题内容、判断某个节点内是否出现了某文字等。表 7-1 列出了所有等待条件。

Table 1. 表 7-1 等待条件
等待条件	含义
`title_is`	标题是某内容
`title_contains`	标题包含某内容
`presence_of_element_located`	节点出现，参数为节点的定位元组，如 (By.ID, 'p')
`visibility_of_element_located`	节点可见，参数为节点的定位元组
`visibility_of`	可见，参数为节点对象
`presence_of_all_elements_located`	所有节点都出现
`text_to_be_present_in_element`	某个节点的文本值中包含某文字
`text_to_be_present_in_element_value`	某个节点值中包含某文字
`frame_to_be_available_and_switch_to_it`	加载并切换
`invisibility_of_element_located`	节点不可见
`element_to_be_clickable`	按钮可点击
`staleness_of`	判断一个节点是否仍在 DOM 树中，可知页面是否已经刷新
`element_to_be_selected`	节点可选择，参数为节点对象
`element_located_to_be_selected`	节点可选择，参数为节点的定位元组
`element_selection_state_to_be`	参数为节点对象及状态，相等返回 True，否则返回 False
`element_located_selection_state_to_be`	参数为定位元组及状态，相等返回 True，否则返回 False
`alert_is_present`	是否出现警告框

更多等待条件的参数及用法介绍可以参考官方文档： http://selenium-python.readthedocs.io/api.html#module-selenium.webdriver.support.expected_conditions 。

前进和后退

平常使用浏览器时，都有前进和后退功能，Selenium 也可以完成这个操作，它使用 forward 方法实现前进，使用 back 方法实现后退。示例如下：

import time
from selenium import webdriver

browser = webdriver.Chrome()
browser.get('https://www.baidu.com/')
browser.get('https://www.taobao.com/')
browser.get('https://www.python.org/')
browser.back()
time.sleep(1)
browser.forward()
browser.close()

这里我们先连续访问了 3 个页面，然后调用 back 方法回到第 2 个页面，接着调用 forward 方法又前进到第 3 个页面。

Cookie

使用 Selenium，还可以方便地对 Cookie 进行操作，例如获取、添加、删除等。示例如下：

from selenium import webdriver

browser = webdriver.Chrome()
browser.get('https://www.zhihu.com/explore')
print(browser.get_cookies())
browser.add_cookie({'name': 'name', 'domain': 'www.zhihu.com', 'value': 'germey'})
print(browser.get_cookies())
browser.delete_all_cookies()
print(browser.get_cookies())

这里我们先访问了知乎。知乎页面加载完成后，浏览器其实已经生成 Cookie 了。然后，调用浏览器对象的 get_cookies 方法获取所有的 Cookie。接着，添加一个 Cookie，这里传入了一个字典，包含 name、domain 和 value 等键值。之后，再次获取所有的 Cookie，会发现结果中多了一项，就是我们新加的 Cookie。最后，调用 delete_all_cookies 方法删除所有的 Cookie 并再次获取，会发现此时结果就为空了。

控制台的输出结果如下：

[{'secure': False, 'value': '"NGMOZTM5NDAwMWFEYNDQWNDk5ODlkZWY3OTkXY2IONDY=|1491604091|
236e34290a6f407bfbb517888849ea509ac366d0"', 'domain': '.zhihu.com', 'path': '/', 'httpOnly': False, 'name':
'_zap_cap_id', 'expiry': 1494196091.403418}, ...]
[{'secure': False, 'value': 'germey', 'domain': '.www.zhihu.com', 'path': '/', 'httpOnly': False, 'name':
'name'}, {'secure': False, 'value': '"NGMOZTM5NDAwMWFEYNDQWNDk5ODlkZWY3OTkXY2IONDY=|1491604091|
236e34290a6f407bfbb517888849ea509ac366d0"', 'domain': '.zhihu.com', 'path': '/', 'httpOnly': False, 'name':
'_zap_cap_id', 'expiry': 1494196091.403418}, ...]
[]

通过以上方法操作 Cookie 还是非常方便的。

选项卡管理

访问网页的时候，会开启一个个选项卡。在 Selenium 中，我们也可以对选项卡做操作。示例如下：

import time
from selenium import webdriver

browser = webdriver.Chrome()
browser.get('https://www.baidu.com')
browser.execute_script('window.open()')
print(browser.window_handles)
browser.switch_to.window(browser.window_handles[1])
browser.get('https://www.taobao.com')
time.sleep(1)
browser.switch_to.window(browser.window_handles[0])
browser.get('https://python.org')

这里首先访问百度，然后调用 execute_script 方法，向其参数传入 window.open() 这个 JavaScript 语句，表示新开启一个选项卡。接着，我们想切换到这个新开的选项卡。window_handles 属性用于获取当前开启的所有选项卡，返回值是选项卡的代号列表。要想切换选项卡，只需要调用 switch_to.window 方法即可，其中参数是目的选项卡的代号。这里我们将新开选项卡的代号传入，就切换到了第 2 个选项卡，然后在这个选项卡下打开一个新页面，再重新调用 switch_to.window 方法切换回第 1 个选项卡。

控制台的输出结果如下：

['CDwindow-4f58e3a7-7167-4587-bedf-9cd8c867f435', 'CDwindow-6e05f076-6d77-453a-a36c-32baacc447df']

异常处理

在使用 Selenium 的过程中，难免会遇到一些异常，例如超时、节点未找到等，一旦出现此类异常，程序便不会继续运行了。此时我们可以使用 try except 语句捕获各种异常。

首先，演示一下节点未找到的异常，示例如下：

from selenium import webdriver

browser = webdriver.Chrome()
browser.get('https://www.baidu.com')
browser.find_element_by_id('hello')

这里首先打开百度页面，然后尝试选择一个并不存在的节点，就会遇到节点未找到的异常。

控制台的输出结果如下：

NoSuchElementException Traceback (most recent call last)
<ipython-input-23-978945848a1b> in <module>()
      3 browser = webdriver.Chrome()
      4 browser.get('https://www.baidu.com')
----> 5 browser.find_element_by_id('hello')

可以看到，这里抛出了 NoSuchElementException 异常，这通常表示节点未找到。为了防止程序遇到异常而中断运行，我们需要捕获这些异常，示例如下：

from selenium import webdriver
from selenium.common.exceptions import TimeoutException, NoSuchElementException

browser = webdriver.Chrome()
try:
    browser.get('https://www.baidu.com')
except TimeoutException:
    print('Time Out')

try:
    browser.find_element_by_id('hello')
except NoSuchElementException:
    print('No Element')
finally:
    browser.close()

这里我们使用 try except 语句捕获各类异常。例如，对查找节点的方法 find_element_by_id 捕获 NoSuchElementException 异常，这样一旦出现这样的错误，就会进行异常处理，程序也不会中断。

控制台的输出结果如下： No Element

关于更多的异常类，可以参考官方文档： http://selenium-python.readthedocs.io/api.html#module-selenium.common.exceptions。

反屏蔽

现在有很多网站增加了对 Selenium 的检测，防止一些爬虫的恶意爬取，如果检测到有人使用 Selenium 打开浏览器，就直接屏蔽。

在大多数情况下，检测的基本原理是检测当前浏览器窗口下的 window.navigator 对象中是否包含 webdriver 属性。因为在正常使用浏览器时，这个属性应该是 undefined ，一旦使用了 Selenium，它就会给 window.navigator 对象设置 webdriver 属性。很多网站通过 JavaScript 语句判断是否存在 webdriver 属性，如果存在就直接屏蔽。

一个典型的案例网站 https://antispiderl.scrape.center/ 就是使用上述原理，检测是否存在 webdriver 属性，如果我们使用 Selenium 直接爬取该网站的数据，网站就会返回如图 7-6 所示的页面。

图 7-6 使用 Selenium 打开浏览器的结果

这时可能有人会说直接使用 JavaScript 语句把 webdriver 属性置空不就行了，例如调用 execute_script 方法执行这行代码：

Object.defineProperty(navigator, "webdriver"，(get：()=>undefined))

这行代码的确可以把 webdriver 属性置空，但 execute_script 方法是在页面加载完毕之后才调用这行 JavaScript 语句的，太晚了，网站早在页面煊染之前就已经检测 webdriver 属性了，所以上述方法并不能达到预期的效果。

在 Selenium 中，可以用 CDP（即 Chrome Devtools Protocol，Chrome 开发工具协议）解决这个问题，利用它可以实现在每个页面刚加载的时候就执行 JavaScript 语句，将 webdriver 属性置空。这里执行的 CDP 方法叫作 Page.addScriptToEvaluateOnNewDocument，将上面的 JavaScript 语句传入其中即可。另外，还可以加入几个选项来隐藏 WebDriver 提示条和自动化扩展信息，代码实现如下：

from selenium import webdriver
from selenium.webdriver import ChromeOptions

option = ChromeOptions()
option.add_experimental_option('excludeSwitches', ['enable-automation'])
option.add_experimental_option('useAutomationExtension', False)
browser = webdriver.Chrome(options=option)
browser.execute_cdp_cmd('Page.addScriptToEvaluateOnNewDocument', {
    'source': 'Object.defineProperty(navigator, "webdriver", {get: () => undefined})'
})
browser.get('https://antispider1.scrape.center/')

这样就能加载出整个页面了，如图7-7所示。

图7-7加载出了案例网站的整个页面

在大多数时候，以上方法可以实现 Selenium 的反屏蔽。但也存在一些特殊网站会对 WebDriver 属性设置更多的特征检测，这种情况下可能需要具体排查。

无头模式

不知道大家是否观察到，上面的案例在运行时，总会弹出一个浏览器窗口，虽然有助于观察页面的爬取状况，但窗口弹来弹去有时也会造成一些干扰。

Chrome 浏览器从 60 版本起，已经开启了对无头模式的支持，即 Headless。无头模式下，在网站运行的寸候不会弹出窗口，从而减少了干扰，同时还减少了一些资源（如图片）的加载，所以无头模式也在十定程度上节省了资源加载的时间和网络带宽。

我们可以借助 ChromeOptions 对象开启 Chrome 浏览器的无头模式，代码实现如下：

from selenium import webdriver
from selenium.webdriver import ChromeOptions

option = ChromeOptions()
option.add_argument('--headless')
browser = webdriver.Chrome(options=option)
browser.set_window_size(1366, 768)
browser.get('https://www.baidu.com')
browser.get_screenshot_as_file('preview.png')

这里利用 ChromeOptions 对象的 add_argument 方法添加了一个参数 --headless，从而开启了无头模式。在无头模式下，最好设置一下窗口的大小，因此这里调用了 set_window_size 方法。之后打开页面，并调用 get_screenshot_as_file 方法输出了页面截图。

运行这段代码后，会发现窗口不会再弹出来了，代码依然正常运行，最后输出的页面截图如图7-8 所示。

图7-8输出的页面截图

这样我们就在无头模式下完成了页面的爬取和截图操作。

总结

现在，我们大体了解了 Selenium 的常规用法。有了 Selenium 处理 JavaScript 渲染的页面不再是难事，7.5 节我们会用一个实例演示利用 Selenium 爬取网站的流程。

本节代码参见: https://github.com/Python3WebSpider/SeleniumTest