一文掌握Python爬虫XPath语法_Python

一、问题描述

1.什么是XPath？

xpath是一门在XML和HTML文档中查找信息的语言，可用来在XML和HTML文档中对元素和属性进行遍历，XPath 通过使用路径表达式来选取 XML 文档中的节点或者节点集。这些路径表达式和在常规的电脑文件系统中看到的表达式非常相似。

二、解决方案

1.XPath语法

想要学好xpath，首先要搞明白html文档中的节点。

				?

									<div>

									     <ul>

									          <li class="item-0"><a href="link1.html" rel="external nofollow" >first item</a></li>

									          <li class="item-1"><a href="link2.html" rel="external nofollow" >second item</a></li>

									          <li class="item-inactive"><a href="link3.html" rel="external nofollow" >third item</a></li>

									          <li class="item-1"><a href="link4.html" rel="external nofollow" >fourth item</a></li>

									          <li class="item-0"><a href="link5.html" rel="external nofollow" >fifth item</a> # 注意，此处缺少一个 </li> 闭合标签

									      </ul>

									  </div>

以上是在网上随便找的一段html的文本，可以观察得到，div的标签下是ul标签，而ul标签下是li标签，于是发现html的标签是一级一级如树状的。Xpath正是通过这样的方式去寻找。以生活中举例，要确定一个人的位置，首先确定他在中国，然后确定他在某个省份，哪座城市，那个小区，最后找到他。

表达式	描述
Nodename	选取此节点的所有子节点 bookstore 选取bookstore下所有的子节点
/	如果是在最前面，代表从根节点选取。否则选择某节点下的某个节点 /bookstore 选取根元素下所有的bookstore节点
//	从全局节点中选择节点，随便在哪个位置 //book 从全局节点中找到所有的book节点
@	选取某个节点的属性 //book[@price] 选择所有拥有price属性的book节点
.	当前节点
Text()	获取标签中的文本