Python|快速掌握Python爬虫XPath语法-天翼云

Python|快速掌握Python爬虫XPath语法

2023-02-27 09:25:35 阅读次数：126

1.什么是XPath？

xpath是一门在XML和HTML文档中查找信息的语言，可用来在XML和HTML文档中对元素和属性进行遍历，XPath 通过使用路径表达式来选取 XML 文档中的节点或者节点集。这些路径表达式和在常规的电脑文件系统中看到的表达式非常相似。

2.XPath语法

想要学好xpath，首先要搞明白html文档中的节点。

first item second item third item fourth item fifth item # 注意，此处缺少一个闭合标签

以上是在网上随便找的一段html的文本，可以观察得到，div的标签下是ul标签，而ul标签下是li标签，于是发现html的标签是一级一级如树状的。Xpath正是通过这样的方式去寻找。以生活中举例，要确定一个人的位置，首先确定他在中国，然后确定他在某个省份，哪座城市，那个小区，最后找到他。

表达式	描述
Nodename	选取此节点的所有子节点 bookstore 选取bookstore下所有的子节点
/	如果是在最前面，代表从根节点选取。否则选择某节点下的某个节点 /bookstore 选取根元素下所有的bookstore节点
//	从全局节点中选择节点，随便在哪个位置 //book 从全局节点中找到所有的book节点
@	选取某个节点的属性 //book[@price] 选择所有拥有price属性的book节点
.	当前节点
Text()	获取标签中的文本

同级标签可以用li[1],li[2],li[3]的方式获取

3.lxml库

简单介绍一下lxml库，接下来会用到它

lxml是一个HTML/XML的解析器，主要的功能是如何解析和提取HTML/XML 数据。

lxml和正则一样，也是用C实现的，是一款高性能的PythonHTML/XML解析器，可以利用之前学习的XPath语法，来快速的定位特定元素以及节点信息。

4.实际案例

随便爬取一个网站，找到找到网站的html文本，如下图

Python|快速掌握Python爬虫XPath语法_编程之美_02

5.总结

Xpath，是在爬虫中常见的提取数据的方式之一，相比于正则，它更加简单一些，便于操作，xpath的难点在于准确的确定数据所在的位置。

活动

智算服务

应用商城

合作伙伴

开发者

支持与服务

了解天翼云

Python|快速掌握Python爬虫XPath语法

Python|快速掌握Python爬虫XPath语法

相关文章

python四种抽样方法的使用：随机抽样、聚类抽样、系统抽样、分层抽样

视频 | Python测试开发之调试print代码实例

python简单介绍及基础知识（一）

[快学Python3]XML解析处理 - Element Tree

使用Python扩展PAM（part 2）

1行Python代码，把Excel转成PDF，python-office功能更新~

IronPython 与 c# 交互之导入Python模块的两种方法

python性能测试之pyperformance

Python高维统计建模变量选择:SCAD平滑剪切绝对偏差惩罚、Lasso惩罚函数比较

一篇文章教会你Python中三种简单函数的使用

作者介绍

最新文章

python四种抽样方法的使用：随机抽样、聚类抽样、系统抽样、分层抽样

[快学Python3]XML解析处理 - Element Tree

视频 | Python测试开发之调试print代码实例

python简单介绍及基础知识（一）

使用Python扩展PAM（part 2）

1行Python代码，把Excel转成PDF，python-office功能更新~

热门文章

Linux实用命令authconfig和authconfig-tui（备忘）

Python高级变量类型

python学习——面向对象编程

一个简单的http server，处理get和post请求，Python实现

Python数据库测试实战教程

Python编程：生成器yield与yield from区别简单理解

热门标签

相关产品

弹性云主机

天翼云电脑（公众版）

对象存储

云硬盘

随机文章

python-面向对向-实例方法的继承

Scala 模式匹配

Python面向对象概述

Python编程：面向对象深入

Python基础 is与==的区别

python3 lambda表达式与函数式编程