python用match()函数爬数据方法详解

Aurora ·

更新时间:2024-11-01

· 771 次阅读

match()函数的使用。以及从文本中提取数据的方法。在学习re模块的相关函数前应了解正则表达式的特殊字符

准备一个要爬取的文本文档：

直接从某个网页拷贝一份代码，粘贴在一个txt文件里，以供学习。

方法很简单，比如打开百度视频的热门电影网页，右键点击查看源代码，然后复制，粘贴到一个txt文件里，保存到工作目录下。

有4000多行。


re.match(pattern, string, flags=0)

①pattern，是正则表达式。string，被检验的字符串。

②flags是可选参数，此标记是用来对patten的补充。例如：re.S，可以让正则表达式中的点匹配换行符\n。(如图片中，可以看帮助文档，查看有哪些标记）

③ match()函数由左向右检验string，若匹配到正则表达式，返回一个匹配对象，否则就返回None.

④re.match() 匹配字符串的开始位置，而不匹配每行开始。

----所以才将网页的每行放入列表，以供match函数对每行操作。

比如要在文档中，提取电影的网址，和电影名。

①复制那行文本作为表达式，

②将要提取的网址和和电影名替换为(.*)，这只是暂时的，可以在接下来的代码中调整。

读取文本：

①用with open（）语句读取；

②用readlines，一次性读完，返回一个列表，元素是文本的每一行。


with open('aa.txt','r',encoding='utf-8') as f:
  lines=f.readlines()

①判断每行是否返回了匹配的对象，

②接收匹配对象，并用groups()提取表达式内括号的内容；


for line in lines:
  if re.match(pat,line):   #判断过滤掉返回None的行，
    ret=re.match(pat,line) #接收匹配对象
    print(ret.groups())

发现有不符合的行，稍加修改，过滤掉不符合的行：

因为，不合的行都有空格（或其他字符）。可以给第二子组的点 . 换成非[^ ]；非空格的任意字符，意思就是不要有空格的。

用f-string格式化对输出的文本稍加修饰，使用group(1)，group(2);

可以将这段代码封装为一个函数。爬取百度视频的其他栏目。

测试: 百度视频的电影，电视剧，和动漫等栏目，网页上的格式基本相同，所以用上面的函数直接套用。

打开百度视频的动漫，复制源代码，存为bb.txt。

同样可以爬取网址和视频名称。

以上仅是练习match()函数的例子。

以上就是关于python如何用match()函数爬数据的全部内容，感谢大家的阅读和对软件开发网的支持。

您可能感兴趣的文章:Python中正则表达式match()、search()函数及match()和search()的区别详解

方法数据函数 match Python

1024 个赞

需要登录后方可回复, 如果你还没有账号请注册新账号

HTML 字符集

Kamiisa 2020-04-27

703

正则表达式 - 示例

Linda 2021-05-05

569

.NET Core 2.0迁移小技巧之MemoryCache问题修复解决的方法

Nita 2021-07-06

975

详解css栅格系统在项目中的灵活运用

Ursula 2020-04-01

908

Laravel 中使用简单的方法跟踪用户是否在线(推荐)

Serwa 2020-03-20

874

ssh报错nokeyalg的解决方法(关于低版本连接高版本ssh)

Jacinthe 2023-08-08

339

在没有Docker缓存的情况下构建镜像的方法分享

Viridis 2023-08-08

1779

docker-compose中启动镜像失败的几种解决方法

Hana 2023-08-08

725

Windows服务器默认IE浏览器无法下载文件的解决方法

Cybill 2023-08-08

1355

Windows服务器长时间保持远程桌面不被自动断开的方法

Elsa 2023-08-08

1249

Python 对象拷贝及深浅拷贝区别的详细教程示例

Miette 2023-08-09

488

使用Python对接OpenAi API实现智能QQ机器人的方法

Miette 2023-08-28

1874

python进阶学习实时目标跟踪示例详解

Serafina 2023-08-28

1732

Python人工智能语音合成实现案例详解

Rhea 2023-08-28

744

python Tkinter实例详解

Malinda 2023-08-28

1999

Python人工智能构建简单聊天机器人示例详解

Kathy 2023-08-28

1370

Python ttkbootstrap的介绍与使用教程

Nora 2023-08-28

1592

python中os模块和sys模块的使用详解

Pandora 2023-08-28

600

Python中的QPixmap用法详解

Tani 2023-08-28

951

pytorch SummaryWriter保存日志的方法

Tanisha 2023-08-28

1486

我要提问

致谢

帮助他人，成就自己。

人生最大成功就是伸出热情而温暖的双手，尽自己所能去帮助身边的每一个人，只要无私的奉献，就会收获到美好的生活。

1024问感谢每一位朋友的帮助和支持。

软件开发网提供编程的基础软件技术培训教程,软件开发编程实例讲解Go,Node,HTML,CSS,Javascript,Python,Java,Ruby,C,PHP,MySQL等软件开发编程语言以及数据开发的基础知识，也提供大量的软件开发在线实例、从入门到精通就在1024问。

育儿网微养生全球行美食街育儿菜谱大全海南旅游女性养狗百科星座