python验证码识别教程之灰度处理、二值化、降噪与tesserocr识别

Gelsey ·

更新时间:2024-11-14

· 949 次阅读

前言

写爬虫有一个绕不过去的问题就是验证码，现在验证码分类大概有4种：

图像类滑动类点击类语音类

今天先来看看图像类，这类验证码大多是数字、字母的组合，国内也有使用汉字的。在这个基础上增加噪点、干扰线、变形、重叠、不同字体颜色等方法来增加识别难度。

相应的，验证码识别大体可以分为下面几个步骤：

灰度处理增加对比度(可选) 二值化降噪倾斜校正分割字符建立训练库识别

由于是实验性质的，文中用到的验证码均为程序生成而不是批量下载真实的网站验证码，这样做的好处就是可以有大量的知道明确结果的数据集。

当需要真实环境下需要获取数据时，可以使用结合各个大码平台来建立数据集进行训练。

生成验证码这里我使用Claptcha （本地下载）这个库，当然Captcha（本地下载）这个库也是个不错的选择。

为了生成最简单的纯数字、无干扰的验证码，首先需要将claptcha.py的285行_drawLine做一些修改，我直接让这个函数返回None，然后开始生成验证码：


from claptcha import Claptcha
c = Claptcha("8069","/usr/share/fonts/truetype/freefont/FreeMono.ttf")
t,_ = c.write('1.png')

这里需要注意ubuntu的字体路径，也可以在网上下载其他字体使用。生成验证码如下：

可以看出，验证码有形变。对于这类最简单的验证码，可以直接使用谷歌开源的tesserocr来识别。

首先安装：


apt-get install tesseract-ocr libtesseract-dev libleptonica-dev
pip install tesserocr

然后开始识别：


from PIL import Image
import tesserocr
p1 = Image.open('1.png')
tesserocr.image_to_text(p1)
'8069\n\n'

可以看出，对于这种简单的验证码，基本什么都不做识别率就已经很高了。有兴趣的小伙伴可以用更多的数据来测试，这里我就不展开了。

接下来，在验证码背景添加噪点来看看：


c = Claptcha("8069","/usr/share/fonts/truetype/freefont/FreeMono.ttf",noise=0.4)
t,_ = c.write('2.png')

生成验证码如下：

识别：


p2 = Image.open('2.png')
tesserocr.image_to_text(p2)
'8069\n\n'

效果还可以。接下来生成一个字母数字组合的：


c2 = Claptcha("A4oO0zZ2","/usr/share/fonts/truetype/freefont/FreeMono.ttf")
t,_ = c2.write('3.png')

生成验证码如下：

第3个为小写字母o，第4个为大写字母O，第5个为数字0，第6个为小写字母z，第7个为大写字母Z，最后一个是数字2。人眼已经跪了有木有！但现在一般验证码对大小写是不做严格区分的，看自动识别什么样吧：


p3 = Image.open('3.png')
tesserocr.image_to_text(p3)
'AMOOZW\n\n'

人眼都跪的计算机当然也废了。但是，对于一些干扰小、形变不严重的，使用tesserocr还是十分简单方便的。然后将修改的claptcha.py的285行_drawLine还原，看添加干扰线的情况。


p4 = Image.open('4.png')
tesserocr.image_to_text(p4)
''

加了条干扰线就完全识别不出来了，那么有没有什么办法去除干扰线呢？

虽然图片看上去是黑白的，但还需要进行灰度处理，否则使用load()函数得到的是某个像素点的RGB元组而不是单一值了。处理如下：


def binarizing(img,threshold):
 """传入image对象进行灰度、二值处理"""
 img = img.convert("L") # 转灰度
 pixdata = img.load()
 w, h = img.size
 # 遍历所有像素，大于阈值的为黑色
 for y in range(h):
  for x in range(w):
   if pixdata[x, y] < threshold:
    pixdata[x, y] = 0
   else:
    pixdata[x, y] = 255
 return img

处理后的图片如下：

可以看出处理后图片锐化了很多，接下来尝试去除干扰线，常见的4邻域、8邻域算法。所谓的X邻域算法，可以参考手机九宫格输入法，按键5为要判断的像素点，4邻域就是判断上下左右，8邻域就是判断周围8个像素点。如果这4或8个点中255的个数大于某个阈值则判断这个点为噪音，阈值可以根据实际情况修改。


def depoint(img):
 """传入二值化后的图片进行降噪"""
 pixdata = img.load()
 w,h = img.size
 for y in range(1,h-1):
  for x in range(1,w-1):
   count = 0
   if pixdata[x,y-1] > 245:#上
    count = count + 1
   if pixdata[x,y+1] > 245:#下
    count = count + 1
   if pixdata[x-1,y] > 245:#左
    count = count + 1
   if pixdata[x+1,y] > 245:#右
    count = count + 1
   if pixdata[x-1,y-1] > 245:#左上
    count = count + 1
   if pixdata[x-1,y+1] > 245:#左下
    count = count + 1
   if pixdata[x+1,y-1] > 245:#右上
    count = count + 1
   if pixdata[x+1,y+1] > 245:#右下
    count = count + 1
   if count > 4:
    pixdata[x,y] = 255
 return img

处理后的图片如下：

好像……根本没卵用啊？！确实是这样的，因为示例中的图片干扰线的宽度和数字是一样的。对于干扰线和数据像素不同的，比如Captcha生成的验证码：

从左到右依次是原图、二值化、去除干扰线的情况，总体降噪的效果还是比较明显的。另外降噪可以多次执行，比如我对上面的降噪后结果再进行依次降噪，可以得到下面的效果：

再进行识别得到了结果：


p7 = Image.open('7.png')
tesserocr.image_to_text(p7)
'8069 ,,\n\n'

另外，从图片来看，实际数据颜色明显和噪点干扰线不同，根据这一点可以直接把噪点全部去除，这里就不展开说了。
第一篇文章，先记录如何将图片进行灰度处理、二值化、降噪，并结合tesserocr来识别简单的验证码，剩下的部分在下一篇文章中和大家一起分享。

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作具有一定的参考学习价值，如果有疑问大家可以留言交流，谢谢大家对软件开发网的支持。

您可能感兴趣的文章:python对验证码降噪的实现示例代码

程之二值化 Python 教程

1024 个赞

需要登录后方可回复, 如果你还没有账号请注册新账号

Go 语言Map(集合)

Kara 2021-05-30

918

HTML 字符集

Kamiisa 2020-04-27

703

CSS布局之如何实现居中布局

Kiran 2020-10-18

579

正则表达式小脚本(对输入内容进行处理)

Octavia 2021-08-05

844

Python采集二手车数据的超详细讲解

Pandora 2023-07-24

294

Python进阶之利用+和*进行列表拼接

Tani 2023-07-24

656

Python进阶之列表推导与生成器表达式详解

Tanisha 2023-07-24

1394

Python实战使用XPath采集数据示例解析

Diane 2023-07-24

1433

Windows server 2019 批量创建用户的详细教程

Diane 2023-08-08

1728

IIS10服务器安装SSL证书的图文教程

Olinda 2023-08-08

1419

Python 对象拷贝及深浅拷贝区别的详细教程示例

Miette 2023-08-09

488

使用Python对接OpenAi API实现智能QQ机器人的方法

Miette 2023-08-28

1874

python进阶学习实时目标跟踪示例详解

Serafina 2023-08-28

1732

Python人工智能语音合成实现案例详解

Rhea 2023-08-28

744

python Tkinter实例详解

Malinda 2023-08-28

1999

Python人工智能构建简单聊天机器人示例详解

Kathy 2023-08-28

1370

Python ttkbootstrap的介绍与使用教程

Nora 2023-08-28

1592

python中os模块和sys模块的使用详解

Pandora 2023-08-28

600

Python中的QPixmap用法详解

Tani 2023-08-28

951

python人工智能算法之线性回归实例

Diane 2023-08-28

527

我要提问

致谢

帮助他人，成就自己。

人生最大成功就是伸出热情而温暖的双手，尽自己所能去帮助身边的每一个人，只要无私的奉献，就会收获到美好的生活。

1024问感谢每一位朋友的帮助和支持。

软件开发网提供编程的基础软件技术培训教程,软件开发编程实例讲解Go,Node,HTML,CSS,Javascript,Python,Java,Ruby,C,PHP,MySQL等软件开发编程语言以及数据开发的基础知识，也提供大量的软件开发在线实例、从入门到精通就在1024问。

育儿网微养生全球行美食街育儿菜谱大全海南旅游女性养狗百科星座