某网站查询页面的辣鸡爬虫
March 12, 2020
## 阅前须知
1. 由于该网站太顶风作案,域名我和谐了,懂的自然懂
2. 我还在学 py,代码过于辣鸡甚至没有优化,调用方法完全乱套
## 背景
由于用公司研发部同事基于 Java 开发的某网站查询的爬虫用得太爽了,搞到我自己都想抄一份试试了,并在此之前通过百度“抄了”很多方法做了个多线程查询接口的小程序就有点膨胀了(其实代码还是一坨屎,而不需要太多字符串处理)
同事做的虽然速度很快,还特意为验证码做了训练识别率超高也很快,后来我反编译同事的源码发现用了阿里云的 OCR 服务,爷懂了,这就是在线识别的速度吗,爷i了(.....