import Requests
有三个 url ,登陆页面,表单提交页面,登陆返回页面
首先浏览器过程如下:
1.登陆要输入验证码,验证码在登陆页面显示
2.输入登录信息之后, post 表单到表单提交页面
3.然后页面跳转到登陆返回页面,也就是我要抓取的页面
我用爬虫模拟登陆,然后抓取登陆返回页面的信息
requests.get 登陆页面,然后提取页面中的验证码链接,但是验证码链接刷新,验证码就会变化
验证码页面 http://ah.189.cn/sso/VImage.servlet?random=0.17272478651825085 (参数在登陆页面是会变化的)
requests.port 表单提交页面(验证码,我通过 ocr 验证码图片来解决)
我现在有三个个问题:
- 我提取到的验证码能否 post 成功(不能保证是否同步)?
- requests 这三个页面,带的 cookies 和 headers 是否相同?
- 用之前 post 过程中的 cookies 和 headers 来直接抓取登陆返回页面?
谢谢