已解决urllib.error.HTTPError: HTTP Error 403: Forbidden
已解决(python使用urlopen/urlretrieve下载文件时出现403 forbidden)urllib.error.HTTPError: HTTP Error 403: Forbidden
报错代码
urllib.urlretrieve(url[, filename[, reporthook[, data]]])
参数说明:
- url:外部或者本地url
- filename:指定了保存到本地的路径(如果未指定该参数,urllib会生成一个临时文件来保存数据);
- reporthook:是一个回调函数,当连接上服务器、以及相应的数据块传输完毕的时候会触发该回调。我们可以利用这个回调函数来显示当前的下载进度。
- data:指post到服务器的数据。该方法返回一个包含两个元素的元组(filename, headers),filename表示保存到本地的路径,header表示服务器的响应头。
最近用urllib编写了一个简单的爬虫下载网上文件的代码,刚运行没多久就每个url都报403错误。但是手动在浏览器端访问却是能够访问的。报错代码如下:
from urllib.request import urlretrieve
import wget
url = "http://cdict.qq.pinyin.cn/download?dict_id=s49272" # 请求下载文件地址
urlretrieve(url, '1.qcel') # 第二个参数表示路径
报错信息截图如下:
报错翻译
报错信息翻译:
错误。HTTP错误403:禁止
报错原因
报错原因:
访问网站403错误:资源不可用,403错误是一种在网站访问过程中,常见的错误提示,表示资源不可用。服务器理解客户的请求,但拒绝处理它,通常由于服务器上文件或目录的权限设置导致的WEB访问错误。
出现该错误的原因是服务器开启了反爬虫,一般情况下只需要设置header模拟浏览器即可,但是urlretrieve并未提供header参数。
解决方法
(1)排查发现可能是服务器开启了反爬虫,针对这种情况添加headers浏览器头,模拟人工访问网站行为:
from urllib.request import urlretrieve
import urllib
import random
url = "http://cdict.qq.pinyin.cn/download?dict_id=s49272" # 请求下载文件地址
urlretrieve(url, '1.qcel') # 第二个参数表示路径
opener = urllib.request.build_opener()
# 构建请求头列表每次随机选择一个
ua_list = ['Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:102.0) Gecko/20100101 Firefox/102.0',
'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/103.0.0.0 Safari/537.36',
'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/103.0.5060.114 Safari/537.36 Edg/103.0.1264.62',
'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:98.0) Gecko/20100101 Firefox/98.0',
'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.81 Safari/537.36 SE 2.X MetaSr 1.0'
]
opener.addheaders = [('User-Agent', random.choice(ua_list))]
urllib.request.install_opener(opener)
urlretrieve(url, '1.qcel')
(2)如果网站反爬虫级别特别高的,还需要切换代理ip:使用urllib模块设置代理IP是比较简单的,首先需要创建ProxyHandler对象,其参数为字典类型的代理IP,键名为协议类型(如HTTP或者HTTPS),值为代理链接。然后利用ProxyHandler对象与buildopener()方法构建一个新的opener对象,最后再发送网络请求即可。
# 创建代理IP
proxy_handler = urllib.request.ProxyHandler({
'https':'58.220.95.114:10053'
})
# 创建opener对象
opener = urllib.request.build_opener(proxy_handler)
以上是此问题报错原因的解决方法,欢迎评论区留言讨论是否能解决,如果有用欢迎点赞收藏文章谢谢支持,博主才有动力持续记录遇到的问题!!!
千人全栈VIP答疑群联系博主帮忙解决报错
由于博主时间精力有限,每天私信人数太多,没办法每个粉丝都及时回复,所以优先回复VIP粉丝,可以通过订阅限时9.9付费专栏《100天精通Python从入门到就业》进入千人全栈VIP答疑群,获得优先解答机会(代码指导、远程服务),白嫖80G学习资料大礼包,专栏订阅地址:https://blog.csdn.net/yuan2019035055/category_11466020.html
-
优点:作者优先解答机会(代码指导、远程服务),群里大佬众多可以抱团取暖(大厂内推机会),此专栏文章是专门针对零基础和需要进阶提升的同学所准备的一套完整教学,从0到100的不断进阶深入,后续还有实战项目,轻松应对面试!
-
专栏福利:简历指导、招聘内推、每周送实体书、80G全栈学习视频、300本IT电子书:Python、Java、前端、大数据、数据库、算法、爬虫、数据分析、机器学习、面试题库等等
-
注意:如果希望得到及时回复,订阅专栏后私信博主进千人VIP答疑群
相关文章
- ajax怎么解决报414,关于c#:HTTP错误414。请求URL太长。 asp.net
- 使用 http-proxy 代理 HTTP 请求时遇到的 the requested url is invalid 错误消息
- HTTP协议之:报文详解
- xp系统http服务器,WinXP HTTP500内部服务器错误的解决方法
- Python实现http请求的方法
- 【说站】HTTP服务响应数据不完整响应数据截断解决方法
- Go HTTP 编程 | 01 - 使用 http 包创建 Web 服务器
- HTTP 新增的 103 状态码,这次终于派上用场了!
- chrome浏览器关闭http强制调转https问题解决-亲测有效
- HTTP协议无状态,该怎么解决?
- 【Flutter】HTTP 网络操作 ( 引入 http 插件 | 测试网站 | Get 请求 | Post 请求 | 将响应结果转为 Dart 对象 | Future 异步调用 )
- WordPress 技巧:解决 HTTP Request 中 SSL certificate Problem
- Postman测试http请求返回415状态码的解决详解程序员
- 服务Linux快速启动HTTP服务实现网络分享(linux启动http)
- 服务 Linux下检测HTTP服务的方法(linux测试http)
- 服务Linux 下监控HTTP服务的方法(linux监控http)
- 服务器Linux下简易配置HTTP服务器(linux配置http)
- 一个 HTTP/2 的故事
- 故障解决解决Linux中的HTTP连接故障(linuxhttp连接)
- 如何使用Linux搭建一个安全的HTTP服务器(linux搭建http服务器)
- 熟悉Redis,HTTP抓包,防止网络安全漏洞(redis,http抓包)
- win7中iis7.5中没有http绑定类型的解决方法
- PHP中通过HTTP_USER_AGENT判断是否为手机移动终端的函数代码
- HTTP错误500.19解决方法(定义了重复的节点)
- Node.js中HTTP模块与事件模块详解
- nginx:[warn]"log_format"directiveusedonlyon"http"level解决方法
- Nginx中使用gzip_http_version解决CDN只支持http1.0问题