#2
fall_bernana2020-09-04 17:48
以下是引用kmzyp444在2020-9-4 14:55:32的发言: import requests #导入requests库 import re #导入re模块 #定义一个getHtml()函数,根据填写的url参数获取数据 def getHtml(url): #最终获得“查看源代码”的所有 #异常处理 try: r = requests.get(url) #使用get函数打开指定的url r.raise_for_status() #如果状态不是200,则引发异常 r.encoding = 'utf-8' #更改编码方式 return r.text #返回页面内容 except: return "" #发生异常返回空字符 #定义一个getImg()函数,根据填写的html参数获取图片并存储 def getImg(html): reg=r'src="(.+?\.jpg)"' #定义正则表达式 #r’’问号的意思是到.jpg就结束一次匹配 imglist=re.findall(reg,html) #从html里找到reg表达式 print(imglist) #打印找出来的表达式 i = 0 #定义i用于给下载的图片命名 for url in imglist: #遍历 with open(str(i)+".jpg","wb") as fd: #创建图片号+.jpg的文件,这种写法好 #路径前加上“http://www.” response=requests.get("http://www.)#要写/,因为/是符号 fd.write(response.content) #写入文件图片啥的,不能用text,要用二进制 print('图片',i,"保存成功\n") #输出提示信息 i+=1 #i加1 html = getHtml("http://www.) #先异常 getImg(html) #后获取 ------------------------------------------------------- 以上是一个教材的PPT演示程序,但用起来有的网站图片打不开,有的就能打开。 求助这个网站的图片是什么原理,解决办法是哪个。谢谢了 虽然不知道你说的是哪个能打开。哪个打不开。我根据你的程序猜测 在getHtml()返回的页面内容里你用re.findall返回了所有的jpg地址。但是你要注意在里面有带域名的地址比如: <li><a target="_blank" href="ppt.php?type=1" title="E时代大学英语"><img src="http://oss. 有不带域名的地址比如: <img class="qq_service" border="0" src="images/jqecode.jpg" title="金企鹅微信公众号"> 不带域名的你用response=requests.get("http://www.)可以获取到。带域名的你就不能再在前面加上http://www.了。 你需要先判断下哪些需要加,哪些不需要加 |
import requests #导入requests库
import re #导入re模块
#定义一个getHtml()函数,根据填写的url参数获取数据
def getHtml(url): #最终获得“查看源代码”的所有
#异常处理
try:
r = requests.get(url) #使用get函数打开指定的url
r.raise_for_status() #如果状态不是200,则引发异常
r.encoding = 'utf-8' #更改编码方式
return r.text #返回页面内容
except:
return "" #发生异常返回空字符
#定义一个getImg()函数,根据填写的html参数获取图片并存储
def getImg(html):
reg=r'src="(.+?\.jpg)"' #定义正则表达式
#r’’问号的意思是到.jpg就结束一次匹配
imglist=re.findall(reg,html) #从html里找到reg表达式
print(imglist) #打印找出来的表达式
i = 0 #定义i用于给下载的图片命名
for url in imglist: #遍历
with open(str(i)+".jpg","wb") as fd: #创建图片号+.jpg的文件,这种写法好
#路径前加上“http://www.”
response=requests.get("http://www.)#要写/,因为/是符号
fd.write(response.content) #写入文件图片啥的,不能用text,要用二进制
print('图片',i,"保存成功\n") #输出提示信息
i+=1 #i加1
html = getHtml("http://www.) #先异常
getImg(html) #后获取
-------------------------------------------------------
以上是一个教材的PPT演示程序,但用起来有的网站图片打不开,有的就能打开。
求助这个网站的图片是什么原理,解决办法是哪个。谢谢了