| 网站首页 | 业界新闻 | 小组 | 威客 | 人才 | 下载频道 | 博客 | 代码贴 | 在线编程 | 编程论坛
欢迎加入我们,一同切磋技术
用户名:   
 
密 码:  
共有 2216 人关注过本帖
标题:初学者的python爬虫问题
只看楼主 加入收藏
kmzyp444
Rank: 2
等 级:论坛游民
帖 子:27
专家分:20
注 册:2013-7-8
结帖率:81.82%
收藏
已结贴  问题点数:20 回复次数:5 
初学者的python爬虫问题
import requests            #导入requests库
import re            #导入re模块
#定义一个getHtml()函数,根据填写的url参数获取数据
def getHtml(url):   #最终获得“查看源代码”的所有
    #异常处理
    try:
        r = requests.get(url)        #使用get函数打开指定的url
        r.raise_for_status()        #如果状态不是200,则引发异常
        r.encoding = 'utf-8'        #更改编码方式
        return r.text            #返回页面内容
    except:
        return ""            #发生异常返回空字符
#定义一个getImg()函数,根据填写的html参数获取图片并存储
def getImg(html):
    reg=r'src="(.+?\.jpg)"' #定义正则表达式   
                                                #r’’问号的意思是到.jpg就结束一次匹配
    imglist=re.findall(reg,html)        #从html里找到reg表达式
    print(imglist)                #打印找出来的表达式
    i = 0                    #定义i用于给下载的图片命名
    for url in imglist:            #遍历
        with open(str(i)+".jpg","wb") as fd:    #创建图片号+.jpg的文件,这种写法好
         #路径前加上“http://www.
            response=requests.get("http://www.)#要写/,因为/是符号
            fd.write(response.content)    #写入文件图片啥的,不能用text,要用二进制
            print('图片',i,"保存成功\n")        #输出提示信息
            i+=1                #i加1
html = getHtml("http://www.)    #先异常
getImg(html)                    #后获取
-------------------------------------------------------
以上是一个教材的PPT演示程序,但用起来有的网站图片打不开,有的就能打开。
求助这个网站的图片是什么原理,解决办法是哪个。谢谢了
搜索更多相关主题的帖子: 图片 定义 html jpg url 
2020-09-04 14:55
fall_bernana
Rank: 11Rank: 11Rank: 11Rank: 11
等 级:贵宾
威 望:17
帖 子:244
专家分:2106
注 册:2019-8-16
收藏
得分:20 
以下是引用kmzyp444在2020-9-4 14:55:32的发言:

import requests            #导入requests库
import re            #导入re模块
#定义一个getHtml()函数,根据填写的url参数获取数据
def getHtml(url):   #最终获得“查看源代码”的所有
    #异常处理
    try:
        r = requests.get(url)        #使用get函数打开指定的url
        r.raise_for_status()        #如果状态不是200,则引发异常
        r.encoding = 'utf-8'        #更改编码方式
        return r.text            #返回页面内容
    except:
        return ""            #发生异常返回空字符
#定义一个getImg()函数,根据填写的html参数获取图片并存储
def getImg(html):
    reg=r'src="(.+?\.jpg)"' #定义正则表达式   
                                                #r’’问号的意思是到.jpg就结束一次匹配
    imglist=re.findall(reg,html)        #从html里找到reg表达式
    print(imglist)                #打印找出来的表达式
    i = 0                    #定义i用于给下载的图片命名
    for url in imglist:            #遍历
        with open(str(i)+".jpg","wb") as fd:    #创建图片号+.jpg的文件,这种写法好
         #路径前加上“http://www.
            response=requests.get("http://www.)#要写/,因为/是符号
            fd.write(response.content)    #写入文件图片啥的,不能用text,要用二进制
            print('图片',i,"保存成功\n")        #输出提示信息
            i+=1                #i加1
html = getHtml("http://www.)    #先异常
getImg(html)                    #后获取
-------------------------------------------------------
以上是一个教材的PPT演示程序,但用起来有的网站图片打不开,有的就能打开。
求助这个网站的图片是什么原理,解决办法是哪个。谢谢了




虽然不知道你说的是哪个能打开。哪个打不开。我根据你的程序猜测
在getHtml()返回的页面内容里你用re.findall返回了所有的jpg地址。但是你要注意在里面有带域名的地址比如:
 <li><a target="_blank" href="ppt.php?type=1" title="E时代大学英语"><img src="http://oss.
有不带域名的地址比如:
<img class="qq_service" border="0" src="images/jqecode.jpg" title="金企鹅微信公众号">
不带域名的你用response=requests.get("http://www.)可以获取到。带域名的你就不能再在前面加上http://www.了。
你需要先判断下哪些需要加,哪些不需要加
2020-09-04 17:48
kmzyp444
Rank: 2
等 级:论坛游民
帖 子:27
专家分:20
注 册:2013-7-8
收藏
得分:0 
回复 2楼 fall_bernana
说的完全对啊!
2020-09-07 09:57
jackcoden
Rank: 1
等 级:新手上路
帖 子:11
专家分:0
注 册:2020-9-11
收藏
得分:0 
666
2020-09-15 14:48
phiplato
Rank: 2
等 级:新手上路
威 望:3
帖 子:22
专家分:7
注 册:2020-4-24
收藏
得分:0 
如果是动态加载图片的,这种代码就没用了。
2020-09-21 11:21
sssooosss
Rank: 9Rank: 9Rank: 9
等 级:禁止访问
威 望:3
帖 子:664
专家分:1115
注 册:2019-8-27
收藏
得分:0 
共同学习
2020-09-21 13:44
快速回复:初学者的python爬虫问题
数据加载中...
 
   



关于我们 | 广告合作 | 编程中国 | 清除Cookies | TOP | 手机版

编程中国 版权所有,并保留所有权利。
Powered by Discuz, Processed in 0.017900 second(s), 8 queries.
Copyright©2004-2024, BCCN.NET, All Rights Reserved