您现在的位置是：首页 > 其他

当前栏目

我是一仅仅百度贴吧的小爬虫

百度仅仅

2023-09-11 14:15:00 时间

整体功能：查看特定帖子楼主的发言（不包括图片）

前段时间大概看了python的语法，可是确实第一次用python来写东西。非常久之前就想学python。学爬虫了。如今最终開始了！

谢了自己的第一个爬虫，非常开心O(∩_∩)O 认为学东西兴趣非常重要。爬虫真的好玩！

整个功能的实现含有两个类，一个是工具类Tool，还有一个是百度贴吧的爬虫类BaiduTieba，提取网页的内容主要还是正則表達式。代码例如以下：

# -*- coding:utf-8 -*-
import urllib
import urllib2
import re

#工具类，用于去除一些链接之类的特殊标签
class Tool:
    #去除图片链接
    removeImage = re.compile('<img class="BDE_Image".*?>')
    #去除<br>
    removeBR = re.compile('<br>')
    #去除超链接
    removeHref = re.compile('<a href=.*?</a>')

    def replaceStrange(self,x):
        x = re.sub(self.removeImage,"",x)
        x = re.sub(self.removeBR,"\n",x)
        x = re.sub(self.removeHref,"",x)
        return x.strip()

#百度贴吧爬虫类
class BaiduTieba:
    def __init__(self,baseUrl,seeLZ):
        #帖子基址
        self.baseUrl = baseUrl
        #仅仅看楼主seeLZ=1
        self.seeLZ = '?see_lz='+str(seeLZ)
        self.tool = Tool()

    def getPage(self,pageNum):
        try:
            url = self.baseUrl + self.seeLZ + '&pn=' + str(pageNum)
            request = urllib2.Request(url)
            response = urllib2.urlopen(request)
            #print response.read()
            return response.read().decode('utf-8')
        except urllib2.URLError,e:
            if hasattr(e,"reason"):
                print e.reason
                return None

    def getTitle(self):
        page = self.getPage(1)
        pattern = re.compile('<h1 class="core_title_txt.*?>(.*?)</h1>',re.S)
        result = re.search(pattern,page)
        if result:
            print "success!"
            print result.group()
        else:
            print "failed!"

    def getContent(self,page):
        #正則表達式匹配
        pattern = re.compile('<div id="post_content_.*?>(.*?)</div>',re.S)
        items = re.findall(pattern,page)
        floor = 1
        for item in items:
            print '\n',floor,u"楼-----------------------------------------------------------------------------------"
            print self.tool.replaceStrange(item)
            floor += 1

print u"请输入帖子编号："
baseURL = 'http://tieba.baidu.com/p/' + str(raw_input(u'http://tieba.baidu.com/p/'))
baidu = BaiduTieba(baseURL,1)
baidu.getContent(baidu.getPage(1))

效果如图（扒一扒这些年朋友之上恋人未满的逗逼）：
这里写图片描写叙述

猜你喜欢

S3C2416裸机开发系列十六_sd卡驱动实现
SQL Server 商业智能
常见状态码
C++20的Chrono扩展正式可用
【渗透技巧】资产探测与信息收集
Codeforces 390E Inna and Large Sweet Matrix 树状数组改段求段
输入法分类总结与优缺点
Altium Designer，覆铜，焊盘孔径大于n，采用不同的覆铜模式
赶紧收藏，年终盘点：绝不仅仅15种最常用的数据分析方法和模型
JavaWeb课程复习资料（七）——select服务查询所有功能编写
[Typescript] Use never for readable string
Firefly 流程架构
2023年网络安全常用的9大顶级工具
优秀学生专栏——孙珩发
《暗黑世界GM管理后台系统》部署+功能说明文档
BAdI to control ALV grid display
OpenCV每日函数计算摄影模块(3) HDR动态范围成像算法
[SAA + SAP] 07. Lambda

相关主题

百度小程序
百度地图之定位
2015.10.25(百度地图API)
调用百度地图API
百度之星初赛二
百度轻应用
百度面试
百度新闻
百度云我的书

zl程序教程

当前栏目

我是一仅仅百度贴吧的小爬虫

相关文章