实现目标:
1,爬取楼主所发的帖子
2,显示所爬去的楼层以及帖子题目
3,将爬取的内容写入到文件里,并实现动态显示爬取进度
实现工具:python的requests库和正则表达式以及bs4库
首先我们爬取的帖子网址为:https://tieba.baidu.com/p/3138733512?see_lz=1&pn=1,该网址是只看楼主的帖子的网址,因此该网站的源代码内容均为楼主所发贴的内容,爬取起来也比较方便。我们发现需要爬取的帖子一共有5页,我们可以通过for循环来进行对每一页信息的爬取。
接下来我们来整体构建爬取的思路:
1,爬取该网页的源代码
2,用正则表达式提取所需内容
3,用正则匹配对所取内容进行精准修改以达到我们想要的内容
4,把内容写入到文件并显示写入进度
以下是全部代码