实现目标:

1,爬取楼主所发的帖子

2,显示所爬去的楼层以及帖子题目

3,将爬取的内容写入到文件里,并实现动态显示爬取进度

实现工具:python的requests库和正则表达式以及bs4库

首先我们爬取的帖子网址为:https://tieba.baidu.com/p/3138733512?see_lz=1&pn=1,该网址是只看楼主的帖子的网址,因此该网站的源代码内容均为楼主所发贴的内容,爬取起来也比较方便。我们发现需要爬取的帖子一共有5页,我们可以通过for循环来进行对每一页信息的爬取。

接下来我们来整体构建爬取的思路:

  1,爬取该网页的源代码

  2,用正则表达式提取所需内容

  3,用正则匹配对所取内容进行精准修改以达到我们想要的内容

  4,把内容写入到文件并显示写入进度

以下是全部代码


本文转载:CSDN博客