IT数码 购物 网址 头条 软件 日历 阅读 图书馆
TxT小说阅读器
↓语音阅读,小说下载,古典文学↓
图片批量下载器
↓批量下载图片,美女图库↓
图片自动播放器
↓图片自动播放器↓
一键清除垃圾
↓轻轻一点,清除系统垃圾↓
开发: C++知识库 Java知识库 JavaScript Python PHP知识库 人工智能 区块链 大数据 移动开发 嵌入式 开发工具 数据结构与算法 开发测试 游戏开发 网络协议 系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁
 
   -> 开发工具 -> Python--爬取豆瓣影评① -> 正文阅读

[开发工具]Python--爬取豆瓣影评①

Python–爬取豆瓣影评①并保存在本地

提示:

①.本文只提供能爬取豆瓣影评前二十页(豆瓣影评前二十页不需要登录)的内容,若需要爬取更多页,请看“Python–爬取豆瓣影评②并保存在本地”
②.本文可爬取阿甘正传的观影影评,若您需要爬取别的电影影评,需要修改爬取的url以及url的规律(但是规律一般一致)。
③.本文不做任何教学,只将代码附上,有需要学习的或者借鉴的从代码中自行学习!,介意勿看。


完整代码附上

"""
1.爬取豆瓣的短影评 ----阿甘正传
2.保存在本地.
-------- 只能查看前200条影评
"""

import requests
import re
import time
import random



class Spider_db:
    def __init__(self):
        self.comment_url = "https://movie.douban.com/subject/1292720/comments?start={}&limit=20&status=P&sort=new_score"
        self.comment_headers = {
            "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/96.0.4664.55 Safari/537.36 Edg/96.0.1054.34"}

    def get_comment_url(self):
        url_list = []
        for i in range(10):
            url_list.append(self.comment_url.format(i * 20))

        return url_list

    def comment_db(self, url):

        resp = requests.get(url=url, headers=self.comment_headers)

        comments = re.findall('<span class="short">(.*)</span>', resp.content.decode())
        return comments

    def save_text(self, db_text, page_num):
        file_path = "阿甘正传--影评第{}页".format(page_num)
        with open(file_path, "a+", encoding="utf-8") as f:
            f.write(db_text)
            f.write("\n")

    def run(self):
        # 1.页面规律总结,得到要爬取数据的页面
        comment_list = self.get_comment_url()
        # 3.进入阿甘正传页面爬取影评
        for url in comment_list:
            comments = self.comment_db(url)

            page_num = comment_list.index(url) + 1

            for content in comments:

                self.save_text(content, page_num)


            print("写入成功")
            time.sleep(random.random() * 5)
        # 4.保存在本地


if __name__ == '__main__':
    spider = Spider_db()
    spider.run()

效果图

在这里插入图片描述

注意:
①:此代码不能保证一直能够爬取,因为url地址及规律会变化。最后一次执行时间为:2021-12-04

②:若不能执行私信我,我会更新一下内容!


  开发工具 最新文章
Postman接口测试之Mock快速入门
ASCII码空格替换查表_最全ASCII码对照表0-2
如何使用 ssh 建立 socks 代理
Typora配合PicGo阿里云图床配置
SoapUI、Jmeter、Postman三种接口测试工具的
github用相对路径显示图片_GitHub 中 readm
Windows编译g2o及其g2o viewer
解决jupyter notebook无法连接/ jupyter连接
Git恢复到之前版本
VScode常用快捷键
上一篇文章      下一篇文章      查看所有文章
加:2021-12-05 12:14:40  更:2021-12-05 12:16:22 
 
开发: C++知识库 Java知识库 JavaScript Python PHP知识库 人工智能 区块链 大数据 移动开发 嵌入式 开发工具 数据结构与算法 开发测试 游戏开发 网络协议 系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁

360图书馆 购物 三丰科技 阅读网 日历 万年历 2024年11日历 -2024/11/15 16:18:00-

图片自动播放器
↓图片自动播放器↓
TxT小说阅读器
↓语音阅读,小说下载,古典文学↓
一键清除垃圾
↓轻轻一点,清除系统垃圾↓
图片批量下载器
↓批量下载图片,美女图库↓
  网站联系: qq:121756557 email:121756557@qq.com  IT数码