| |
|
开发:
C++知识库
Java知识库
JavaScript
Python
PHP知识库
人工智能
区块链
大数据
移动开发
嵌入式
开发工具
数据结构与算法
开发测试
游戏开发
网络协议
系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程 数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁 |
-> Python知识库 -> CSDN每日开源指数 -> 正文阅读 |
|
[Python知识库]CSDN每日开源指数 |
一、前言身为一名程序员,想必你肯定知道有个神奇的网站叫Github,上面有各路大神开源的各种项目,CSDN也有自己的开源网站,以前叫CodeChina,现在叫GitCode,使用起来与github无太大差别,但网速比GitHub快很多,非常适合国内开发者使用。为了解决国内用户访问 github 速度较慢的问题,Gitcode将github上的所有开源项目都镜像到Gitcode Mirrors 镜像仓库里,从Gitcode Mirrors 镜像仓库 clone 项目可以有将近 50 倍左右的速度提升。 我们的目的,就是从GitCode镜像仓库,爬取每日最热门的开源项目 二、开源指数计算规则
开源指数越大的,排名越靠前 三、获取数据数据源地址: https://gitcode.net/mirrors 如下图: 进入该网页时你会发现,这是个动态加载的页面,什么意思呢,就是你只通过 我们先
关于chromedriver的安装,可以参考centos 安装 chromedriver 我们需要获取的数据可以分为两部分: 四、存储数据Gitcode Mirrors 镜像仓库共用5w+的开源项目,这么多数据,怎么存呢? 显然,用数据库来存储是最好的选择。 怎么存储呢?都存在一个表里?好像不太合理,因为开源项目自身的基本信息(项目名称、项目描述等)是不变的,只有开源指数需要的star数、fork数是每天需要更新的,如果都存在一个表里,很浪费存储空间,而且,我们每天都需要存5w+的数据,没几天上上百万级别了,因此,将全部数据存储在一个表里,是不合适的。 思考过后,我们决定将数据存储在两个表里,两个表可以通过
这样,project_info就只有5w+的数据,且来了新的 有了以上两个表,我们数据存在哪,怎么存的问题,就解决了。 五、性能问题前面有提到https://gitcode.net/mirrors是个动态加载的网页,因此,我们获取网页源码时,需要等待网页加载完,才能获取到网页所有源码,总共有2500多页,获取每页的所有数据需要40s左右,获取所有数据需要100000s,一天86400s,就算我们的计算机全天不停,也爬不完。因此,我们需要使用多进程/多线程来解决这个问题。 首先,我们可以将2500页分为五段,每个进程处理500页,这样下来,我们开五个进程,速度飞快。 这一番操作下来,我们可以在三四个小时内就将所有数据都爬下来 部分代码:
六、结果我们将结果以社区帖子的形式发布了出来,请看👉 极客日报社区|开源指数频道 今日开源指数:CSDN每日指数–2022-04-12 |
|
|
上一篇文章 下一篇文章 查看所有文章 |
|
开发:
C++知识库
Java知识库
JavaScript
Python
PHP知识库
人工智能
区块链
大数据
移动开发
嵌入式
开发工具
数据结构与算法
开发测试
游戏开发
网络协议
系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程 数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁 |
360图书馆 购物 三丰科技 阅读网 日历 万年历 2024年11日历 | -2024/11/15 17:22:17- |
|
网站联系: qq:121756557 email:121756557@qq.com IT数码 |