开源公司内部的微信爬虫，寻求志同道合的人一起来改进

2016-09-20 18:35:51 +08:00

crayonyi

一个爬取微信公众号文章的爬虫

github: https://github.com/bowenpay/wechat-spider

微信爬虫的由来

我们是一家帮助中国 5000 万贫困人口与社会公益组织的对接的公司。

我们通过国家和地方政府的“建档立卡”系统，获取到了一手的贫困户数据，目前有 100 万左右，总数为 5000 万，目前每个月都在增长。

为了帮助这部分贫困户对接公益机构，我写了这个微信爬虫，从微信公众号发布的文章中上找出最新的公益项目。

这种找项目的方式的可行性，我们还在试验中。

起初，为了快速上线，本爬虫的代码是基于我的另一个通用爬虫项目开发的，还不是很完善，所以希望任何对本项目感兴趣的人联系我，与我一同改进这个项目。

联系方式：在该 issue 下留言告诉我点击去留言

界面预览

1 ）要爬取的微信公众号列表

2 ）要爬取的文章关键字列表

3 ）已经爬取的微信文章

4 ）查看文章，并标记是否可用

5 ）控制爬取进程数

使用到的技术和框架

django mysql redis lxml selenium

12369 次点击

所在节点

65 条回复

hadoop

2017-02-01 23:15:17 +08:00

@crayonyi vps 的 ip 变了，那你怎么连过去呢？还是把程序放在动态 ip vps 上跑

crayonyi

2017-02-03 00:27:42 +08:00

@hadoop 需要在 vps 上部署一个脚本，实时获取 ip ，提交到服务端。
你说的把程序放在动态 ip vps 上跑也是可以的。

crayonyi

2017-02-03 00:28:29 +08:00

@ospider 早期的今日头条就是这样的。因为我维护过。

4BVL25L90W260T9U

2017-02-04 11:25:44 +08:00

@crayonyi 哈哈，原来是前辈

toliho

2020-03-14 20:11:54 +08:00

可惜没有更新了，支持楼主和你的公益事业

第 4 页／共 4 页

这是一个专为移动设备优化的页面（即为了让你能够在 Google 搜索结果里秒开这个页面），如果你希望参与 V2EX 社区的讨论，你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/307617

V2EX 是创意工作者们的社区，是一个分享自己正在做的有趣事物、交流想法，可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX