Python裸奔也疯狂：批量爬取中国工程院院士信息

时间：12-27来源：作者：点击数：27

中国工程院院士，是中国设立的工程科学技术方面的最高学术称号，为终身荣誉，由选举产生。在工程科学技术方面作出重大的、创造性的成就和贡献，热爱祖国，学风正派，品行端正，具有中国国籍的高级工程师、研究员、教授或具有同等职称的专家，可被提名并当选为中国工程院院士。

增选院士每两年进行一次,必要时,可提前或延后进行。每次的增选院士名额,由中国工程院主席团讨论决定。

为更好地膜拜众位男神女神，了解其在相关领域做出的杰出贡献，本文代码用于从中国工程院官方网站公开的信息中进行快速提取，主要用来演示Python标准库os、re、urllib的用法以及网络爬虫的原理，没有使用任何扩展库。本文涉及到的内容严禁用于不良用途，违者后果自负。

首先，打开工程院官方网站，查看全部院士名单，查看源代码，进行简单分析，得到规律，以便后面设计正则表达式，图中红框内是我们感兴趣的内容：

接下来打开任意一位院士的链接，进一步分析，得到数据组织的规则，以方便设计正则表达式：

所有规则都清晰之后，就可以编写代码进行爬取了：

方便获取更多学习、工作、生活信息请关注本站微信公众号 城东书院微信服务号

高考生入学注意：这些大	【健康】纯净水、天然
14种竞赛生升学路径盘	excel后缀xls和xlsx有

首页