AI Agent赋能科研爬虫:从数据获取到智能采集全流程
一. 爬虫基础
1. 什么是网络爬虫
1.1 网络爬虫的定义
1.2 网络爬虫的用途
1.3 网络爬虫是否合法
2. AI 智能体时代的数据获取新范式
2.1 爬虫的演进:手工编码 → AI 智能体辅助 → AI 智能体自主执行
2.2 AI 智能体核心概念:Agent、技能、Tool Use、subagent
2.3 Claude Code 深度解析:代码能力、上下文窗口、项目
2.4 AI 智能体在科研数据工作中的应用场景:自动采集 / 代码生成 / 数据清洗 / 深度分析 / 报告撰写
3. HTTP 基本原理
3.1 URL——资源地址的格式
3.2 HTTP 与 HTTPS——传输网页的协议,HTTPS 是加密版
3.3 HTTP 请求——客户端发什么(方法、URL、请求头、请求体)
3.4 HTTP 响应——服务器返回什么(状态码、响应头、响应体)
4. Web 网页基础
4.1 结构层(HTML)——网页内容与结构,解析的对象
4.2 表现层(CSS)——样式与布局,选择器可用于定位
4.3 行为层(JavaScript)——动态改页面、发异步请求,动态爬取的难点
4.4 简单网页制作——手写小页面,理解三层协作
5. 爬虫基本流程
5.1 目标分析——要什么数据、在哪、翻页规律
5.2 发送请求——构造 URL、请求头、参数发起请求
5.3 获取响应——接收 HTML/JSON/文件,查状态码
5.4 数据解析——正则 / BeautifulSoup / XPath 抽字段
5.5 数据存储——写入 TXT/CSV/Excel/JSON 或数据库
5.6 爬虫策略优化——间隔、重试、代理、并发
二、网页解析与数据存储
1. 页面解析方法
1.1 静态内容解析——直接从 HTML 源码抽数据(正则 / BeautifulSoup / XPath)
1.2 结构化数据解析——解析接口返回的 JSON / XML
1.3 动态内容解析——JS 渲染或异步加载的数据(抓接口或用浏览器自动化)
1.4 混合解析策略——按页面情况组合上述方法
2. 正则表达式
2.1 正则表达式的创建——re.compile、原始字符串 r
2.2 正则表达式匹配规则——字符类、量词、分组、边界、贪婪与非贪婪
2.3 正则表达式匹配方法——match / search / findall / finditer / sub / split
2.4 案例:用正则表达式提取天气预报数据——从网页源码用正则抽出日期、天气、气温
3. 数据存储
3.1 常见文本数据存储格式(TXT / CSV / Excel / JSON)
3.2 案例:知网文献数据存储同一批文献数据分别写入 TXT / CSV / Excel / JSON
三、网络请求库:requests
1. 核心功能
1.1 GET 请求
1.2 带参数的请求
1.3 POST 请求
1.4 Headers 设置
1.5 Cookies 处理
1.6 代理设置
2. 案例
案例 1:提取链家房源图片网址并下载图片
案例 2:提取链家房源面积与价格并排序(单页 + 多页翻页)
案例 3:豆瓣电影分类排行榜—动画片(JSON 数据格式,单页 + 多页)
案例 4:《舌尖上的中国》短评提取(添加 Cookies + 模拟登录 + 反爬处理)
四、BeautifulSoup 与 XPath
1. BeautifulSoup
1.1 基本介绍
1.2 BeautifulSoup 支持的解析器
1.3 节点树
1.4 元素的选择
1.5 案例
案例 1:中国天气网天气预报数据抓取(本章主线案例)
案例 2:电视剧《猎场》豆瓣短评抓取(单页 + 多页)
2. XPath
2.1 基本介绍
2.2 XPath 常用规则(节点 / 子节点 / 父节点 / 属性获取 / 属性匹配 / 文本获取 / 多值与多属性匹配)
2.3 案例:用 XPath 抓取中国天气网天气预报数据
五、Selenium 与 Playwright(动态页面与自动化)
1. Selenium
1.1 基本介绍
1.2 Selenium 的基本操作
1.3 案例
案例 1:知网论文下载(信息提取 → 单页/多页 → 数据清洗 → 存储 → 下载文献)
案例 2:巨潮资讯网PDF公告下载(获取网址 → 获取下载链接 → 单页完整下载)
2. Playwright
2.1 基本介绍
2.2 核心特性(多浏览器支持 / 自动等待 / 网络拦截 / 录制工具等)
2.3 反爬机制与应对:IP 代理池、请求频率控制、指纹伪装
2.4 案例
案例 1:Playwright 完整流程
案例 2:谷歌学术数据抓取
案例 3:东方财富网股吧评论数据获取
3. 验证码处理(反爬进阶)
3.1 常见验证码类型:数字/字母、滑动、点选、行为、短信/邮箱
3.2 解决思路概览:OCR 识别(传统验证码)/ 深度学习模型 / 第三方打码平台 / 自动化工具绕过
3.3 推荐做法:用 Claude 视觉能力识别验证码、分析反爬逻辑(详见第七章 §1.4)
六、Scrapy 爬虫框架
1. Scrapy 介绍
1.1 爬虫流程
1.2 Scrapy 框架组成(Engine / Item / Scheduler / Spiders / Downloader / Item Pipelines / 中间件)
1.3 数据的流转
2. Scrapy 的使用
2.1 安装
2.2 Scrapy 项目开发流程(以 quotes.toscrape.com 为例)
2.3 中间件的使用(下载中间件 / 爬虫中间件:更换 header、cookie、代理 IP)
2.4 案例:易车网数据抓取
七、AI 智能体协同:从代码辅助到自主执行
1. Claude Code 协同编程:加速爬虫开发
1.1 自然语言描述需求 → 自动生成爬虫代码
1.2 代码解释、Debug、重构与性能优化
1.3 由网页结构生成代码:保存网页到本地 → AI 分析结构 → 生成解析代码 → 调试修正
1.4 用 Claude 视觉能力识别验证码、分析反爬逻辑
1.5 案例
案例 1:中国新闻网滚动新闻抓取
案例 2:微博数据抓取
2. 调用技能自动化采集数据
用现成技能封装接口调用,无需自己写请求代码。
2.1 arxiv-watcher(无需 API Key)
案例:检索并下载论文数据
2.2 tushare-finance(需 API Key / token)
案例:获取股票行情数据并存为 CSV
2.3 Wind 数据获取
案例:获取股票资讯数据
3. 驱动 Chrome 浏览器执行操作
两种方式:
① 调用 agent-browser 技能;
② 安装 Claude 浏览器插件。共享浏览器登录状态,无需额外 API 密钥或重新认证。
3.1 功能概览:打开网页、点击、填表;读取控制台日志(console / network / DOM);与已登录网站交互
3.2 安装与使用
3.3 案例
案例 1:谷歌学术论文数据获取
案例 2:获取并下载知网论文数据
| 报名时间 |
2026-08-31 00:00 至 2026-09-30 00:00 |
| 培训时间 |
2026年10月1-2日 (两天) |
| 培训地点 |
北京现场班, 同步远程直播; 均提供录播回放 |
| 培训费用 |
2000元,提供电子版发票+通知+结业证书 |
| 授课安排 |
9:00-12:00;14:00-17:00;答疑 |
AI Agent赋能科研爬虫:从数据获取到智能采集全流程 2026国庆新课
知网、谷歌学术、arXiv、Wind、Tushare等科研数据源实战,包含22个实战案例
【课程大纲】
陈远祥,北京邮电大学副教授,博士生导师,北京大学博士,北京大学优秀博士后,人工智能资深讲师。
主要科研方向:数据分析、大数据处理、智能信号处理和图像。
发表SCI/EI学术论文100余篇,其中第一或通讯作者论文60余篇,授权国家发明专利20余项。
主持国家自然科学基金面上项目,国家重点研发计划课题,国家自然科学基金青年项目及博士后基金等多个国家级和省部级项目。IEEE、OSA会员,多个SCI期刊审稿人。
曾给中国移动,中国电信,中国银行,国家电网等多个企业和高校做过人工智能相关的课程培训。授课风格通俗易懂,深入浅出,大量的实战案例,广受学员好评。JG学术培训-Python及AI金牌讲师。
【课程大纲】
1. 什么是网络爬虫
1.1 网络爬虫的定义
1.2 网络爬虫的用途
1.3 网络爬虫是否合法
2. AI 智能体时代的数据获取新范式
2.1 爬虫的演进:手工编码 → AI 智能体辅助 → AI 智能体自主执行
2.2 AI 智能体核心概念:Agent、技能、Tool Use、subagent
2.3 Claude Code 深度解析:代码能力、上下文窗口、项目
2.4 AI 智能体在科研数据工作中的应用场景:自动采集 / 代码生成 / 数据清洗 / 深度分析 / 报告撰写
3. HTTP 基本原理
3.1 URL——资源地址的格式
3.2 HTTP 与 HTTPS——传输网页的协议,HTTPS 是加密版
3.3 HTTP 请求——客户端发什么(方法、URL、请求头、请求体)
3.4 HTTP 响应——服务器返回什么(状态码、响应头、响应体)
4. Web 网页基础
4.1 结构层(HTML)——网页内容与结构,解析的对象
4.2 表现层(CSS)——样式与布局,选择器可用于定位
4.3 行为层(JavaScript)——动态改页面、发异步请求,动态爬取的难点
4.4 简单网页制作——手写小页面,理解三层协作
5. 爬虫基本流程
5.1 目标分析——要什么数据、在哪、翻页规律
5.2 发送请求——构造 URL、请求头、参数发起请求
5.3 获取响应——接收 HTML/JSON/文件,查状态码
5.4 数据解析——正则 / BeautifulSoup / XPath 抽字段
5.5 数据存储——写入 TXT/CSV/Excel/JSON 或数据库
5.6 爬虫策略优化——间隔、重试、代理、并发
二、网页解析与数据存储
1. 页面解析方法
1.1 静态内容解析——直接从 HTML 源码抽数据(正则 / BeautifulSoup / XPath)
1.2 结构化数据解析——解析接口返回的 JSON / XML
1.3 动态内容解析——JS 渲染或异步加载的数据(抓接口或用浏览器自动化)
1.4 混合解析策略——按页面情况组合上述方法
2. 正则表达式
2.1 正则表达式的创建——re.compile、原始字符串 r
2.2 正则表达式匹配规则——字符类、量词、分组、边界、贪婪与非贪婪
2.3 正则表达式匹配方法——match / search / findall / finditer / sub / split
2.4 案例:用正则表达式提取天气预报数据——从网页源码用正则抽出日期、天气、气温
3. 数据存储
3.1 常见文本数据存储格式(TXT / CSV / Excel / JSON)
3.2 案例:知网文献数据存储同一批文献数据分别写入 TXT / CSV / Excel / JSON
三、网络请求库:requests
1. 核心功能
1.1 GET 请求
1.2 带参数的请求
1.3 POST 请求
1.4 Headers 设置
1.5 Cookies 处理
1.6 代理设置
2. 案例
案例 1:提取链家房源图片网址并下载图片
案例 2:提取链家房源面积与价格并排序(单页 + 多页翻页)
案例 3:豆瓣电影分类排行榜—动画片(JSON 数据格式,单页 + 多页)
案例 4:《舌尖上的中国》短评提取(添加 Cookies + 模拟登录 + 反爬处理)
四、BeautifulSoup 与 XPath
1. BeautifulSoup
1.1 基本介绍
1.2 BeautifulSoup 支持的解析器
1.3 节点树
1.4 元素的选择
1.5 案例
案例 1:中国天气网天气预报数据抓取(本章主线案例)
案例 2:电视剧《猎场》豆瓣短评抓取(单页 + 多页)
2. XPath
2.1 基本介绍
2.2 XPath 常用规则(节点 / 子节点 / 父节点 / 属性获取 / 属性匹配 / 文本获取 / 多值与多属性匹配)
2.3 案例:用 XPath 抓取中国天气网天气预报数据
五、Selenium 与 Playwright(动态页面与自动化)
1. Selenium
1.1 基本介绍
1.2 Selenium 的基本操作
1.3 案例
案例 1:知网论文下载(信息提取 → 单页/多页 → 数据清洗 → 存储 → 下载文献)
案例 2:巨潮资讯网PDF公告下载(获取网址 → 获取下载链接 → 单页完整下载)
2. Playwright
2.1 基本介绍
2.2 核心特性(多浏览器支持 / 自动等待 / 网络拦截 / 录制工具等)
2.3 反爬机制与应对:IP 代理池、请求频率控制、指纹伪装
2.4 案例
案例 1:Playwright 完整流程
案例 2:谷歌学术数据抓取
案例 3:东方财富网股吧评论数据获取
3. 验证码处理(反爬进阶)
3.1 常见验证码类型:数字/字母、滑动、点选、行为、短信/邮箱
3.2 解决思路概览:OCR 识别(传统验证码)/ 深度学习模型 / 第三方打码平台 / 自动化工具绕过
3.3 推荐做法:用 Claude 视觉能力识别验证码、分析反爬逻辑(详见第七章 §1.4)
六、Scrapy 爬虫框架
1. Scrapy 介绍
1.1 爬虫流程
1.2 Scrapy 框架组成(Engine / Item / Scheduler / Spiders / Downloader / Item Pipelines / 中间件)
1.3 数据的流转
2. Scrapy 的使用
2.1 安装
2.2 Scrapy 项目开发流程(以 quotes.toscrape.com 为例)
2.3 中间件的使用(下载中间件 / 爬虫中间件:更换 header、cookie、代理 IP)
2.4 案例:易车网数据抓取
七、AI 智能体协同:从代码辅助到自主执行
1. Claude Code 协同编程:加速爬虫开发
1.1 自然语言描述需求 → 自动生成爬虫代码
1.2 代码解释、Debug、重构与性能优化
1.3 由网页结构生成代码:保存网页到本地 → AI 分析结构 → 生成解析代码 → 调试修正
1.4 用 Claude 视觉能力识别验证码、分析反爬逻辑
1.5 案例
案例 1:中国新闻网滚动新闻抓取
案例 2:微博数据抓取
2. 调用技能自动化采集数据
用现成技能封装接口调用,无需自己写请求代码。
2.1 arxiv-watcher(无需 API Key)
案例:检索并下载论文数据
2.2 tushare-finance(需 API Key / token)
案例:获取股票行情数据并存为 CSV
2.3 Wind 数据获取
案例:获取股票资讯数据
3. 驱动 Chrome 浏览器执行操作
两种方式:
① 调用 agent-browser 技能;
② 安装 Claude 浏览器插件。共享浏览器登录状态,无需额外 API 密钥或重新认证。
3.1 功能概览:打开网页、点击、填表;读取控制台日志(console / network / DOM);与已登录网站交互
3.2 安装与使用
3.3 案例
案例 1:谷歌学术论文数据获取
案例 2:获取并下载知网论文数据
【联系方式】
尹老师
电话:13321178792
QQ:42884447
WeChat:JGxueshu
