AI Agent赋能科研数据分析:从数据获取到论文变量构造 我要报名 ¥5000
Peixun.net > 现场班 > 计量实证分析 > AI Agent赋能科研数据分析:从数据获取到论文变量构造

AI Agent赋能科研数据分析:从数据获取到论文变量构造

满意程度:     课程系列:A4
课时:0 分钟| 86人学习 分享 收藏
【2026new】一门打通“数据获取—文本分析—AI Agent—论文研究”的科研实战课程。新版在保留经典爬虫与NLP技术体系的基础上,全面升级Claude Code与大模型应用,并融入70+实战案例、10篇经典论文案例,覆盖知网、谷歌学术、金融数据、年报与公告等真实科研场景,帮助你从“会用工具”进一步走向“解决论文问题”。

上课信息

上课时间: 2026年10月1-4日 (四天)
9:00-12:00;14:00-17:00;答疑

上课地点: 北京现场班, 同步远程直播; 均提供录播回放

AI Agent赋能科研数据分析:从数据获取到论文变量构造

AI Agent赋能科研爬虫:从数据获取到智能采集全流程 (前两天)

1. 什么是网络爬虫

1.1 网络爬虫的定义

1.2 网络爬虫的用途

1.3 网络爬虫是否合法

2. AI 智能体时代的数据获取新范式

2.1 爬虫的演进:手工编码 → AI 智能体辅助 → AI 智能体自主执行

2.2 AI 智能体核心概念:Agent、技能、Tool Use、subagent

2.3 Claude Code 深度解析:代码能力、上下文窗口、项目

2.4 AI 智能体在科研数据工作中的应用场景:自动采集 / 代码生成 / 数据清洗 / 深度分析 / 报告撰写

3. HTTP 基本原理

3.1 URL——资源地址的格式

3.2 HTTP 与 HTTPS——传输网页的协议,HTTPS 是加密版

3.3 HTTP 请求——客户端发什么(方法、URL、请求头、请求体)

3.4 HTTP 响应——服务器返回什么(状态码、响应头、响应体)

4. Web 网页基础

4.1 结构层(HTML)——网页内容与结构,解析的对象

4.2 表现层(CSS)——样式与布局,选择器可用于定位

4.3 行为层(JavaScript)——动态改页面、发异步请求,动态爬取的难点

4.4 简单网页制作——手写小页面,理解三层协作

5. 爬虫基本流程

5.1 目标分析——要什么数据、在哪、翻页规律

5.2 发送请求——构造 URL、请求头、参数发起请求

5.3 获取响应——接收 HTML/JSON/文件,查状态码

5.4 数据解析——正则 / BeautifulSoup / XPath 抽字段

5.5 数据存储——写入 TXT/CSV/Excel/JSON 或数据库

5.6 爬虫策略优化——间隔、重试、代理、并发

二、网页解析与数据存储

1. 页面解析方法

1.1 静态内容解析——直接从 HTML 源码抽数据(正则 / BeautifulSoup / XPath)

1.2 结构化数据解析——解析接口返回的 JSON / XML

1.3 动态内容解析——JS 渲染或异步加载的数据(抓接口或用浏览器自动化)

1.4 混合解析策略——按页面情况组合上述方法

2. 正则表达式

2.1 正则表达式的创建——re.compile、原始字符串 r

2.2 正则表达式匹配规则——字符类、量词、分组、边界、贪婪与非贪婪

2.3 正则表达式匹配方法——match / search / findall / finditer / sub / split

2.4 案例:用正则表达式提取天气预报数据——从网页源码用正则抽出日期、天气、气温

3. 数据存储

3.1 常见文本数据存储格式(TXT / CSV / Excel / JSON)

3.2 案例:知网文献数据存储同一批文献数据分别写入 TXT / CSV / Excel / JSON

三、网络请求库:requests

1. 核心功能

1.1 GET 请求

1.2 带参数的请求

1.3 POST 请求

1.4 Headers 设置

1.5 Cookies 处理

1.6 代理设置

2. 案例

案例 1:提取链家房源图片网址并下载图片

案例 2:提取链家房源面积与价格并排序(单页 + 多页翻页)

案例 3:豆瓣电影分类排行榜—动画片(JSON 数据格式,单页 + 多页)

案例 4:《舌尖上的中国》短评提取(添加 Cookies + 模拟登录 + 反爬处理)

四、BeautifulSoup 与 XPath

1. BeautifulSoup

1.1 基本介绍

1.2 BeautifulSoup 支持的解析器

1.3 节点树

1.4 元素的选择

1.5 案例

案例 1:中国天气网天气预报数据抓取(本章主线案例)

案例 2:电视剧《猎场》豆瓣短评抓取(单页 + 多页)

2. XPath

2.1 基本介绍

2.2 XPath 常用规则(节点 / 子节点 / 父节点 / 属性获取 / 属性匹配 / 文本获取 / 多值与多属性匹配)

2.3 案例:用 XPath 抓取中国天气网天气预报数据

五、Selenium 与 Playwright(动态页面与自动化)

1. Selenium

1.1 基本介绍

1.2 Selenium 的基本操作

1.3 案例

案例 1:知网论文下载(信息提取 → 单页/多页 → 数据清洗 → 存储 → 下载文献)

案例 2:巨潮资讯网PDF公告下载(获取网址 → 获取下载链接 → 单页完整下载)

2. Playwright

2.1 基本介绍

2.2 核心特性(多浏览器支持 / 自动等待 / 网络拦截 / 录制工具等)

2.3 反爬机制与应对:IP 代理池、请求频率控制、指纹伪装

2.4 案例

案例 1:Playwright 完整流程

案例 2:谷歌学术数据抓取

案例 3:东方财富网股吧评论数据获取

3. 验证码处理(反爬进阶)

3.1 常见验证码类型:数字/字母、滑动、点选、行为、短信/邮箱

3.2 解决思路概览:OCR 识别(传统验证码)/ 深度学习模型 / 第三方打码平台 / 自动化工具绕过

3.3 推荐做法:用 Claude 视觉能力识别验证码、分析反爬逻辑(详见第七章 §1.4)

六、Scrapy 爬虫框架

1. Scrapy 介绍

1.1 爬虫流程

1.2 Scrapy 框架组成(Engine / Item / Scheduler / Spiders / Downloader / Item Pipelines / 中间件)

1.3 数据的流转

2. Scrapy 的使用

2.1 安装

2.2 Scrapy 项目开发流程(以 quotes.toscrape.com 为例)

2.3 中间件的使用(下载中间件 / 爬虫中间件:更换 header、cookie、代理 IP)

2.4 案例:易车网数据抓取

七、AI 智能体协同:从代码辅助到自主执行

1. Claude Code 协同编程:加速爬虫开发

1.1 自然语言描述需求 → 自动生成爬虫代码

1.2 代码解释、Debug、重构与性能优化

1.3 由网页结构生成代码:保存网页到本地 → AI 分析结构 → 生成解析代码 → 调试修正

1.4 用 Claude 视觉能力识别验证码、分析反爬逻辑

1.5 案例

案例 1:中国新闻网滚动新闻抓取

案例 2:微博数据抓取

2. 调用技能自动化采集数据

用现成技能封装接口调用,无需自己写请求代码。

2.1 arxiv-watcher(无需 API Key)

案例:检索并下载论文数据

2.2 tushare-finance(需 API Key / token)

案例:获取股票行情数据并存为 CSV

2.3 Wind 数据获取

案例:获取股票资讯数据

3. 驱动 Chrome 浏览器执行操作

两种方式:

① 调用 agent-browser 技能;

② 安装 Claude 浏览器插件。共享浏览器登录状态,无需额外 API 密钥或重新认证。

3.1 功能概览:打开网页、点击、填表;读取控制台日志(console / network / DOM);与已登录网站交互

3.2 安装与使用

3.3 案例

案例 1:谷歌学术论文数据获取

案例 2:获取并下载知网论文数据

AI Agent赋能文本分析:从文本数据到论文变量构造 (后两天)

一、文本分析概述

1. 文本数据与文本分析

1.1 数据的分类(结构化 / 非结构化)

1.2 文本数据的来源

1.3 文本分析的概念、层次与流程(层次:词法 / 信息抽取 / 分类聚类 / 句法 / 语义 / 篇章;流程:收集 → 预处理

→ 特征 → 建模 → 评估)

1.4 文本分析的挑战(一词多义、语义歧义、领域差异、标注成本、评估困难)

2. 方法的演进:从规则到大语言模型

2.1 规则方法——人工编写词典与语法规则

2.2 统计方法——基于语料频率与概率(N-gram、HMM 等)

2.3 机器学习方法——人工造特征 + 分类器(朴素贝叶斯、SVM 等)

2.4 深度学习方法——自动学特征(Word2Vec、RNN/LSTM、TextCNN、BERT)

2.5 大语言模型 / AI 智能体——预训练大模型 + 提示词,零样本 / 少样本直接出结果

3. AI 智能体时代的文本分析新范式

3.1 范式之变:从

3.2 两条落地路线:

① 嵌入(Embedding)+ 轻量模型——样本量大、要可复现;

② 对话式调用——无标注、任务多变、需解释理由

3.3 关键概念:Embedding、提示词工程、零样本 / 少样本

3.4 工具选型:Claude Code、对话模型 API(DeepSeek / 通义千问)、嵌入服务(硅基流动 /Hugging Face)

3.5 边界与风险:结果不稳定、幻觉、口径对齐、成本限流、可复现性与审稿要求

二、数据获取与预处理

1. 语料库

1.1 语料库的概念与作用

1.2 语料库的分类(通用 / 专用、单语 / 平行、生语料 / 标注语料)

1.3 常见中文语料库一览(人民日报、SIGHAN、THUCNews、搜狗新闻、中文维基等)

1.4 语料库的获取与加载方式

2. 文本数据的读取

2.1 常用文件形式读取

案例:CSV / Excel / Word / JSON / TXT / PDF 六类文件读取实操

2.2 文件夹数据遍历

案例:批量遍历文件夹读取全部文本文件

3. 文本数据的清洗

3.1 英文文本清洗

案例:基于 NLTK 的英文清洗——句子拆分、词拆分、去重复词、去停用词、大小写变换、文本翻译、词干提取、提取 Email/URL

提取 Email/URL

3.2 中文文本清洗

案例 1:pandas 字符串序列操作—长度、大小写、检索(get/slice/findall/extract)、索引(find/index)、类型判断、对齐填充、替换、分割(split/partition)、拼接、重复、统计

判断、对齐填充、替换、分割(split/partition)、拼接、重复、统计

案例 2:用正则表达式清洗中文文

4. 分词

4.1 中文与英文文本分析的区别

4.2 中文分词的难点

4.3 三大主流分词方法

4.4 jieba 分词

案例:jieba 三种模式基本用法 + 高频词提取(加载 / 不加载停用词对比)+ 绘制词云图

4.5 自定义词典与领域适配(加载专业词库、调整词频、经管 / 中医药 / 法律等领域用法)

5. 词性标注

5.1 N-gram 用于词性标注

5.2 jieba 库中的词性标注(北大计算所词性标注集,40 种词性)

案例:对多篇新闻进行词性标注 + 添加偏僻词 + 添加自定义词典与停用词

三、文本表示:从词频到向量

1. 稀疏表示:基于词频统计

1.1 词集模型(one-hot / SOW)

1.2 词袋模型(BOW)

案例:BOW 中文处理实操

1.3 TFIDF

案例:TF-IDF 模型构建与文档表示

1.4 N-gram 特征

2. 稠密表示:静态词 / 文档向量

2.1 Word2Vec(CBOW / Skipgram)

案例 1:用 Word2Vec 计算《西游记》人物相似性

案例 2:加载中文预训练模型 + 文章相似性分析

2.2 GloVe

案例:GloVe 模型加载与使用

2.3 FastText(子词嵌入)

案例:自训练 FastText + 加载官方多语言模型

2.4 Doc2Vec(PV-DM / PV-DBOW,文档级向量)

案例:Doc2Vec 文档向量训练与相似度

3. 稠密表示:动态上下文向量与序列模型

3.1 序列建模:RNN → LSTM → GRU

3.2 卷积用于文本:TextCNN(一维卷积捕捉局部 N-gram 特征)

3.3 自注意力与并行建模:Transformer(整体组成、Encoder-Decoder、自注意力机制)

3.4 预训练 + 微调:BERT

案例:BERT 中文 / 英文向量提取,并与 Word2Vec 对比

四、关键信息提取:关键词与主题

1. 关键词提取

1.1 基于统计的方法

1.1.1 TF-IDF(jieba 中的实现细节)——案例:基于 TF-IDF 的关键词提取

1.1.2 RAKE——案例:RAKE 短语型关键词提取

1.1.3 YAKE——案例:YAKE 无监督关键词提取

1.2 基于图模型的方法:TextRank

从 PageRank 到 TextRank;构图方式(词为节点、共现为边、迭代求权重)

案例:TextRank 关键词提取

2. 主题模型:LDA

2.1 为什么需要 LDA

2.2 LDA 的假设(文档主题、主题词的双层分布)

2.3 LDA 建模与主题词提取流程

案例:新闻语料主题词提取 + pyLDAvis 主题可视化

五、文本分析任务:分类、聚类、摘要、情感

1. 文本分类

1.1 任务定义与评价指标(准确率 / 精确率 / 召回率 / F1 / 混淆矩阵)

1.2 朴素贝叶斯分类原理(多项式模型 / 伯努利模型)

1.3 SVM 分类原理(线性核 / 多项式核 / RBF 核)

1.4 综合案例:贝叶斯新闻分类

1.5 综合案例:基于深度学习的新闻文本分类

数据预处理 → 分别用 DNN / RNN / LSTM / GRU / TextCNN 建模并对比 → BERT 微调(加载模型与 tokenizer → 训练 → 测试集评估 → 预测)

→ 训练 → 测试集评估 → 预测)

2. 文本聚类

2.1 常用算法(K-Means / 层次聚类 / DBSCAN)

2.2 聚类数选择与效果评估(肘部法则、轮廓系数)

2.3 案例:百度百科数据聚类

3. 文本摘要

3.1 抽取式摘要(句子打分、TextRank 摘要)

3.2 生成式与混合式摘要

3.3 案例:抽取式摘要实操

4. 情感分析

4.1 核心概念(情感极性 / 强度 / 分析层次)

4.2 方法分类(词典方法 / 机器学习方法)

4.3 案例:SnowNLP 情感分析——基本用法 → 基于预训练模型的分析 → 自定义训练(增量 / 重新训练)

六、AI 智能体文本分析实操与经管应用

1. Claude Code 全流程辅助

1.1 分析代码的解读与优化

1.2 从数据准备、模型训练到结果可视化的代码自动生成

1.3 案例 1:自动生成

1.4 案例 2:AI 智能体自动撰写分析报告(含图表、结论、政策建议)

2. 嵌入特征的获取与应用

2.1 获取嵌入向量、读取与筛选数据

2.2 案例 1:利用嵌入特征进行文本分类

2.3 案例 2:利用嵌入特征进行回归

2.4 案例 3:基于嵌入特征的相似性分析与推荐

2.5 案例 4:利用嵌入特征进行聚类

2.6 案例 5:零样本分类(Zero-Shot Classification)

2.7 案例 6:用嵌入特征分析《西游记》人物关系网络

3. 对话式调用大模型

3.1 案例 1:文本分类

3.2 案例 2:情感分析(豆瓣评论:传统方法 vs 大模型零样本对比)

3.3 案例 3:结构化信息提取(实体关系抽取)

3.4 案例 4:文本摘要

3.5 案例 5:少样本学习

3.6 案例 6:词汇信息提取

4. 经管场景综合应用

4.1 研究范式与数据准备

文本研究的三种产出:文本 → 变量(进回归)/ 文本 → 关系(构网络)/ 文本 → 描述(讲模式)

经管文本源:年报 / MD&A、招股书、公告、问询函、业绩说明会、互动易 / 上证 e 互动、研报、财经新闻

案例:AI 智能体批量清洗、格式化年报 / 公告 / 互动文本,输出规整语料

4.2 词频 / TF-IDF 类变量

学术口径:词表构建、分母选择、按年份 / 行业标准化、Winsorize;常见陷阱:分词错误、停用词不当、行业词库

缺失

案例:企业数字化转型指数与全要素生产率—《企业数字化转型与资本市场表现》(管理世界,2021)/ 等《数字

化转型与企业分工》(中国工业经济,2021)的

4.3 词向量类变量

学术用法:用词向量扩展种子词、构建领域词表再回到词频度量;AI 智能体自动挖掘领域词

案例:企业文化五维度量(创新 / 诚信 / 团队 / 尊重 / 质量)——《Measuring Corporate Culture Using Machine Learning》(RFS,2021)与国内跟进研究(如《企业文化与创新》类文献)的 word2vec 种子词扩展 + 年报计分法

Machine Learning》(RFS,2021)与国内跟进研究(如《企业文化与创 新》类文献)的 word2vec 种子词扩展 + 年报计分法

+ 年报计分法

4.4 文本相似度与信息含量类变量

度量口径:余弦 / 软余弦相似度、年报文本相似度与变动度、问答一致性、信息密度

案例:年报文本相似度与信息含量——《Large-Sample Evidence on Firms' Year-over-Year MD&A Modifications》(JAR,2011)、《Lazy Prices》(JF,2020)思路,及国内《年报文本信息含量》类研究

Modifications》(JAR,2011)、《Lazy Prices》(JF,2020)思路,及国内《年报 文本信息含量》类研究

4.5 语调 / 情感类变量

学术口径:财经专用情感词典(英文 Loughran-McDonald、中文财经词典),净语调 =(正面词−负面词)/ 总词数,与通用情感分类的区别

数,与通用情感分类的区别

案例:年报 / MD&A 语调与市场反应——《When Is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks》(JF,2011)的 LM 词典法,及国内

and 10-Ks》(JF,2011)的 LM 词典法,及国内

4.6 可读性 / 复杂度类变量

度量口径:Fog 指数、平均句长、文件字节数 / 词数、模糊限制词占比

案例:年报可读性与盈余持续性 《Annual Report Readability, Current Earnings, and Earnings Persistence》(JAE,2008)的 Fog 指数 + 文档长度法,及国内

(JAE,2008)的 Fog 指数 + 文档长度法,及国内

4.7 文本 → 关系 / 网络类变量

案例:文本产品市场竞争度(TNIC)《TextBased Network Industries and Endogenous Product Differentiation》(JPE,2016),用年报产品描述算公司两两相似 度、构建时变行业网络;延伸:用专利 / 年报文本算企业间技术邻近度

Differentiation》(JPE,2016),用年报产品描述算公司两两相似 度、构建时变行业网络;延伸:用专利 / 年报文本算企业间技术邻近度

文本算企业间技术邻近度

4.8 LDA 主题类变量

经管场景:年报风险、ESG、问询函、管理层讨论的主题强度变量;AI 智能体加速主题数选择、命名与标注

案例:交易所问询函主题分类与监管有效性——《证券交易所一线监管的有效性研究——基于财务报告问询函的证据》(《管理世界》2019 年第 3 期)中对问询函按问题类型 / 主题分类的做法,用 LDA 提取问询函主题结构,再检验其与盈余管理、市场反应的关系

据》(《管理世界》2019 年第 3 期)中对问询函按问题类型 / 主题分 类的做法,用 LDA 提取问询函主题结构,再检验其与盈余管理、市场反应的关系

检验其与盈余管理、市场反应的关系

4.9 大语言模型直接生成变量

用提示词让大模型直接读文本、输出识别 / 分类 / 情感 / 风险标注;学术要求:口径固定、可复现、抽样人工校验、报告与人工标注的一致性(Kappa / 准确率)

验、报告与人工标注的一致性(Kappa / 准确率)

案例:企业风险暴露的大模型度量——《Firm-Level Political Risk》(QJE,2019)的的

模型逐句判断年报是否披露某类风险(供应链 / 数据安全 / 地缘政治), 端到端全链路:PDF → 清洗 → 变量 → 可直接回归

可直接回归


报名时间 2026-09-01 00:00 至 2026-09-30 00:00
培训时间 2026年10月1-4日 (四天)
培训地点 北京现场班, 同步远程直播; 均提供录播回放
培训费用 5000元,提供电子版发票+通知+结业证书
授课安排 9:00-12:00;14:00-17:00;答疑


【授课老师】

陈远祥,北京邮电大学副教授,博士生导师,北京大学博士,北京大学优秀博士后,人工智能资深讲师。主要科研方向:数据分析、大数据处理,人工智能。

发表SCI/EI学术论文100余篇,其中第一或通讯作者论文60余篇,授权国家发明专利20余项。主持国家自然科学基金面上项目,国家重点研发计划课题,国家自然科学基金青年项目及博士后基金等多个国家级和省部级项目。国自然函评专家。IEEE、OSA会员,多个SCI期刊审稿人。



【课程大纲】蓝色字体为本次新增内容

爬虫与文本分析概述

目标:了解爬虫和文本分析常见应用场景,如何高效分析文本价值

1) 爬虫常见应用场景,结构化数据/文本数据的获取方法概述

2) 爬虫和文本分析的技术难点,大模型如何辅助爬虫和文本分析


DeepSeek助力Python爬虫

1. 爬虫基础

目标:掌握爬虫基本概念,爬虫基本流程,掌握网页基础知识

1) 什么是网络爬虫,爬虫的注意事项

2) http基本原理

3) web网页基础

4) 爬虫基本流程

案例:

百度,网易有道,豆瓣网页结构的理解和数据的解析;
简单网页的制作


2. 页面解析和数据存储

目标:掌握正则表达式的用法,学会利用正则表达式进行文本信息提取,掌握常见文本信息存储方法

1) 常用网页数据解析方法,基于正则表达式的文本信息提取

2) 文本文件存储

3) JSON文件存储

案例:
正则表达式提取知网信息;
知网爬取数据的存储和读取(txt,csv,excel,json)


3. urllib和requests

目标:掌握两种基本的请求发送方法,通过案例展示,实现单页和多页数据爬取,掌握动态页面爬取方法,掌握模拟登录,IP代理常用方法,实现高效率、大规模的网络爬取

1) 请求头的构造

2) urllib中的get请求与post请求

3) requests单页和多页数据的爬取

4) 动态页面的数据爬取

5) 模拟登录

6) 代理的基本使用

7) 高效代理池的维护

案例:
案例1:链家房源图片的获取和下载;
案例2:链家房源数据的获取(单页和多页);
案例3:电影分类数据的爬取(JSON数据);
案例4:电影评论的爬取(单页跳转到多页)


4. BeautifulSoup和Xpath

目标:通过案例,掌握两种高效的网页信息解析和提取方法,实现网络数据的高效提取

1) BeautifulSoup简介

2) BeautifulSoup的页面解析

3) BeautifulSoup节点选择方法

4) 什么是Xpath

5) Xpath常用匹配规则

6) Xpath的节点选择

案例:
案例1:天气预报数据的爬取(7天和40天);
案例2:豆瓣短评的爬取(多页)


5. Selenium和Playwright

目标:通过案例,掌握动态渲染页面的两种自动化的爬虫方法

1) Selenium的安装与配置

2) Selenium的基本使用

3) 页面的访问与节点定位

4) 节点信息的获取

5) Playwright的安装

6) Playwright的编写模式

7) Playwright代码生成

8) Playwright的常用操作方法

案例:
案例1:知网数据的爬取和论文的下载;
案例2:京东商品数据的爬取;
案例3:谷歌学术论文数据的爬取


6. 验证码的处理

目标:针对验证码反爬虫机制,掌握几种常用验证码识别方法

1) OCR识别验证码

2) 图像匹配识别滑动验证码

3) 云验证码识别

案例:
OCR验证码的识别


7. Scrapy和分布式爬虫

目标:掌握scrapy爬虫框架和常用方法

1) scrapy框架介绍

2) scrapy入门

3) scrapy的节点选择

4) Spider的用法

案例:
案例1:名言引用数据的抓取;
案例2:中国新闻网数据抓取


8. 基于大模型辅助的网络爬虫

目标:利用DeepSeek辅助爬虫,提高爬虫效率

1) 大模型在爬虫中的作用

2) 网页结构解析和信息提取:基于提示词的信息提取,生成代码进行信息提取

3) 爬虫代码的自动生成

4) 爬虫代码的解读和优化

案例:

案例1:基于deepseek提示词的评论数据抓取;

案例2:基于deepseek生成代码的评论数据抓取;
案例3:微博数据抓取


DeepSeek助力Python文本分析:

1. 文本分析概述

目标:掌握文本分析的基本概念,文本分析的发展历程,文本分析流程和挑战

1) 文本数据与文本分析

2) 自然语言处理的流派

3) 文本分析的常见应用

4) 文本分析的层次

5) 文本分析的流程

6) 文本分析的挑战


2. 文本单元的提取与标注

目标:掌握文本常用清洗方法,分词原理和方法,词性标注方法

1) 文本数据的读取:csv, excel,word, pdf, txt

2) 文本数据的清洗

3) 分词

4) 词性标注

案例:
案例1:年报数据的读取;
案例2:评论数据分词和词云图绘制;
案例3:新闻词性标注


3. 文本特征的选取与表示

目标:掌握文本的常用结构化表示方法,利用多种方法实现文本特征提取,理解每种特征提取的优缺点

1) 词袋模型

2) TF-IDF

3) Word2Vec

4) GloVe

5) Doc2vec

6) FastText

7) BERT深度学习方法

案例:
案例1:基于word2vec的西游记人物相似性分析;
案例2:基于维基百科的glove模型特征提取


4. 关键词提取

目标:掌握三种关键词提取方法

1) 基于统计的方法:TF-IDF

2) 基于图算法的方法:TextRank,RAKE

3) YAKE

4) LDA

案例:
案例1:新闻语料关键词提取;
案例2:LDA关键词提取和可视化


5. 文本分析的常见应用

目标:掌握文本分析的常见应用,和传统的机器学习方法结合,实现文本的分类,聚类,摘要提取,情感分析等功能

1) 文字云

2) 文本分类

3) 文本聚类

4) 文本摘要

5) 情感分析

案例:
案例1:评论数据词云图的绘制;
案例2:基于贝叶斯的新闻分类;
案例3:爬取豆瓣评论并构建分类器;
案例4:百科数据聚类;
案例5:豆瓣读书数据聚类


6. 基于深度学习的文本分析技术

目标:掌握最新的深度学习在文本分析中的应用,包括RNN,LSTM,CNN,注意力,Transformer等模型和机制的引入

1) RNN

2) LSTM

3) textCNN

4) GRU

5) 注意力机制

6) BERT和Transformer

案例:

案例1:基于DNN的评论分类;

案例2:基于RNN的评论分类;

案例3:基于LSTM的文本分类;

案例4:基于Text-CNN的文本分类


7. 基于大模型的文本分析

目标:AI大模型辅助文本分析,高效提取文本价值

1) 利用大模型进行文本特征提取

2)利用嵌入特征进行文本分类

3)利用嵌入特征进行回归

4)利用嵌入特征文本相似性提取和推荐

5)利用嵌入特征进行零样本分类

6)利用嵌入特征进行聚类

7)少样本学习

8)结构化数据提取

9)内容摘要的提取

10)内容分类

11)情感分析

12)文本知识图谱构建

13)文本聊天机器人构建

14)基于微调大模型的文本分析

案例:
案例1:美食点评数据分析(基于通义千问的文本嵌入特征获取);
案例2:点评数据的分类和回归;
案例3:基于deepseek的豆瓣文本情感分析;
案例4:基于deepseek的文本情感词提取;
案例5:基于deepseek的新闻文本分类;
案例6:基于deepseek的结构化信息提取;
案例7:基于deepseek的文本情感词提取;
案例8:deepseek聊天机器人构建;
案例9:中药文本知识图谱构建;

案例10:法律大模型微实践



【联系方式】

尹老师

电话:13321178792

QQ:42884447

WeChat:JGxueshu

JGxueshu.jpg

讲师介绍


Peixun.net

AI Agent赋能科研数据分析:从数据获取到论文变量构造

请认真填写以下信息,方便为您服务
  • 姓名:
  • 电话:
  • 邮箱:
  • 备注:
  • 邀请码:
  • 您还可以选择 登录 或者 注册 更方便您管理课程。

Peixun.net

您关于:

AI Agent赋能科研数据分析:从数据获取到论文变量构造

的报名信息已经提交成功。

去购物车结算
您可以选择 登录 或者 注册 更方便您管理课程。
回头再说
联系顾问 顾问微信

邮件已发送!

已成功发送邮件到您注册的邮箱 请前往查询并点击链接重置密码

有待解答的问题

3 名学员对您的课程提问,需要您作出回答。 现在就去