上课信息
上课时间:
2026年10月3-4日 (两天)
9:00-12:00;14:00-17:00;答疑
上课地点: 北京现场+远程直播,提供录播回放
1.1 数据的分类(结构化 / 非结构化)
1.2 文本数据的来源
1.3 文本分析的概念、层次与流程(层次:词法 / 信息抽取 / 分类聚类 / 句法 / 语义 / 篇章;流程:收集 → 预处理
→ 特征 → 建模 → 评估)
1.4 文本分析的挑战(一词多义、语义歧义、领域差异、标注成本、评估困难)
2.1 规则方法——人工编写词典与语法规则
2.2 统计方法——基于语料频率与概率(N-gram、HMM 等)
2.3 机器学习方法——人工造特征 + 分类器(朴素贝叶斯、SVM 等)
2.4 深度学习方法——自动学特征(Word2Vec、RNN/LSTM、TextCNN、BERT)
2.5 大语言模型 / AI 智能体——预训练大模型 + 提示词,零样本 / 少样本直接出结果
3.1 范式之变:从
3.2 两条落地路线:
① 嵌入(Embedding)+ 轻量模型——样本量大、要可复现;
② 对话式调用——无标注、任务多变、需解释理由
3.3 关键概念:Embedding、提示词工程、零样本 / 少样本
3.4 工具选型:Claude Code、对话模型 API(DeepSeek / 通义千问)、嵌入服务(硅基流动 /Hugging Face)
3.5 边界与风险:结果不稳定、幻觉、口径对齐、成本限流、可复现性与审稿要求
1.1 语料库的概念与作用
1.2 语料库的分类(通用 / 专用、单语 / 平行、生语料 / 标注语料)
1.3 常见中文语料库一览(人民日报、SIGHAN、THUCNews、搜狗新闻、中文维基等)
1.4 语料库的获取与加载方式
2.1 常用文件形式读取
案例:CSV / Excel / Word / JSON / TXT / PDF 六类文件读取实操
2.2 文件夹数据遍历
案例:批量遍历文件夹读取全部文本文件
3.1 英文文本清洗
案例:基于 NLTK 的英文清洗——句子拆分、词拆分、去重复词、去停用词、大小写变换、文本翻译、词干提取、提取 Email/URL
提取 Email/URL
3.2 中文文本清洗
案例 1:pandas 字符串序列操作—长度、大小写、检索(get/slice/findall/extract)、索引(find/index)、类型判断、对齐填充、替换、分割(split/partition)、拼接、重复、统计
判断、对齐填充、替换、分割(split/partition)、拼接、重复、统计
案例 2:用正则表达式清洗中文文
4.1 中文与英文文本分析的区别
4.2 中文分词的难点
4.3 三大主流分词方法
4.4 jieba 分词
案例:jieba 三种模式基本用法 + 高频词提取(加载 / 不加载停用词对比)+ 绘制词云图
4.5 自定义词典与领域适配(加载专业词库、调整词频、经管 / 中医药 / 法律等领域用法)
5.1 N-gram 用于词性标注
5.2 jieba 库中的词性标注(北大计算所词性标注集,40 种词性)
案例:对多篇新闻进行词性标注 + 添加偏僻词 + 添加自定义词典与停用词
1.1 词集模型(one-hot / SOW)
1.2 词袋模型(BOW)
案例:BOW 中文处理实操
1.3 TFIDF
案例:TF-IDF 模型构建与文档表示
1.4 N-gram 特征
2.1 Word2Vec(CBOW / Skipgram)
案例 1:用 Word2Vec 计算《西游记》人物相似性
案例 2:加载中文预训练模型 + 文章相似性分析
2.2 GloVe
案例:GloVe 模型加载与使用
2.3 FastText(子词嵌入)
案例:自训练 FastText + 加载官方多语言模型
2.4 Doc2Vec(PV-DM / PV-DBOW,文档级向量)
案例:Doc2Vec 文档向量训练与相似度
3.1 序列建模:RNN → LSTM → GRU
3.2 卷积用于文本:TextCNN(一维卷积捕捉局部 N-gram 特征)
3.3 自注意力与并行建模:Transformer(整体组成、Encoder-Decoder、自注意力机制)
3.4 预训练 + 微调:BERT
案例:BERT 中文 / 英文向量提取,并与 Word2Vec 对比
1.1 基于统计的方法
1.1.1 TF-IDF(jieba 中的实现细节)——案例:基于 TF-IDF 的关键词提取
1.1.2 RAKE——案例:RAKE 短语型关键词提取
1.1.3 YAKE——案例:YAKE 无监督关键词提取
1.2 基于图模型的方法:TextRank
从 PageRank 到 TextRank;构图方式(词为节点、共现为边、迭代求权重)
案例:TextRank 关键词提取
2.1 为什么需要 LDA
2.2 LDA 的假设(文档主题、主题词的双层分布)
2.3 LDA 建模与主题词提取流程
案例:新闻语料主题词提取 + pyLDAvis 主题可视化
1.1 任务定义与评价指标(准确率 / 精确率 / 召回率 / F1 / 混淆矩阵)
1.2 朴素贝叶斯分类原理(多项式模型 / 伯努利模型)
1.3 SVM 分类原理(线性核 / 多项式核 / RBF 核)
1.4 综合案例:贝叶斯新闻分类
1.5 综合案例:基于深度学习的新闻文本分类
数据预处理 → 分别用 DNN / RNN / LSTM / GRU / TextCNN 建模并对比 → BERT 微调(加载模型与 tokenizer → 训练 → 测试集评估 → 预测)
→ 训练 → 测试集评估 → 预测)
2.1 常用算法(K-Means / 层次聚类 / DBSCAN)
2.2 聚类数选择与效果评估(肘部法则、轮廓系数)
2.3 案例:百度百科数据聚类
3.1 抽取式摘要(句子打分、TextRank 摘要)
3.2 生成式与混合式摘要
3.3 案例:抽取式摘要实操
4.1 核心概念(情感极性 / 强度 / 分析层次)
4.2 方法分类(词典方法 / 机器学习方法)
4.3 案例:SnowNLP 情感分析——基本用法 → 基于预训练模型的分析 → 自定义训练(增量 / 重新训练)
1.1 分析代码的解读与优化
1.2 从数据准备、模型训练到结果可视化的代码自动生成
1.3 案例 1:自动生成
1.4 案例 2:AI 智能体自动撰写分析报告(含图表、结论、政策建议)
2.1 获取嵌入向量、读取与筛选数据
2.2 案例 1:利用嵌入特征进行文本分类
2.3 案例 2:利用嵌入特征进行回归
2.4 案例 3:基于嵌入特征的相似性分析与推荐
2.5 案例 4:利用嵌入特征进行聚类
2.6 案例 5:零样本分类(Zero-Shot Classification)
2.7 案例 6:用嵌入特征分析《西游记》人物关系网络
3.1 案例 1:文本分类
3.2 案例 2:情感分析(豆瓣评论:传统方法 vs 大模型零样本对比)
3.3 案例 3:结构化信息提取(实体关系抽取)
3.4 案例 4:文本摘要
3.5 案例 5:少样本学习
3.6 案例 6:词汇信息提取
文本研究的三种产出:文本 → 变量(进回归)/ 文本 → 关系(构网络)/ 文本 → 描述(讲模式)
经管文本源:年报 / MD&A、招股书、公告、问询函、业绩说明会、互动易 / 上证 e 互动、研报、财经新闻
案例:AI 智能体批量清洗、格式化年报 / 公告 / 互动文本,输出规整语料
学术口径:词表构建、分母选择、按年份 / 行业标准化、Winsorize;常见陷阱:分词错误、停用词不当、行业词库
缺失
案例:企业数字化转型指数与全要素生产率—《企业数字化转型与资本市场表现》(管理世界,2021)/ 等《数字
化转型与企业分工》(中国工业经济,2021)的"关键词词频占比"构造法
学术用法:用词向量扩展种子词、构建领域词表再回到词频度量;AI 智能体自动挖掘领域词
案例:企业文化五维度量(创新 / 诚信 / 团队 / 尊重 / 质量)——《Measuring Corporate Culture Using Machine Learning》(RFS,2021)与国内跟进研究(如《企业文化与创新》类文献)的 word2vec 种子词扩展 + 年报计分法
Machine Learning》(RFS,2021)与国内跟进研究(如《企业文化与创 新》类文献)的 word2vec 种子词扩展 + 年报计分法
+ 年报计分法
度量口径:余弦 / 软余弦相似度、年报文本相似度与变动度、问答一致性、信息密度
案例:年报文本相似度与信息含量——《Large-Sample Evidence on Firms' Year-over-Year MD&A Modifications》(JAR,2011)、《Lazy Prices》(JF,2020)思路,及国内《年报文本信息含量》类研究
Modifications》(JAR,2011)、《Lazy Prices》(JF,2020)思路,及国内《年报 文本信息含量》类研究
学术口径:财经专用情感词典(英文 Loughran-McDonald、中文财经词典),净语调 =(正面词−负面词)/ 总词数,与通用情感分类的区别
数,与通用情感分类的区别
案例:年报 / MD&A 语调与市场反应——《When Is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks》(JF,2011)的 LM 词典法,及国内
and 10-Ks》(JF,2011)的 LM 词典法,及国内"管理层讨论语调"类研究
度量口径:Fog 指数、平均句长、文件字节数 / 词数、模糊限制词占比
案例:年报可读性与盈余持续性 《Annual Report Readability, Current Earnings, and Earnings Persistence》(JAE,2008)的 Fog 指数 + 文档长度法,及国内
(JAE,2008)的 Fog 指数 + 文档长度法,及国内"年报可读性与股价同步性"类研究
从"文本 → 变量"到"文本 → 关系":两两文本相似度构造企业对,再汇成节点级变量(中心 度、竞争度)进回归
案例:文本产品市场竞争度(TNIC)《TextBased Network Industries and Endogenous Product Differentiation》(JPE,2016),用年报产品描述算公司两两相似 度、构建时变行业网络;延伸:用专利 / 年报文本算企业间技术邻近度
Differentiation》(JPE,2016),用年报产品描述算公司两两相似 度、构建时变行业网络;延伸:用专利 / 年报文本算企业间技术邻近度
文本算企业间技术邻近度
经管场景:年报风险、ESG、问询函、管理层讨论的主题强度变量;AI 智能体加速主题数选择、命名与标注
案例:交易所问询函主题分类与监管有效性——《证券交易所一线监管的有效性研究——基于财务报告问询函的证据》(《管理世界》2019 年第 3 期)中对问询函按问题类型 / 主题分类的做法,用 LDA 提取问询函主题结构,再检验其与盈余管理、市场反应的关系
据》(《管理世界》2019 年第 3 期)中对问询函按问题类型 / 主题分 类的做法,用 LDA 提取问询函主题结构,再检验其与盈余管理、市场反应的关系
检验其与盈余管理、市场反应的关系
用提示词让大模型直接读文本、输出识别 / 分类 / 情感 / 风险标注;学术要求:口径固定、可复现、抽样人工校验、报告与人工标注的一致性(Kappa / 准确率)
验、报告与人工标注的一致性(Kappa / 准确率)
案例:企业风险暴露的大模型度量——《Firm-Level Political Risk》(QJE,2019)的的
模型逐句判断年报是否披露某类风险(供应链 / 数据安全 / 地缘政治), 端到端全链路:PDF → 清洗 → 变量 → 可直接回归
可直接回归
| 报名时间 | 2026-08-31 00:00 至 2026-10-02 00:00 |
|---|---|
| 培训时间 | 2026年10月3-4日 (两天) |
| 培训地点 | 北京现场+远程直播,提供录播回放 |
| 培训费用 | 3000元,提供电子版发票+通知+结业证书 |
| 授课安排 | 9:00-12:00;14:00-17:00;答疑 |
AI Agent赋能文本分析:从文本数据到论文变量构造 2026新课
从TF-IDF、Word2Vec、BERT到Embedding与大模型,包含48个实战案例
【授课老师】
陈远祥,北京邮电大学副教授,博士生导师,北京大学博士,北京大学优秀博士后,人工智能资深讲师。主要科研方向:数据分析、大数据处理、智能信号处理和图像。
发表SCI/EI学术论文100余篇,其中第一或通讯作者论文60余篇,授权国家发明专利20余项。主持国家自然科学基金面上项目,国家重点研发计划课题,国家自然科学基金青年项目及博士后基金等多个国家级和省部级项目。IEEE、OSA会员,多个SCI期刊审稿人。
曾给中国移动,中国电信,中国银行,国家电网等多个企业和高校做过人工智能相关的课程培训。授课风格通俗易懂,深入浅出,大量的实战案例,广受学员好评。JG学术培训-Python及AI金牌讲师。
【课程大纲】
1.1 数据的分类(结构化 / 非结构化)
1.2 文本数据的来源
1.3 文本分析的概念、层次与流程(层次:词法 / 信息抽取 / 分类聚类 / 句法 / 语义 / 篇章;流程:收集 → 预处理
→ 特征 → 建模 → 评估)
1.4 文本分析的挑战(一词多义、语义歧义、领域差异、标注成本、评估困难)
2.1 规则方法——人工编写词典与语法规则
2.2 统计方法——基于语料频率与概率(N-gram、HMM 等)
2.3 机器学习方法——人工造特征 + 分类器(朴素贝叶斯、SVM 等)
2.4 深度学习方法——自动学特征(Word2Vec、RNN/LSTM、TextCNN、BERT)
2.5 大语言模型 / AI 智能体——预训练大模型 + 提示词,零样本 / 少样本直接出结果
3.1 范式之变:从"分词 → 造特征 → 训练分类器"的流水线,到"写清任务 → 模型直接给结果"
3.2 两条落地路线:
① 嵌入(Embedding)+ 轻量模型——样本量大、要可复现;
② 对话式调用——无标注、任务多变、需解释理由
3.3 关键概念:Embedding、提示词工程、零样本 / 少样本
3.4 工具选型:Claude Code、对话模型 API(DeepSeek / 通义千问)、嵌入服务(硅基流动 /Hugging Face)
3.5 边界与风险:结果不稳定、幻觉、口径对齐、成本限流、可复现性与审稿要求
1.1 语料库的概念与作用
1.2 语料库的分类(通用 / 专用、单语 / 平行、生语料 / 标注语料)
1.3 常见中文语料库一览(人民日报、SIGHAN、THUCNews、搜狗新闻、中文维基等)
1.4 语料库的获取与加载方式
2.1 常用文件形式读取
案例:CSV / Excel / Word / JSON / TXT / PDF 六类文件读取实操
2.2 文件夹数据遍历
案例:批量遍历文件夹读取全部文本文件
3.1 英文文本清洗
案例:基于 NLTK 的英文清洗——句子拆分、词拆分、去重复词、去停用词、大小写变换、文本翻译、词干提取、提取 Email/URL
提取 Email/URL
3.2 中文文本清洗
案例 1:pandas 字符串序列操作—长度、大小写、检索(get/slice/findall/extract)、索引(find/index)、类型判断、对齐填充、替换、分割(split/partition)、拼接、重复、统计
判断、对齐填充、替换、分割(split/partition)、拼接、重复、统计
案例 2:用正则表达式清洗中文文
4.1 中文与英文文本分析的区别
4.2 中文分词的难点
4.3 三大主流分词方法
4.4 jieba 分词
案例:jieba 三种模式基本用法 + 高频词提取(加载 / 不加载停用词对比)+ 绘制词云图
4.5 自定义词典与领域适配(加载专业词库、调整词频、经管 / 中医药 / 法律等领域用法)
5.1 N-gram 用于词性标注
5.2 jieba 库中的词性标注(北大计算所词性标注集,40 种词性)
案例:对多篇新闻进行词性标注 + 添加偏僻词 + 添加自定义词典与停用词
1.1 词集模型(one-hot / SOW)
1.2 词袋模型(BOW)
案例:BOW 中文处理实操
1.3 TFIDF
案例:TF-IDF 模型构建与文档表示
1.4 N-gram 特征
2.1 Word2Vec(CBOW / Skipgram)
案例 1:用 Word2Vec 计算《西游记》人物相似性
案例 2:加载中文预训练模型 + 文章相似性分析
2.2 GloVe
案例:GloVe 模型加载与使用
2.3 FastText(子词嵌入)
案例:自训练 FastText + 加载官方多语言模型
2.4 Doc2Vec(PV-DM / PV-DBOW,文档级向量)
案例:Doc2Vec 文档向量训练与相似度
3.1 序列建模:RNN → LSTM → GRU
3.2 卷积用于文本:TextCNN(一维卷积捕捉局部 N-gram 特征)
3.3 自注意力与并行建模:Transformer(整体组成、Encoder-Decoder、自注意力机制)
3.4 预训练 + 微调:BERT
案例:BERT 中文 / 英文向量提取,并与 Word2Vec 对比
1.1 基于统计的方法
1.1.1 TF-IDF(jieba 中的实现细节)——案例:基于 TF-IDF 的关键词提取
1.1.2 RAKE——案例:RAKE 短语型关键词提取
1.1.3 YAKE——案例:YAKE 无监督关键词提取
1.2 基于图模型的方法:TextRank
从 PageRank 到 TextRank;构图方式(词为节点、共现为边、迭代求权重)
案例:TextRank 关键词提取
2.1 为什么需要 LDA
2.2 LDA 的假设(文档主题、主题词的双层分布)
2.3 LDA 建模与主题词提取流程
案例:新闻语料主题词提取 + pyLDAvis 主题可视化
1.1 任务定义与评价指标(准确率 / 精确率 / 召回率 / F1 / 混淆矩阵)
1.2 朴素贝叶斯分类原理(多项式模型 / 伯努利模型)
1.3 SVM 分类原理(线性核 / 多项式核 / RBF 核)
1.4 综合案例:贝叶斯新闻分类
1.5 综合案例:基于深度学习的新闻文本分类
数据预处理 → 分别用 DNN / RNN / LSTM / GRU / TextCNN 建模并对比 → BERT 微调(加载模型与 tokenizer → 训练 → 测试集评估 → 预测)
→ 训练 → 测试集评估 → 预测)
2.1 常用算法(K-Means / 层次聚类 / DBSCAN)
2.2 聚类数选择与效果评估(肘部法则、轮廓系数)
2.3 案例:百度百科数据聚类
3.1 抽取式摘要(句子打分、TextRank 摘要)
3.2 生成式与混合式摘要
3.3 案例:抽取式摘要实操
4.1 核心概念(情感极性 / 强度 / 分析层次)
4.2 方法分类(词典方法 / 机器学习方法)
4.3 案例:SnowNLP 情感分析——基本用法 → 基于预训练模型的分析 → 自定义训练(增量 / 重新训练)
1.1 分析代码的解读与优化
1.2 从数据准备、模型训练到结果可视化的代码自动生成
1.3 案例 1:自动生成
1.4 案例 2:AI 智能体自动撰写分析报告(含图表、结论、政策建议)
2.1 获取嵌入向量、读取与筛选数据
2.2 案例 1:利用嵌入特征进行文本分类
2.3 案例 2:利用嵌入特征进行回归
2.4 案例 3:基于嵌入特征的相似性分析与推荐
2.5 案例 4:利用嵌入特征进行聚类
2.6 案例 5:零样本分类(Zero-Shot Classification)
2.7 案例 6:用嵌入特征分析《西游记》人物关系网络
3.1 案例 1:文本分类
3.2 案例 2:情感分析(豆瓣评论:传统方法 vs 大模型零样本对比)
3.3 案例 3:结构化信息提取(实体关系抽取)
3.4 案例 4:文本摘要
3.5 案例 5:少样本学习
3.6 案例 6:词汇信息提取
文本研究的三种产出:文本 → 变量(进回归)/ 文本 → 关系(构网络)/ 文本 → 描述(讲模式)
经管文本源:年报 / MD&A、招股书、公告、问询函、业绩说明会、互动易 / 上证 e 互动、研报、财经新闻
案例:AI 智能体批量清洗、格式化年报 / 公告 / 互动文本,输出规整语料
学术口径:词表构建、分母选择、按年份 / 行业标准化、Winsorize;常见陷阱:分词错误、停用词不当、行业词库
缺失
案例:企业数字化转型指数与全要素生产率—《企业数字化转型与资本市场表现》(管理世界,2021)/ 等《数字
化转型与企业分工》(中国工业经济,2021)的"关键词词频占比"构造法
学术用法:用词向量扩展种子词、构建领域词表再回到词频度量;AI 智能体自动挖掘领域词
案例:企业文化五维度量(创新 / 诚信 / 团队 / 尊重 / 质量)——《Measuring Corporate Culture Using Machine Learning》(RFS,2021)与国内跟进研究(如《企业文化与创新》类文献)的 word2vec 种子词扩展 + 年报计分法
Machine Learning》(RFS,2021)与国内跟进研究(如《企业文化与创 新》类文献)的 word2vec 种子词扩展 + 年报计分法
+ 年报计分法
度量口径:余弦 / 软余弦相似度、年报文本相似度与变动度、问答一致性、信息密度
案例:年报文本相似度与信息含量——《Large-Sample Evidence on Firms' Year-over-Year MD&A Modifications》(JAR,2011)、《Lazy Prices》(JF,2020)思路,及国内《年报文本信息含量》类研究
Modifications》(JAR,2011)、《Lazy Prices》(JF,2020)思路,及国内《年报 文本信息含量》类研究
学术口径:财经专用情感词典(英文 Loughran-McDonald、中文财经词典),净语调 =(正面词−负面词)/ 总词数,与通用情感分类的区别
数,与通用情感分类的区别
案例:年报 / MD&A 语调与市场反应——《When Is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks》(JF,2011)的 LM 词典法,及国内
and 10-Ks》(JF,2011)的 LM 词典法,及国内"管理层讨论语调"类研究
度量口径:Fog 指数、平均句长、文件字节数 / 词数、模糊限制词占比
案例:年报可读性与盈余持续性 《Annual Report Readability, Current Earnings, and Earnings Persistence》(JAE,2008)的 Fog 指数 + 文档长度法,及国内
(JAE,2008)的 Fog 指数 + 文档长度法,及国内"年报可读性与股价同步性"类研究
从"文本 → 变量"到"文本 → 关系":两两文本相似度构造企业对,再汇成节点级变量(中心 度、竞争度)进回归
案例:文本产品市场竞争度(TNIC)《TextBased Network Industries and Endogenous Product Differentiation》(JPE,2016),用年报产品描述算公司两两相似 度、构建时变行业网络;延伸:用专利 / 年报文本算企业间技术邻近度
Differentiation》(JPE,2016),用年报产品描述算公司两两相似 度、构建时变行业网络;延伸:用专利 / 年报文本算企业间技术邻近度
文本算企业间技术邻近度
经管场景:年报风险、ESG、问询函、管理层讨论的主题强度变量;AI 智能体加速主题数选择、命名与标注
案例:交易所问询函主题分类与监管有效性——《证券交易所一线监管的有效性研究——基于财务报告问询函的证据》(《管理世界》2019 年第 3 期)中对问询函按问题类型 / 主题分类的做法,用 LDA 提取问询函主题结构,再检验其与盈余管理、市场反应的关系
据》(《管理世界》2019 年第 3 期)中对问询函按问题类型 / 主题分 类的做法,用 LDA 提取问询函主题结构,再检验其与盈余管理、市场反应的关系
检验其与盈余管理、市场反应的关系
用提示词让大模型直接读文本、输出识别 / 分类 / 情感 / 风险标注;学术要求:口径固定、可复现、抽样人工校验、报告与人工标注的一致性(Kappa / 准确率)
验、报告与人工标注的一致性(Kappa / 准确率)
案例:企业风险暴露的大模型度量——《Firm-Level Political Risk》(QJE,2019)的的
模型逐句判断年报是否披露某类风险(供应链 / 数据安全 / 地缘政治), 端到端全链路:PDF → 清洗 → 变量 → 可直接回归
可直接回归
【联系方式】
尹老师
电话:13321178792
QQ:42884447
WeChat:JGxueshu

内容不能少于5个字符!
顾问微信
©2026Peixun.net 北京国富如荷网络科技有限公司 版权所有 未经许可 请勿转载
京ICP备11001960号-4
京公网安备 11010802034634号
邮件已发送!
已成功发送邮件到您注册的邮箱 请前往查询并点击链接重置密码
分享
收藏
