764 字
4 分钟

第三部分:NLP——从文本里挖交易信号(第 14~16 章)

原书第三部分用三章讲自然语言处理在交易中的应用。对多数平台用户这是索引板块:先知道流水线长什么样、信号藏在哪,等真要做舆情/公告因子时再回来精读。

第 14 章:文本数据与情绪分析#

文本→信号的标准流水线:

  1. 预处理:分词、词形还原、去停用词(工具:spaCy、NLTK);
  2. 向量化:词袋模型 + TF-IDF,把一篇文档变成一行特征;
  3. 分类:朴素贝叶斯做情绪分类——简单、快、在文本上出奇地能打;
  4. 成为因子:把新闻/推文情绪得分聚合到股票 × 日期,就得到一个标准的情绪因子面板,之后的 IC 体检、分层回测与价量因子完全同一套流程。

这是本部分最值得记住的一点:文本因子的下游检验没有任何特殊性——难点全在上游的数据获取与清洗。

第 15 章:主题模型#

LDA(潜在狄利克雷分配)把海量新闻/财报电话会自动聚成若干”主题”,追踪主题热度随时间的变化。用途偏监控与理解:市场在讨论什么、某公司的叙事何时切换——直接变成可交易信号的案例少,当仪表盘思路看。

第 16 章:词向量与深度文本模型#

word2vec/doc2vec 让”语义相近的词向量也相近”,书中用 SEC 文件和财报电话会记录训练嵌入、喂给下游分类器;第 2 版还补了 transformer/BERT 的简介——2020 年的书,NLP 部分是全书老化最快的板块,今天做文本信号大概率直接上预训练大模型,但”文本 → 向量 → 因子面板 → IC 体检”的骨架没变。

对 A 股与本平台的现实盘点#

诚实评估文本因子在本平台的可行性:

  • 数据源:公告(巨潮)、研报摘要、股吧/雪球情绪——可得,但爬取、清洗、去重的工程量远超价量数据,且历史回填困难(情绪数据没有”补历史”一说);
  • 优先级:平台价量因子的地基还在夯(样本量、多重检验纪律),文本因子属于二期工程——先把第 12 章的梯度提升因子做出来,再考虑给它加一列情绪特征;
  • 最小可行起点:如果真想试,从”公告数量/类型”这类结构化文本元数据入手(不用 NLP 也能算),比直接上情绪分析务实得多。

本页带走的三句话#

  1. 文本因子的特殊性全在上游获取与清洗,下游检验与价量因子共用同一套 IC 流程;
  2. 这三章当索引读:知道流水线长什么样,要做舆情因子时再回来;
  3. NLP 是全书老化最快的板块——骨架仍然成立,具体模型今天会换成预训练大模型。