周一,启明资本的量化部依然维持着那种如同服务器机房般的冷淡与高效。但空气里,确实有些东西变得不一样了。
刘余刚坐回那个偏僻工位,桌上多了一杯冰美式,杯壁上贴着一张便利贴,字迹挺拔:“你的数据清洗脚本,逻辑写得很漂亮。——李哲” 。
刘余愣了愣,抬头看向区域中心。李哲正戴着耳机,修长的手指在键盘上飞速跳跃,甚至没往这边看一眼 。沈心玥则转过转椅,隔着几排工位对刘余笑了笑,晃了晃手里同样的咖啡:“别误会,李哲这是‘逻辑癖’发作,看到干净的代码就忍不住想打钱。你的XXX数据源校正,确实救了我们上周那个策略回测的急。”
这并非恶性竞争的职场剧。在启明这种智力密度极高的地方,实力是唯一的社交通行证 。李哲和沈心玥虽然带着名校精英的骄傲,但面对一个能从“脏数据”里提炼出真理的新人,他们表达认可的方式非常直接——把对方拉进自己的专业坐标系里 。
“谢了。”刘余在内网通讯软件上回了一句,顺手把那张便利贴贴在老款Alienware的屏幕边缘 。那台笨重的电脑依旧在稳定地输出着数据流,发出轻微但踏实的风扇声 。
工作节奏一如既往的高速有序,新的项目启动邮件是在周一清晨九点零五分,准时抵达所有相关成员邮箱的。
主题简明扼要:“行业情绪轮动因子构建项目(代号:Sentinel)——启动暨分工”。刘余点开邮件,快速浏览。项目目标:利用海量公开文本数据,构建能前瞻性捕捉不同行业板块情绪拐点的复合因子,旨在增强现有宏观策略的敏锐度。项目周期六周,最终需提交完整因子构建方法论、回测报告及实盘接入方案。
邮件的附件里,分工表清晰列明:
??核心建模组:李哲(组长)、沈心玥,另配备一名自然语言处理专家顾问。负责整体模型架构设计,重点攻关“基于预训练大模型(BERT/GPT)与图神经网络的跨行业情绪传导关系挖掘”。
??数据工程与预处理组:刘余、王磊。负责所有文本数据的爬取、清洗、结构化,以及基础情绪词典的构建与优化,为模型组提供“干净、可靠”的输入数据。
??回测与评估组:其他几位资深分析师。
分工符合预期,却又透着某种冰冷的合理性。李哲与沈心玥的名字并排出现在最显眼、最具创造性的部分。而刘余,与以踏实著称的王磊一起,被归入“基建”环节。她关掉邮件,目光落在面前略显陈旧的显示器上,那里已经打开了一个空白文档,标题是“Sentinel项目数据需求与预处理初步计划”。她深吸一口气,开始敲击键盘。无法参与最炫目的部分,那就把脚下的基石铺到最平、最稳。
开题会定在周三下午。会议室玻璃墙外,CBD的午后阳光被百叶窗切割成明暗相间的条纹。
李哲代表核心建模组进行陈述。他站在投影前,姿态松弛自信,语言流畅地抛出一连串术语:“我们将采用经过金融语料微调的BERT模型作为文本编码器,提取深度语义特征;同时,构建行业关联图,节点为公司,边权重基于供应链、共同股东等关系,应用图注意力网络捕捉情绪在产业网络中的非线性扩散路径……预期能超越传统词袋模型和简单情感词典,捕捉到诸如‘政策期待中的审慎乐观’、‘业绩隐忧下的修辞性淡化’等复杂情绪维度。”
幻灯片上,模型结构图复杂如神经网络本身,引用的论文来自最新的顶会。沈心玥适时补充了关于损失函数设计和防止过拟合的正则化方案。整个展示技术密度高,前瞻性强,引得与会几位总监频频点头。
轮到数据工程组。王磊简要说明了数据源范围(财经新闻、公司公告、券商研报、社交媒体精选)、爬取频率和初步的清洗框架。然后他示意刘余:“具体在文本清洗和噪声处理中遇到的实际挑战,以及我们计划的一些针对性方法,请刘余详细说明。”
刘余站起来,走到前面。她的心跳有些快,但不是因为紧张,而是因为要陈述的内容是她过去一周扎在数据里反复验证过的实际问题。她没有复杂的模型图,打开的是几张简洁的幻灯片,上面列着问题、示例和解决方案思路。
“我们面临的首要挑战,是文本中的‘噪声’具有高度情境依赖性和欺骗性。”她的声音清晰平稳,目光落在自己的内容上,避免与下方那些审视的目光直接接触,“例如,新闻标题中常见的反讽或夸张修辞。像‘XX公司股价‘一飞冲天’后迅速回落’这里的‘一飞冲天’,直接匹配积极词典会导致误判。我们计划构建一个基于规则和轻量级上下文模型的讽刺/夸张识别模块,规则部分结合标点、特定副词和前后文转折词,模型部分尝试用小型BERT分类器辅助。”
她切换到下一张:“其次是财报和公告中的‘软性表述’量化问题。比如‘面临一定挑战’、‘存在不确定性’、‘保持审慎乐观’,这些表述的程度、方向极为模糊,且与行业惯例、公司历史表述风格强相关。我们打算分两步走:第一,建立行业/公司特定表述语料库,进行相对情绪评分;第二,引入管理层语调分析(如电话会议录音转文本的语速、停顿频率),作为文本情绪的补充和矫正。”
她又展示了几个例子:社交媒体中表情符号与文本情绪的矛盾、同一事件在不同媒体中标题的倾向性差异、以及陈旧新闻被重复抓取带来的“僵尸信号”。
“因此,我们的预处理方案,不是一个线性的清洗管道,而是一个包含多级过滤、交叉验证和不确定性标注的混合系统。”她最后总结,“目标是尽可能透明地暴露文本数据的‘噪声层’,为后续模型提供更‘诚实’的输入,而不是追求单一维度的‘绝对干净’。我们初步称之为‘文本噪声分类与分层处理框架’。”
会议室内安静了片刻。与李哲组令人眼花缭乱的模型相比,刘余的展示显得格外“质朴”,甚至有些琐碎。但其中蕴含的对数据本身复杂性的尊重,以及务实到近乎笨拙的解决思路,让几位真正处理过脏数据的总监露出了思考的神色。
量化部的赵总沉吟道:“思路很实际。特别是对软性表述和语境噪声的关注,确实是现有很多文本因子忽略的。不过,这套方法工程实现复杂度不低,而且对最终因子效果的提升,需要严格评估性价比。”
李哲礼貌地接话:“刘余考虑得很细致。我们模型组会充分参考这些数据层面的洞见,确保输入质量。”话虽如此,他语气中那种“底层问题交给底层处理”的意味依然隐约可辨。
开题会结束。刘余收拾东西时,王磊低声对她说:“讲得不错,问题抓得很准。这些东西,他们搞模型的未必真愿意花时间深究,但很重要。”
“谢谢磊哥。”刘余笑了笑。能得到这位务实前辈的认可,比任何浮夸的表扬都让她感到踏实。
她不知道的是,会议室的单向玻璃观察室后方,那个通常闲置的角落,今天有人。
朱景行并非特意来听这个项目的开题。他刚结束一个跨国电话会议,需要找个安静的地方审阅一份急件。助理临时将他带到了这间有观察室的会议室隔壁。等待文件打印的间隙,他无意中透过单向玻璃,看到了正在进行的会议。
他看到了李哲流畅而前沿的展示,也看到了刘余站起来,用平静的声音阐述那些关于“反讽识别”、“软性表述”和“噪声分层”的具体问题。她的PPT毫无设计感,甚至有些呆板,但内容密度很高,每一页都指向一个真实存在的、棘手的细节。
他的目光在她展示的一个具体例子——某篇充满反语的公司危机公关稿——上停留了几秒。她不仅指出了问题,还给出了结合规则和轻量级模型的具体识别思路。思路不算新颖,但逻辑链条完整,考虑到了可行性和计算成本。
朱景行脸上没有任何表情,只是端起手边已经冷掉的咖啡喝了一口。在他的评估体系里,这又是一次数据点的累积。这个叫刘余的新人,展现出对数据“毛刺”的异常敏感和一种近乎执拗的、想要将其梳理清楚的耐心。这种特质,在追逐宏大模型的潮流中,显得有些“过时”,却又是一种稀缺的、保障系统稳健性的基础品质。