机器之心发布
在社会变化的洪流中,LLM 能不能不断修正自己对社会的认知?
伊利诺伊大学厄巴纳 - 香槟分校(UIUC)的研究者在名为 Social World Model(ICML 2026:https://arxiv.org/abs/2606.11482)的框架中提出并初步探讨了这一问题。他们以Polymarket 和 Kalshi 等预测市场为天然检验场,观察当突发新闻降临时,市场参与者的信念将如何发生偏移。
但这只是第一步。UIUC 联合来自清华的初创团队 Astraculum 决定发起一项更硬核的挑战并获得了一些初步结果:LLM 的认知更新,能否不仅停留在 “训练时(Train-time)” 阶段,而是真正延伸到 “部署(Deployment-time)” 阶段?
换句话说,当 LLM 被置于持续流动的市场数据与实时新闻中,它能否根据不断到来的真实反馈持续学习,让今天经历过的市场变化,真正改变它明天的判断?为了验证这一点,联合团队在长达 390 天的真实数据上进行了滚动训练与持续回测。结果证明了 “持续进化” 的力量:这个在部署后依然不断更新权重的 Model,在同等测试环境下,一举击败了 GPT-5.6、DeepSeek V4 Pro 以及 Claude Opus 5 等一众前沿模型。
什么是 Social World Model?
如果物理世界模型(Physical World Model)能根据物体的 “当前状态(如速度和位置)” 预测它受力后的轨迹;那么当突发新闻降临时,AI 能不能预测人类社会的集体认知会发生怎样的转移?这就是 Social World Model (SWM) 试图解决的问题。
为了量化 “社会认知”,SWM 将目光投向了 Polymarket 和 Kalshi 等预测市场。这是因为预测市场只围绕尚无定论的问题形成,参与者广泛多样,无数普通人真金白银的押注,能最敏锐地反映大众 “集体信念” 的移动,比问卷和社交媒体都更可靠。
在这个框架下,“社会认知如何更新” 被完美映射成了世界模型中最经典的状态转移(State Transition)。以 “美联储九月是否降息” 为例:
- 状态(State)即 信念(Belief): 也就是大众当前的集体预判与近期走势。比如合约卖 62 美分,意味着大众用钱投票得出了 “62% 的概率”,这就是当前社会系统的信念。
- 事件(Event): 真实世界刚刚发生的一条突发新闻。它相当于打破现有状态的输入(Input / Action)。
模型的目标不是去预测美联储到底降不降息,而是预测大众在特定情形下的反应:在当前的状态下,刚发生的新闻会将大众的信念改变多少?换句话说,它学习的是:当前信念 + 突发事件 → 下一时刻的信念。
如何在真实世界中部署 Social World Model?
为了把 Social World Model 从离线实验推向真实环境,研究团队让 SWM 直接接入实时新闻源和预测市场盘口。具体来说,在每一个预测时刻,LLM 都可以看到此前的市场状态以及刚刚出现的新闻,然后判断接下来市场的集体信念会朝哪个方向移动。
比如,在 2026 年 2 月 13 日下午 2 点的一条样本中,市场正在预测 “标普 500 是否会触及 6000 点”,当时合约价格为 0.525。此时,Agent 可以看到过去 24 小时的价格走势,同时读取过去一小时内刚刚发布的新闻。它需要在下一小时结果真正发生之前判断这些新信息里,有没有尚未被市场价格充分反映的内容?如果有,它会把市场信念推向哪里?

如果模型参数始终被冻结,那么它今天从市场中看到的经验,并不会自动成为明天模型能力的一部分:每一次预测都由同一个模型作答,上一次的对错与下一次无关。真正的长期部署因此带来了下一层问题:模型能否把部署过程中不断获得的真实反馈重新写回参数,让过去的经历持续改变未来的判断?
如何让 Social World Model 在部署中持续学习?
现实世界中的社会认知和市场逻辑并不是静止的。新闻的重要性会变化,市场参与者的反应模式会变化,宏观环境也会变化。这种变化不由我们安排,也不会提前通知:模型自己不会报告它已经跟不上了。一个参数冻结在某个时间点的模型,很难保证能适应之后潜在的变化。因此,对于 Social World Model 来说,持续学习(Continual Learning)并不仅仅是一种训练技巧,而是长期部署中必须具备的能力。
那么,每小时到来的市场反馈,该让模型学什么?面对预测市场的涨跌,最直觉的做法是让模型直接根据 “价差” 来修正权重。但这会掉入噪声的陷阱。对于突发新闻引发的市场剧变,数字只是一种表象。它告诉模型的是:“市场最后动了多少。” 却没有直接告诉模型:“哪些新闻真正重要?”“为什么这条新闻会改变市场参与者的判断?”“市场究竟是在更新哪一种对世界的理解?” 因此,更可靠的路径是:跳过单纯的数值拟合,直接让模型去学习 “新闻事件” 与 “信念变动” 之间的逻辑推理过程。
引入 SDFT 机制:利用 “特权信息” 指导推理
为此,团队采用了类SDFT(Self-Distillation Enables Continual Learning,https://arxiv.org/abs/2601.19897)的方法来进行推理过程的自蒸馏。这套机制巧妙地利用了 Hindsight 的 “特权信息(Privileged Context)” 来构建师生闭环。特权信息只用来教,不用来答:预测永远由没看过结果的学生独立完成。
具体而言,当一小时后的真实市场结果揭晓时,系统首先会让模型根据真实变化写出一段事后推演。随后,同一个模型在训练中被分为 “老师” 和 “学生” 两角:
- 老师: 同一个模型,只是上下文里多了这段事后推演(demonstration),作为特权信息(Privileged Context)。它不另外作答,而是用这份上下文给学生的推理逐 Token 打分。
- 学生: 只能看到当前的新闻和价格,没有任何特权信息的辅助,必须进行直接预测。
在蒸馏阶段,老师逐 Token 地给学生的推理打分,把学生拉向看过结果之后的判断:学生还在说 “继续稳定”,老师已经压向 “正式延期”。这样刻进参数的是 “客观事件 →大众情绪→市场动作” 这条链,而不是某一次的价格数字。

Social World Model 持续学习的效果
为了验证这套机制的实效,团队选取了长达 390 天的真实市场数据,并按月切分为多个窗口。模型在每个月的数据上进行自蒸馏迭代与滚动部署。也就是说,整个实验严格按照时间向前滚动:部署 → 获得真实反馈 → 训练 → 更新模型 → 继续部署。
部署表现:持续学习让 7B 模型跑赢前沿模型 面对真实的资讯洪流,GPT-5.6、DeepSeek V4 Pro 等静态大模型全部跌穿了只看价格、不看新闻的基线。而通过持续自蒸馏的 7B 模型,是全场唯一比价格基线预测得更准的。

制胜关键:跨越周期的稳定性 将全年数据按月拆分后可以看出,性能的提升本质上来源于稳定:静态大模型在遇到特定月份(如 w01、w11)的变动时会集体大幅失分,而 7B 模型十二个月里没有一个月大幅失守。

更新有没有让模型变坏实验也做了检查:每一轮训练后都冻结一份副本作为对照,并在无关任务上探针;十二轮下来,模型的推理长度和质量没有退化。
Social World Model 背后的基础设施
LLM 在预测市场的部署只是冰山一角。 任何想让大模型跳出实验室、在真实世界的动态数据中实现持续学习的团队,都会不可避免地撞上三堵工程高墙:
- 判断时什么是可知的?在模型下判断的那一刻,如何确保它只能看到 “当下” 的数据,绝对不会提前偷看到可能泄漏的未来?
- 结果什么时候变得可知?现实世界的反馈往往是碎片化且延迟的。系统必须精确判定,到底要在哪个时间点把 “真实结果” 收集回来,作为给模型对答案的最终标准。
- 更新到底有没有帮助?模型不断在吸收新数据修改自己的参数,如何确信它是在变得更聪明,而不是发生了灾难性遗忘,或者只是在死记硬背?
为了把这套逻辑跑通,研究团队搭建了TrajOps:一个专为持续学习设计的标准化 MLOps 引擎。从工程落地的角度来看,TrajOps 的核心其实非常务实且简洁:它向上层提供了三个接口:Collect(收集)、Inference(推理)、Train(训练),并直接在底层工作流中适配了标准的 SDFT(Self-Distillation Fine-Tuning,自蒸馏微调)方案。
整个循环在这个引擎上被清晰地串联了起来:
- Collect 接口负责在事件落定前后,把新闻数据和姗姗来迟的真实市场结果精准抓取回来;
- Inference 接口负责管理时间视野和持续部署模型;
- Train 接口则直接调用内置的 SDFT 方案,将抓取回来的结果编译成训练信号,驱动模型权重更新。
目前,这个 7B 模型依然依托于这套 Infra 在真实市场中持续判断,每天写下实盘记录,公开在 trajops.astraculum.com。
以下为这项研究的作者及机构:
- Haofei Yu、Yining Zhao、Jiaxuan You(伊利诺伊大学厄巴纳 - 香槟分校);
- Chishang Yang、Junbo Yan、Senquan Gao(Astraculum)