预测市场的准确性,就像一份优秀的天气预报:不可能总是对,但其命中率大致和自己宣称的一样。被定价为70%的事件,实际发生的概率大约也是70%;而且这类市场在多数情况下比民调更准。Polymarket 的市场曾录得约0.09的 Brier 分数,这是一种衡量预测误差的指标,其中0代表完美,而0.25则相当于把每个问题都当成抛硬币。
那么,预测市场到底准不准?坦率的答案有两面。总体上、放在大量问题上看,证据表明答案是“是”,而且这一点已经被验证了几十年。可在单个问题上,市场也会犯众所周知的错误,其中一些还是系统性的:它们会高估冷门结果,容易被薄弱盘口和党派资金推动,而且离最终结算越远,可靠性就越差。
本指南将介绍概率的准确性意味着什么、如何衡量、来自选举及其他领域的证据、市场为何通常有效、何时失灵,以及如何合理使用它们的价格。
| 证据 | 说明 |
|---|---|
| Iowa Electronic Markets,1988–2004 | 市场价格比所比较的 964 份民调中的 74% 更接近最终结果 |
| Polymarket 的 Brier 分数 | 约 0.09,远低于抛硬币预测者的 0.25 |
| 偏爱热门-冷门偏差 | 在投注和预测市场中,冷门被高估 |
| 2016 年美国大选和 Brexit | 市场看好最终落败的一方 |
| 2022 年美国中期选举 | 市场高估了共和党的增益 |
| 2024 年美国大选 | 市场看好获胜者,而民调显示胜负难分 |
“准确”对概率而言是什么意思
单个概率本身不能简单地说对或错。如果市场把某位候选人定价为70%,而这位候选人最终落败,那其实正是十次里应该发生三次的情况。衡量预测者的标准,不是其支持对象是否总赢,而是其概率是否能在大量问题上与现实相符。
这种性质叫作校准。一个校准良好的预测者,其70%的判断大约有70%会成真,20%的判断大约有20%会成真,以此类推。另一个同样重要的性质是分辨力,有时也叫锐度:如果一个预测者对所有事情都给出50%,它是完全校准的,但毫无用处。好的预测既要校准,也要在证据支持时敢于给出高置信度概率。
这种框架决定了你该如何解读单一价格。当市场押中的对象最终落败时,市场未必错了;但如果它一而再、再而三地朝同一方向出错,那就是错了。我们关于预测市场赔率的解读,说明了价格如何首先转化为概率。
如何衡量准确性:Brier分数与校准
标准指标是 Brier 分数:预测概率与结果之间平方差的平均值,其中结果发生记为1,未发生记为0。对某件事给出0.9的预测,而它真的发生了,得分是(1 − 0.9)²,也就是0.01;如果它没发生,则得分是0.81。对很多问题求平均后,分数越低越好。
一个简单的对比就能看出,这个分数为什么同时奖励校准和置信度。预测者A对10个事件都给出80%,其中8个发生;A的平均 Brier 分数是0.16。预测者B对同样10个事件都给出50%;B的分数是0.25,尽管它从未“错过”。A得分更好,是因为A给出的概率与结果相符。我们的预测市场术语表对 Brier 分数、校准以及这里用到的其他术语做了定义。
作为参考,对每个二元问题都说50%的预测者,其得分是0.25。Polymarket 的市场曾录得约0.09的分数,这相当强——通常会被描述为“大约94%准确”,但这种简化说法掩盖了很多内容。分数高度依赖问题构成:如果市场里充满几乎确定的结果,分数自然容易很好;但面对真正不确定的事件,就做不到。
校准图更直观。把每个预测按概率分组,再看每组里的事件实际发生了多少次。对一个校准良好的市场而言,这些点会沿着对角线排列。大多数对大型预测市场的公开分析都显示,中间区间的校准表现不错,但在极端位置存在持续扭曲,这就是下面要讲的“最喜欢者—冷门”偏差。
来自选举市场的证据
最久的记录来自爱荷华电子市场(Iowa Electronic Markets),该市场自1988年以来由爱荷华大学运营,采用小额真钱下注。对其前12年选举市场的一项研究发现,其价格比与之对照的964份民调中的74%更接近最终结果。这一发现开启了大量关于预测市场的学术兴趣,我们关于预测市场如何演变的历史文章梳理了后续发展。
现代记录则更为复杂。2016年,预测市场把希拉里·克林顿定为明显热门;同一年英国脱欧公投中,投注市场也强烈看好留欧。两者都错了。2022年中期选举中,市场定价共和党会迎来红色浪潮,但最终只是涟漪,民主党保住了参议院。2024年,市场给唐纳德·特朗普的胜率高于多数民调平均值;后者显示接近五五开,而特朗普最终获胜。
这四个案例都很引人注目,但数量太少,不能用来判断校准。它们说明的是,市场不是水晶球:它整合了和民调、模型类似的信息,而这些信息有时本身就是错的。如今的2026年中期选举赔率应结合这段历史来看,我们的2026年中期选举交易指南也讨论了这些市场的表现。
市场为何往往准确
有三种机制在起作用。第一是激励。认为价格错了的交易者可以通过纠正它获利,因此掌握好信息的人有动力通过交易把信息释放出来,而信息差的人会亏钱,交易也会减少。第二是聚合。市场价格汇总了所有交易者的看法,并按他们愿意承担的风险大小加权,这往往能抵消个体错误。经济学家弗里德里希·哈耶克在1945年提出,价格是一种汇聚任何单个人都不拥有的知识的方式,而预测市场则是把这一思想应用到问题上,而不是商品上。
第三是套利。当两个市场对同一事件给出不同价格时,交易者会通过买入便宜的一边、卖出昂贵的一边获利,直到价差收敛。这会把价格拉向单一共识。PredictReport 的跟踪清楚显示了这一点:在2026年9月21日,Polymarket 和 Kalshi 对众议院由民主党控制的定价分别为91.5¢和91.3–91.5¢——这是两个独立盘口,用户不同、货币不同,但价差只有半美分。我们的套利扫描器显示了这一过程在剩余价差中仍在何处发挥作用。
维多利亚时代的科学家弗朗西斯·高尔顿曾在乡村集市上做过一次早期演示:让人群猜一头牛的体重,结果中位估计与真实值相差约1%。市场则通过让人们用真钱为自己的判断背书,把这一机制进一步精炼。
市场会在哪些地方出错
冷门结果被高估。 在赛马、体育博彩和预测市场中,针对不太可能结果的合约,交易价格往往高于其真实概率。一个定价为3¢的合约,通常实际赢面的确低于3%。研究者认为,这种模式源于人们对小概率的过度权重,以及对“彩票式”回报的偏好。我们的期望值指南解释了为什么这会让便宜合约成为糟糕的默认选择。
薄弱盘口会产生虚假价格。 交易很少的市场,可能被一笔单独订单推动。PredictReport 的跟踪记录过一笔 Polymarket 交易,将达克·普雷斯科特赢得 NFL MVP 的几率推到13.1¢,而 Kalshi 的中位价格是6.5¢;还记录过“拯救儿童”在诺贝尔和平奖市场中的报价达到31.4¢,而 Kalshi 上只有12¢。两者后来都反转了。我们的NFL MVP赔率和诺贝尔和平奖赔率介绍了这些事件,我们关于预测市场流动性的指南则解释了如何识别没有人真正支撑的价格。
群体也有偏见。 选举市场吸引政治参与度高的交易者,体育市场则吸引球迷。对某位候选人或某支球队的热情,可能让价格高于公允价值,尤其是在较小的市场中。这也是为什么,在两个用户群不同的平台上都能对得上的价格,通常比单一平台上的价格更可信。
长周期会增加噪音。 距离结算还有两年的市场,可供聚合的信息很少,其价格更接近有根据的猜测,而不是预测。我们的2028年民主党总统候选人赔率显示,一位领先者只有18%,这说明市场知道自己并不知道。
有人会试图推动价格。 2012年,据报道,一名在现已关闭的 Intrade 上交易的人曾大举买入,推高米特·罗姆尼的价格;市场也曾受到掌握内部信息者的针对——2025年诺贝尔和平奖市场在公布前不久,从不足4%跃升到超过70%,押中了最终获奖者,后来诺贝尔研究所将此归因于可能的网络攻击。我们对预测市场内幕交易监管的分析讨论了这一问题。
问题本身可能有歧义。 一个市场之所以会被说成“错了”,可能只是因为其规则最终的结算方式和交易者预期不同。我们关于预测市场如何结算的解读,详细说明了决定合约结果的规则。
越接近结算,准确性越高
市场的准确性在很大程度上取决于离答案还有多远。越接近结算,价格反映的几乎就是所有可知信息,校准通常也最好。离结算越远,可供聚合的信息越少,价格就越依赖基准概率、叙事和当前交易者的偏好。
这就是为什么同一个市场在某一时点表现很好,而在另一个时点可能很弱。2028年共和党提名市场把 J.D. Vance 的概率定在约51%,而历史也支持在任副总统的机会——我们的2028年共和党提名人赔率对此基准概率有详细说明。但两年时间足够发生许多尚未被定价的事件,因此这么远的概率应被视为今天的最佳估计,而不是对2028年的预言。
市场 vs 民调 vs 模型
民调衡量的是样本人群说自己会怎么做。统计模型把民调与其他数据结合起来,比如经济状况和历史结果。市场则把这些信息以及交易者知道或相信的其他内容一起整合,并用资金表达出来。
实际上,这三者与其说是竞争对手,不如说是不同层次。市场会密切关注民调和模型,大型民调或模型更新通常会在几分钟内推动价格变化。市场的价值在于速度、纳入民调之外的信息,以及把不确定性表达成一个可交易的数字。它们失去价值的时候,是因为交易者共有的假设错了,就像2016年和2022年那样。理性的读者会把三者都当作输入,并在它们出现分歧时格外留意。
体育博彩提供了一个有用的比较。博彩公司临场赔率——即比赛开始前的最终价格——被广泛认为是任何市场中最有效的预测之一,因为尖锐交易者会整周不断修正它。针对同样比赛的预测市场往往会收敛到相近的概率,而且没有博彩公司抽水。我们关于预测市场与体育博彩的对比,说明了两者的结构性差异,包括为什么交易所不会限制赢利客户。
如何正确使用市场概率
把流动性好的市场价格当作强基准,而不是最终裁决。如果你不同意它,先问问自己知道什么而交易者不知道;大多数时候,诚实的答案是什么也没有。这种纪律是避免在预测市场亏钱的最好保护,我们关于如何在预测市场赚钱的指南就是从这一点出发的。
在相信任何价格之前,先检查深度和跨平台一致性。一个同时在 Polymarket 和 Kalshi 上都能站住、且有真实成交量的数字,远比安静盘口上的单笔成交更值得重视。Polymarket vs Kalshi解释了为什么这两个平台在发生分歧时会拉开差距。
要给冷门结果和超长期价格打折。
两年后发生、且定价为3¢的合约,是预测市场中最不可靠的价格:它同时叠加了上面提到的“最喜欢者—冷门”偏差和长周期噪音。应把它视为“结果有可能发生”的粗略 संकेत,而不是经过测量的概率。
如果你交易,要跟踪自己的校准:记录你交易时相信的概率,然后在30次或更多交易后与结果对比。这是判断自己是否比市场更强的唯一可靠方法。只要一个电子表格就够了,我们关于免费预测市场工具的汇总介绍了一种简单的记录格式,可以让校准检查变得直观。这个练习对大多数人来说都会让人谦逊,但这正是它值得做的原因,尤其是在加大仓位之前。大多数交易者都会发现,自己最有把握的判断往往过度自信,而知道这一点,比任何一笔单独的盈利交易都更有价值。关于这一切背后的机制,见预测市场如何运作;如果你想选择平台,则可参考我们对最佳预测市场应用的排名。
常见问题
预测市场有多准确?
平均而言是准确的。Polymarket 的市场曾录得约0.09的 Brier 分数,而爱荷华电子市场在1988–2004年间的表现优于它们所比较的74%民调。单个市场仍会出错,而且冷门结果会被系统性高估。
预测市场比民调更准确吗?
通常更准确,但并非总是如此。市场会把民调和其他信息一并纳入,而且通常反应更快。它们在2016年和2022年失手,而在2024年则比多数民调平均值表现更好。
什么是 Brier 分数?
它是预测概率与结果之间平方差的平均值,其中0是完美,0.25相当于一个对所有问题都给出50%的人。分数越低越好。
什么是最喜欢者—冷门偏差?
这是指在博彩和预测市场中,不太可能发生的结果往往被高估的倾向。一个定价为3¢的合约,实际赢面通常低于3%。见我们的期望值指南。
预测市场对2024年大选判断对了吗?
它们看好唐纳德·特朗普,而多数民调平均值显示接近五五开,最终特朗普获胜。但一场选举不足以判断市场的校准性。
预测市场会被操纵吗?
价格可能被大额订单推动,尤其是在薄弱市场中;市场也可能被掌握内部信息的人针对。套利和更深的盘口会限制虚假价格持续的时间。见我们对预测市场内幕交易的分析。
为什么预测市场有时会把选举判断错?
因为它们整合的信息与民调和模型相同,而当这些信息系统性地出错时——就像2016年那样——市场也会跟着错。70%的热门选项也意味着它有十次里会输三次。
我该如何使用预测市场赔率?
把它当作来自流动性市场的基准概率,并用另一个平台交叉验证。给冷门结果和长期价格打折,同时跟踪你自己的预测,看你是否能跑赢市场。



