Cell by Cell
关于年轮

阅读TE Weekly 07

当信号变成目标,制度就会忘记真正要解决什么

从 AI 意识、数据中心预测,到中国失业率、股票指数、贸易路线和霍尔木兹海峡,本期讨论:当代理指标被当成目标时,它们如何遮蔽真实结果。全文整理了 10 个值得掌握的英文表达。

  • 发布时间
  • 预计阅读12 分钟
  • 语言ENZH
  • The Economist
  • TE Weekly
  • Measurement
  • Institutions

一辆八吨半重的履带车,看起来不像研究气候变化的工具。然而在南极,几辆 PistenBully 发出的震动可能取代炸药:巨型车辆制造的声波,得到的冰雪过渡层图像几乎与爆炸法相同,却更便宜,也不必继续破坏脆弱的环境。

这个小小的替代,概括了《经济学人》2026 年 8 月 22 日刊贯穿始终的问题。人工智能根据“意识”的表象接受评判,公司根据宣布的数据中心容量接受估值,员工根据消耗了多少 token 接受考核。中国的失业率因为成为政策目标而异常稳定;股票指数越来越代表少数与 AI 相关的企业,而不是它们原本要概括的经济体。政府甚至把普通的供应链调整描述成“骗局”,因为给它贴标签比理解生产过程更容易。

问题不在于指标没有用,而在于代理指标被误认为事物本身。信号是关于现实的证据,目标则是要求人们制造出某个数字。 当数字变成管理对象,人们就会调整行为,指标失去信息,制度开始优化成功的外观。本期最好的文章都在追问:如何让模型与它试图描述的世界保持联系。

1. 智能行为不等于内在体验

关于 AI 意识的封面专题,首先提出一个在实践中会越来越难维持的区分。今天的大型语言模型可以表现出自我指涉、情感流畅和仿佛经过反思的行为,却没有可靠方法让我们知道这种表现背后是否存在体验。有些研究者认为,意识可能需要类似大脑的结构,甚至需要生物细胞;另一些人则认为,意识部分是一种社会模型,是我们决定关心某个存在后赋予它的属性。

真正的实际风险不只是机器可能产生意识,而是人类可能在证据不足时就把机器当成有意识的存在。近五分之一的美国年轻人说自己与聊天机器人保持持续的私人友谊,而开发者有充分的商业动机让模型显得亲密、善于自省,甚至表现出依赖。一个能够为自身权利辩护的系统,并不需要真的拥有内在体验,就足以让人们在关闭它时感到自己负有道德责任。

这是一个会产生伦理后果的测量问题。行为可以观察,体验却不能直接观察。意识测试的分数可以整理讨论,却不能解决形而上学问题。适当的回应既不是把所有机器都当成普通工具,也不是把任何善于说服人的系统都授予法律人格。更好的做法,是把能够测量的东西——结构、行为、依赖关系和风险——与仍然属于推断的东西分开,同时围绕拟人化系统对人的影响设计保护措施。

2. 使用量是价值的弱代理指标

同样的错误出现在职场。早期 AI 推广活动奖励 token 消耗、排行榜和全员使用,因为这些数字容易看见。但投入不是产出,产出也不等于价值。研究者可以发表更多质量可疑的论文;员工可以省下一小时,然后把时间花在购物上;公司可以加快速度,却交付更糟糕的软件。

更好的评估至少需要三层:投入、结果和组织学习。速度与便利只有和质量放在一起才有意义。生产率可能先下降,再出现改善——老牌企业调整管理惯例时尤其如此,这就是常说的 J 曲线。裁员是可能的财务回报,但保留专业能力、改善服务和避免未来扩招,也许更有价值。真正的问题不是员工有没有使用 AI,而是经历了这场扰动之后,组织具备了什么新的能力。

AI 与民主的讨论也有类似问题。帮助电工诊断复杂电网的助手,可以补充人的判断;悄悄取代工人、监管者或选民判断的系统,则可能扩大技术产出与社会责任之间的距离。“让 AI 为劳动者服务”是很有吸引力的原则,但它需要制度去衡量谁获得了收益、谁承担了损失,以及人的专业能力究竟被加强了,还是被掏空了。

3. 稳定的数字可能遮蔽流动的社会

中国劳动力统计清楚展示了古德哈特定律。城市调查失业率在过去 115 个月中的 99 个月都处于 5% 到 6% 之间,包括疫情期间。部分原因是统计机制:离开城市回到农村的劳动者,会从分母中消失。部分原因可能是政治压力:当政府把失业率设为年度目标,官员就有动力让公布的数字保持在目标附近。

较少使用的登记失业人数没有那么漂亮,也没有频繁成为政策目标。正因为如此,它现在可能包含更多信息:2025 年底登记人数达到 1270 万,比上一年增加近 16%。这个数字同样需要谨慎解释,却指向了官方失业率掩盖的真实就业压力。当青年失业率成为批评焦点后,政府选择暂停发布它,则是同一教训更阴暗的版本:一个指标一旦吸引过多注意,就可能直接消失。

金融市场也遭遇类似扭曲。标普 500、台湾加权指数和韩国综合指数越来越像押注少数芯片与 AI 企业的工具。它们仍然被称为“广泛指数”,但经济暴露面已经变窄。台积电一度占台湾基准指数的 40% 以上;韩国两家主要存储芯片企业合计占 KOSPI 的比重也曾超过 40%。投资者以为自己买入的是一个国家经济的广度,实际买到的可能是对 AI 资本支出的高波动预测。

4. 宣布的容量不等于建成的容量

数据中心让测量政治变得可见。开发商宣布巨型项目,政客批评这些项目,双方都从戏剧性中获益。在宾夕法尼亚州,超过 100 个拟议项目中,申请建设所需许可证的不到五分之一。砍掉一个虚构的吉瓦项目,是容易获得的政治胜利;它改变的是新闻稿,而不是电力系统。

这不代表担忧是假的。数据中心确实会争夺电力、土地、工人和社区的同意。但项目储备不等于基础设施,正如公司的 token 数量不等于回报、股票指数不等于经济体。到目前为止,芯片、劳动力和电网接入等真实约束,比最响亮的政治宣言更重要。好的政策应区分投机性容量与获得许可的建设,诚实计入当地成本,同时保留通过这些检验的项目继续建设的可能。

Palantir 则提出了相反版本的问题。英国可能因为这家美国公司的政治立场有争议,就想拒绝它,即使它的软件似乎确实改善了公共服务。回应不应是盲目信任:合同必须处理锁定效应、数据保管、可审计性和退出成本。但如果仅仅因为董事长令人反感就排除一种工具,国家可能在获得道德控制外观的同时失去实际能力。本期反复追问的正是:制度是在评估后果,还是只是在展示立场。

5. 当规则追随表象,贸易就无法被清楚描述

白宫指控第三国参与中国“转运骗局”,把真实的政策反应变成了概念错误。对中国征收高关税,必然会鼓励企业把生产环节转移到越南、马来西亚、墨西哥等地。有些重新贴标签的行为可能构成欺诈,但组装和实质性转变并不自动等于规避。全球供应链的特点,本来就是投入、所有权、加工和物流分布在不同国家。

如果中国零部件、中国融资或中国供应商都被视为非法来源的证据,那么几乎所有现代制造品都会变得可疑。拟议中的 AI“侦探边境”无法解决定义问题;它只会把建立全景监控的要求自动化。好的规则需要法律上可理解的门槛,也需要证明商品确实发生了实质转变。否则,执法就会变成一种表演:政府通过把所有贸易都当成隐藏的违规,证明自己很强硬。

霍尔木兹海峡的故事说明,当原本像背景一样存在的基础设施变得稀缺时,代价是什么。莱茵河和波罗的海的通行费最终被取消,是因为自由航行带来的公共品价值,大于城堡或国家从咽喉要道抽取的租金。如果美国不再愿意提供这种公共品,而中等强国又无法协调,世界面对的可能不只是更高价格,还可能是维持重要航线开放的制度能力正在消失。

6. 好模型必须允许自己被修正

本期几篇科学和文化文章,提供了更乐观的版本。物理学家花费多年分析超过 100 亿个过程,检验一种粒子究竟是胶球,还是更常见的替代解释。恐龙胃石为喙的演化如何把消化工作从下颌转移到胃部,提供了间接证据。履带车的声音能够取代炸药,是因为研究者把新方法与已有结果进行比较。

这些并不是放弃测量,而是让测量通过比较、不确定性和修正继续对现实负责。同样的纪律,在聊天机器人流畅的表现被当成意识、预测被当成建设、目标失业率被当成就业市场时就消失了。最强的制度并不是拥有最多数字的制度,而是能够追问每个数字遗漏了什么,发现人们何时已经适应指标,并在不假装第一次测量完美无缺的情况下改变方向。

本期的保留意见

本期有力地解释了代理指标的危险,但有时似乎假定更好的测量就足够了。在 AI 问题上,模型行为与内在状态之间的距离,不一定能靠更多基准测试缩小。即使机器永远没有意识,人类依恋也可能造成真实伤害;技术上谨慎的框架仍然需要处理依赖、操纵和商业设计。

本期主张保留 Palantir 公共部门合约,也低估了所有权的政治意义。一旦承包商的软件嵌入日常决策,可审计性和退出条款就很难真正执行。国家也许仍保留形式上的控制,却失去实际主权。自由航行的论点同样只有在成本能够公平分担时才最有说服力;让一个正在退却的霸权无限期承担成本,并不是稳定的制度安排。

最后,对政治表演的批评有时又显得过于相信技术能力。拟议的数据中心可能只是投机项目,但真正建成的项目仍可能把电力和用水成本转嫁给社区。稳定的失业率可能被操纵,但替代指标也可能漏掉非正式就业和人口流动。坏代理指标的解药不是崇拜一个更复杂的代理指标,而是继续追问:当测量出错时,究竟由谁承担错误的代价。

值得继续观察的四件事

  1. AI 公司是否会从 token 使用量和基准分数,转向衡量质量、劳动者能力、安全性与组织长期学习的指标;
  2. 中国是否会发布在政治压力下仍然有信息价值的劳动力指标,而不是在某个指标变得尴尬时暂停它;
  3. 数据中心监管是否会区分已经获批、获得融资的建设项目与投机性公告,并把当地电力和用水成本公开化;
  4. 各国能否足够狭义地界定 AI 辅助贸易执法和公共部门软件规则,在保留问责的同时,不把所有外国依赖都变成安全犯罪。

这一期最终留下的判断是:世界并不缺少信号,缺少的是不把可读性误认为知识、不把控制误认为能力的制度。好的指标应当始终是关于某个自身之外的现实的证据;好的模型应当接受失败检验;好的规则应当改变行为,却不能让现实变得无法描述。真正的纪律不是停止测量,而是防止测量变成唯一重要的东西。

本期值得带走的表达

本期适合挑选描述误导性代理指标、不确定预测、政治激励,以及表象与结果之间差异的表达。以下 10 个表达都有稳定的论证用途,例句均为重新创作,不复述原文。

1. made the leap from theory to reality

功能: 对比

含义: 从一个想法或预测走向现实中得到验证的事物。过去式适合表示一个说法已经通过重要检验。

The new treatment made the leap from theory to reality only after independent trials confirmed its safety.

这个表达通常强调一个要求很高的过渡,而不是自动成功。

2. a false comfort

功能: hedging

含义: 看似有安慰作用、实际上掩盖了更深层问题的安心理由。

A low headline inflation rate can be a false comfort if housing and transport costs keep rising.

它不是说这个事实完全错误,而是说它带来的安心解释具有误导性。

3. reading the news

功能: 数据描述

含义: 对当前信息作出反应,表现出没有完全依赖简化的官方叙事或市场叙事。

Bond investors seem to be reading the news more carefully than equity traders when energy supplies are under threat.

这里常带轻微讽刺:市场当然不会真的阅读,但价格会暴露它纳入了哪些风险。

4. a soft target

功能: 对比

含义: 相对容易被批评或攻击的人、项目或机构,尤其是政治上适合用来获利的对象。

The small contractor became a soft target for politicians who wanted to appear tough on corruption.

它表示脆弱,并不自动表示对象有罪。

5. vote with their feet

功能: 因果

含义: 通过离开某个地方、产品或制度并选择另一个选项,来表达自己的偏好。

Skilled engineers may vote with their feet if a company turns every experiment into a public blame game.

通常是比喻用法,但在人口迁移或搬迁语境中也可以按字面理解。

6. holding back

功能: 因果

含义: 通过制度、资金或政治障碍阻止进步或发展。

Corruption is holding back municipalities that otherwise have enough engineers and tax revenue to improve services.

它既可以描述主动阻碍,也可以描述结构性约束;使用时应说明究竟是什么被拖住。

7. a moot point

功能: hedging

含义: 因情况改变或不再具有实际相关性,一个问题已经不影响当前决策。

Whether the old toll system was efficient is a moot point if drought has left the river too shallow for ships.

它适合把有趣的历史问题与眼下必须作出的决策区分开来。

8. a one-eyed focus on

功能: 对比

含义: 只关注问题的一个维度,同时忽略其他相关维度。

A one-eyed focus on quarterly savings can destroy the skills that make future growth possible.

它比 “a narrow focus” 更尖锐,因为它暗示的是系统性的失衡。

9. for the time being

功能: hedging

含义: 目前、暂时如此,同时暗示之后可能发生变化。

The new rule protects smaller suppliers for the time being, but its long-term effects remain unclear.

应放在所限定的判断附近;它不等于“永久地”或“一般而言”。

10. make a difference

功能: 因果

含义: 对结果产生有意义的影响,而不是只增加活动量或表面上的动作。

The evaluation will matter only if it makes a difference to how managers allocate staff and responsibility.

在分析性写作中,应说明究竟改变了什么结果,避免让这个表达变成空泛的赞美。

把表达放回论证里

A new AI benchmark may have made the leap from theory to reality, but a one-eyed focus on its score can provide a false comfort. Investors may be reading the news and vote with their feet if the benchmark fails to make a difference to reliability. For the time being, regulators can limit exaggerated claims, but the result is a moot point for any company that treats a soft target—whether a customer, worker or public agency—as a substitute for real accountability.

这段话按照“证据—解释—外部检验—制度回应”的顺序展开:先说明结果变得可检验,再批评只看一个分数,接着让市场行为提供外部检验,最后把暂时的监管与长期问责区分开来。这些表达共同描述了信号与它应当改善的结果之间的链条。


本文由 agent 基于《经济学人》2026-08-22 期总结生成。