featured

引子:Homo numerus,被计分的人

上一篇《知识—权力—自我》拆的是概念史:现代社会用一套话语,把结构性问题翻译成个人品质问题——你要主动成为更好的自己。

这一篇拆物质史。

因为光有概念是不够的。一句"你应该自我提升"之所以能落地,靠的不是说辞,而是一台台具体的测量装置:问卷、量表、档案、分数、算法。概念负责让你内疚,装置负责让你被追踪。

回头看现代史,每隔几十年就出现一种新的测量装置,宣称"科学地"评估人的某个维度:

  • 1905 年,一道测试题,量化你的智力;
  • 1911 年,一只秒表,量化你的劳动;
  • 1920 年代,一张问卷,量化你的性格;
  • 1950 年代,一本诊断手册,定义你的正常;
  • 1958 年,一个三位数,量化你的信用;
  • 1980 年代,一张排名表,量化你的价值;
  • 2010 年代,一套算法,持续量化你的一切。

每一次技术迭代,命题都往前推一步:从"测量你"到"定义你",再到"预测你",最后是"你不必再自我辩护、系统说了算"。

下面的八个案例,每一个都遵循同一个四段结构:发明的初衷 → 被权力接管 → 制度后果 → 内化成自我。这不是偶然的重复,这是"知识—权力"最标准的运作模板。

案例一:智商测验——一门为救人设计的工具,如何变成优生学的刑具

初衷是善良的。

1904 年,法国公共教育部委托心理学家**阿尔弗雷德·比奈(Alfred Binet)**解决一个实际问题:哪些孩子在学校跟不上、需要额外的补习帮助?比奈和西蒙设计了一套简单的题目——记忆、注意、命名、推理——用来区分"需要帮助的孩子"和"只是懒惰或叛逆的孩子"。

请注意比奈的三条自我限制:

  1. 他反复强调,测验分数不能被当作固定的智力标签;
  2. 他认为智力是可以被训练改善的;
  3. 他明确反对把这套工具用于筛选和排序。

比奈说,用他的量表去给正常儿童排出智力名次,是"一种荒谬的做法"。

然后是接管。

比奈 1911 年去世。他的量表漂洋过海到美国,落进了斯坦福大学的刘易斯·特曼(Lewis Terman)手里。特曼做的事,比奈生前最反对:他把量表标准化、规模化、并用于排序——1916 年推出斯坦福-比奈量表,“智商(IQ)“这个数字从此诞生。

一场更大规模的接管随即展开。1917 年美国参加一战,军队需要快速给一百七十多万新兵分类、分岗——于是开发了陆军甲种/乙种测验(Army Alpha/Beta)。这是人类第一次在如此大的规模上,用纸笔测量题给整整一代成年人打分。

结果被拿去做了最坏的事:

  • 普林斯顿的**卡尔·布里格姆(Carl Brigham)**用这批数据写了《美国智力研究》(1923),宣称来自东南欧的新移民"智力遗传低下”——因为他们的平均分数低;
  • 这套数据直接影响了1924 年《移民法》(Johnson-Reed Act),为限制南欧、东欧移民配额提供了"科学依据”;
  • 后来布里格姆自己也公开撤回了这个结论——因为测试的唯一共同点是语言隔阂和识字程度,考查的是英语能力,不是所谓的天生智力。

最经典的反转来自特曼自己的实验。他和助手做了一次当时被认为最可靠的“天才儿童"预测:

特曼用斯坦福-比奈量表在全加州筛出约一千五百名 IQ 在 140 以上的孩子(日后被称为"特曼的虫子们”),追踪了他们一生,想证明高智商必然带来高成就。

特曼在筛选阶段,把两个被测出"不够天才"的孩子筛掉了——一个叫威廉·肖克利(William Shockley),一个叫路易斯·阿尔瓦雷斯(Luis Alvarez)。前者后来发明了晶体管、创办仙童半导体、拿了诺贝尔物理学奖;后者因发展氢气泡室技术获诺贝尔物理学奖。

特曼系统唯一漏掉的两个诺奖得主,恰恰是它亲手排除的人。

后来史蒂芬·杰伊·古尔德在《人的误测》(The Mismeasure of Man, 1981)里系统清算了这段历史:鼓捣"脑容量决定智力"的颅相学、伪造数据的莫顿、以及所有把 IQ 当"人生基因"的推论。

四段式完成:工具为救人而生 → 被用来排序、分岗、筛选移民、服务优生学 → 直接推动了限制移民的立法和大规模的智力歧视 → 最后内化:一个"我读书差是天生智力不行"的信念,从此压在无数人身上。

反测量提问:当有人给你一个分数,先问——**它是为了帮你,还是为了筛你?**同一道题,目的不同,工具的性质就完全不同。

案例二:优生法——当"科学"变成法律,谁被允许生孩子

测量的下一步,是把结论写进法律。

1927 年,美国最高法院审理了巴克诉贝尔案(Buck v. Bell)。被告是弗吉尼亚州 17 岁的女孩卡丽·巴克(Carrie Buck),州政府认定她"低能",要对她实施强制绝育。所谓"证据",是她母亲在多年前被一次智力测验判定为"弱智",而卡丽本人也得了一个低分。

判决由大法官奥利弗·温德尔·霍姆斯写下,那句判词后来臭名昭著:

“三代低能,已经够了。"(Three generations of imbeciles are enough.)

这是"测量 → 分类 → 判决"链条最赤裸的形态:一个纸笔分数,被升级成对一个人生育权的法律剥夺。

那么"低能"是怎么被测出来的?弗吉尼亚州给卡丽做的测验,是由一名社工主持的、没有任何标准化条件的口头提问。而所谓的"家族遗传证据”,来自一段没被核实的家族传闻。

四段式在卡丽身上走完:

  • 制度后果:到 1970 年代,美国有约 六万名被判定"低能"的人,在三十多个州被强制绝育。这个数字后来被反复更正,但规模量级无争议。这个模式被直接借鉴——纳粹德国 1933 年的《防止遗传病后代法》,在起草时明确引用了美国的优生法,并在"效果"上走得更远。
  • 迟到的反转:卡丽·巴克本人其实是被收养家庭(因为她被养父家的侄子性侵后怀孕,家族为了掩盖丑闻把她送进了"低能收容所")送进去的。她妹妹多丽丝后来又"因为同样的理由"被绝育。研究者后来查证,卡丽和妹妹的智商都在正常范围内。案件在 2024 年才被弗吉尼亚州政府正式"否定",州长公开道歉——距离判决已经过去 97 年。
  • 内化:真正被剥夺的不只是生育权,而是"我这个人不配延续"这种自我认知——它悄无声息地进入一代人的自我评价。

反测量提问:一个分类一旦获得法律或制度的强制力,它就再也不是"观点",而是暴力。所以看到一个分类时,先看它有没有强制力。

案例三:统计学的双面——凯特勒的"平均人"

进入社会层面。19 世纪比利时数学家**阿道夫·凯特勒(Adolphe Quetelet)**做了两件事,塑造了今天所有人的自我认知:

  1. 他把概率论系统地用到社会数据上(出生、死亡、犯罪、身高),发明了"社会物理学";
  2. 他提出了一个概念:“平均人”(l’homme moyen)——一个国家里"典型的人"是什么样:平均身高、平均体重、平均犯罪倾向。

凯特勒的初衷是善意的:他想用数学找到社会规律,从而改良社会(减少贫穷、犯罪)。他本人反对用统计去否定个体。

但"平均人"一旦成立,“偏离平均"就被自动定义为异常:

  • 身高低于平均 → 体质弱;
  • 收入低于平均 → 阶层低;
  • 体重高于平均 → 需要被"管理”(这正是今天 BMI 指数和整个健康管理工业的源头思想)。

统计学的系统性问题在于:它描述分布,却被用来评价个体。分布上的"偏低"本身没有任何道德含义——但一旦社会开始按分布分配机会,落在低分位就成了一项罪名。

内化:你今天看到"人均"、“中位数”、“同龄人平均水平”(从存款到阅读量到伴侣数量)时感到的那一下心慌,就是凯特勒的回声。统计学的涌现让整个人类社会第一次有了一个"标准人"的幻影,而所有人都在拿自己跟这个幻影比。

反测量提问:**这是关于我的描述,还是关于一个群体的描述?**群体统计可以预测一堆人,但不能决定任何一个人。

案例四:泰勒的秒表——劳动是怎么被切碎的

1898 年,美国伯利恒钢铁公司。工程师**弗雷德里克·泰勒(Frederick Winslow Taylor)带着一只秒表,站在生铁搬运工施密特(Schmidt)**面前计时。

泰勒选的这块场地很有名:他付给施密特比市场价更高的日薪(1.85 美元 vs 1.15 美元),然后精确规定他该怎么站、怎么搬、什么时候休息——最终把搬运效率提高了近四倍。

1911 年,泰勒出版《科学管理原理》,把一整套方法写了出来:

  • 把工作拆解成最小可测量单元;
  • 用秒表给每个单元定"标准时间";
  • 按标准时间设定计件工资——达不到就没有工资;
  • 管理层垄断"关于工作的知识"。

同一时代的另一条线是效率工程师合作者——吉尔布雷斯夫妇(Frank & Lillian Gilbreth),他们研究动作研究(motion study),把砌砖动作从每块砖 18 个动作优化到 5 个,并给工人配了能减少弯腰的脚手架。他们家的故事后来被写成畅销书《一打更便宜》(Cheaper by the Dozen, 1948)。

制度后果:

  • 1913 年福特建成第一条移动装配线,把底盘装配时间从 12.5 小时压缩到 93 分钟;代价是工人流失率一度高达每年 370%(后来福特被迫把日薪翻倍到 5 美元才稳住);
  • “标准工时”、“计件”、“KPI”、“考核”——整个现代劳动力管理体系从这只秒表长出来;
  • 卓别林 1936 年拍《摩登时代》(Modern Times),“喂饭机"和流水线上疯狂拧螺丝的桥段,就是对这套体系的票房级证词。

内化:今天你感到的"我必须一直在产出点什么,闲着就是浪费”,是秒表被搬进了大脑。效率从一种外部要求,变成了一种自我道德。

反测量提问:**这个指标量化的是哪一段劳动?被它漏掉的那部分(思考、协作、恢复、创造)去哪了?**任何被计件的工作,都会驱逐掉无法计件的部分。

案例五:信用分——一个三位数如何变成身份

先说一个美国故事。

1930 年代大萧条期间,美国政府成立了房主贷款公司(HOLC),为了评估哪些街区适合发放房贷,它把全国城市地图按风险染成四种颜色:绿、蓝、黄、红。

  • 绿区:新建的白人中产社区,优先放贷;
  • 红区(redlining):黑人聚居区、老城区,拒绝或极度限制放贷。

这套地图的灵感,来自一个更早的私人机构——1910 年代起,美国房地产行业就绘制过"居住安全地图",用来防止黑人"入侵"白人社区。政府只是把它制度化、全国化了。

关键在后面:**红区被切断信贷后,房产贬值、社区衰败,十几年后"红区确实风险高"的证据就自己长出来了。**一个纯粹制度性的排斥,最后被包装成了"数据说话"的自然规律。这套机制在 1968 年《公平住房法》和 1977 年《社区再投资法》后才被逐步禁止,但房屋拥有率的族群差距至今未完全弥合。

再往后,是客制化的个人评分:

  • 1956 年,**费尔(Bill Fair)和艾萨克(Earl Isaac)**在旧金山创办 Fair Isaac(即 FICO),早期用"统计模型给贷款人排序"做生意;
  • 1989 年 FICO 分正式商业化——一个 300–850 的三位数,把一个人一生的还款记录压缩成一个可交易的标签;
  • 到 2010 年代,FICO 分影响美国约 90% 的信贷决策,租房、买车险、甚至部分雇主的背景调查都会看它;
  • 一个著名悖论:为了攒分,你需要借贷并按时还款;如果你彻底不借钱、只用现金,你反而是"信用不可见"(credit invisible)——没有分,也就不被信任。

再看中国这条线(客观描述):

  • 2014 年,国务院印发《社会信用体系建设规划纲要(2014—2020年)》,把"社会信用"作为一项制度化建设方向;
  • 2015 年,芝麻信用、腾讯信用等商业信用评分上线,一度与租房免押金、租充电宝、办理签证等场景挂钩;
  • 2021 年后,监管收紧:央行等部门明确商业信用评分不得与公共信用信息混用,芝麻信用被纳入征信业务统一监管框架——过度扩展被纠正;
  • 与此同时,最高人民法院的"失信被执行人名单"(限制高消费、限制乘坐飞机高铁)是另一条更具体的制度线索。

这里必须做两个区分,否则会滑向阴谋论:

  1. “社会信用体系"是一个复杂的政策集合:里面既有惩戒失信被执行人的内容,也有"信用修复”、“守信激励"的机制,与西方媒体常渲染的"每个公民被实时打分"并不完全对应;
  2. “商业评分"和"公共信用"是不同轨道:前者是公司的运营工具,后者是行政监管的工具,2021 年之后两条轨道被明确要求分离。

内化:无论哪国版本,当一个人的社会身份被压缩成一个数字,“维护这个数字"就会变成一种日常焦虑——你的行为开始不是为了生活,而是为了分数。

反测量提问:**这个分数衡量的是我的能力,还是某个机构的风险?**记住——信用分的服务对象是放贷方,不是借款人。它天然是一个"对方的视角”。

案例六:强制排名——绩效的钟形曲线暴力

如果说泰勒管的是"动作”,那么"排名"管的是"人”。

GE 的"活力曲线"(Vitality Curve)

1980 年代,通用电气 CEO **杰克·韦尔奇(Jack Welch)**推行了一套被称为"活力曲线"的制度:每年把员工强制分成三档——

  • 前 20%:重点奖励、股权、晋升;
  • 中间 70%:维持、再观察;
  • 最后 10%:必须离开。

韦尔奇的逻辑是"避免组织变得臃肿",GE 因此在 1980–2000 年代被华尔街奉为管理模范。

微软的"排名淘汰制"(Stack Ranking)

90 年代到 2000 年代,微软内部实行严格的分组强制排名:每个小组内必须产生一定比例的"差评",哪怕整个组都很优秀。

内部甚至流传一句话:“要么你被淘汰,要么你淘汰别人”。最有名的公开证词,来自 2012 年《名利场》(Vanity Fair)那篇著名的长文《微软失落的十年》(“Microsoft’s Lost Decade”):作者**库尔特·艾肯瓦尔德(Kurt Eichenwald)**采访了多位前微软员工,记录了同一件事——员工因为怕同事超过自己,会刻意回避协作,甚至互相拖后腿。

2013 年,微软新任 HR 负责人丽莎·布鲁梅尔(Lisa Brummel)正式宣布废除员工排名制,改用团队协作导向的考核。这是对强制排名最直接的一次官方否认。

症结在哪?

强制排名的问题不在于"评价员工",而在于它预设了一条钟形曲线——它假设每个组的绩效天然符合正态分布,因此必须有人当"差"。但现实里一个高效团队的成员可能全是优秀的。

Marcia 定律式的后果是:

  • 惩罚协作(帮同事=可能害自己);
  • 奖励短期可见的业绩,驱逐长期投入;
  • 把"保住自己的名额"变成第一优先级;
  • 大规模的人才流向竞争对手(微软在 2000 年代流失了大量工程师到谷歌、亚马逊)。

内化:你对自己"必须比同事强一点点"的执念,很可能是被一条假想的钟形曲线训练出来的。

反测量提问:**这条评价曲线的形状是谁画的?真实分布真的是钟形的吗?**很多"自然规律",其实是制度假设伪装成的现实。

案例七:评分社会——每个人都在给别人打分,也被打

进入 21 世纪,测量从"一段时间测一次"(考试、考核),变成了持续、双向、公开的。

双向评分

  • 2008 年,Airbnb 上线房东/房客双向评分;
  • 2009 年,Uber 上线乘客给司机打分(4.6 分以下有被停号的风险);
  • 2010 年代,滴滴、美团等把评分、派单、乘客评价绑定,形成"评分决定收入"的结构。

这是人类历史上第一次,普通人日常地、大规模地对彼此行使打分权。福柯描述的"人人都监视人人",第一次有了技术基础设施。

代价是:评分从"反馈"变成了"绩效",从"我这次服务好不好"变成了"我这个人的价值"。2019 年《人物》杂志那篇著名的**《外卖骑手,困在系统里》**(2020 年发表)记录了骑手为了保住分数与系统、与红绿灯、与自己身体对抗的完整链条。

全员暴露

同一时期,打分文化从平台渗透进了普通职场:

  • 企业内部的360 度评估:同事、下属、上级互相打分;
  • OKR/KPI 的季度考核;
  • 钉钉/企业微信的已读、在线、活跃时长统计;
  • 甚至有公司在大屏上实时展示每个人的工位在线时长。

内化:当"被评分"成为日常,人会自动进入"表演模式"——**行为开始为了评分而优化,而不是为了事情本身。**这就是为什么很多人说"上班像在演戏"。

反测量提问:**这个评分系统观察的是全是我的行为吗,还是只是恰好被它记录到的那部分?**评分者只能看见它看得见的,剩下的全是盲区。

案例八:算法测量——从"测量你"到"预测你"

前十年的测量是"记录的自动化",接下来是"判断的自动化"。

机器学习把测量推向了最后一步:预测。

  • 内容平台用推荐算法预测你会看什么、停留多久、转发什么;
  • 招聘系统用简历筛选模型预测你"适不适合"(而这类模型屡屡被证实复刻并放大了历史歧视——亚马逊 2018 年废弃过一个因训练数据偏差而歧视女性简历的招聘模型);
  • 信贷机构用行为风控模型预测你会不会还钱;
  • 保险公司用可穿戴数据预测你的健康风险。

这一层的质变在于:前七种测量都需要你"配合"——你得去考试、去上班、去借贷。而算法测量不需要。你只是刷着手机,就已经在被持续测量。

而这些模型的特征是:

  • 不透明:你通常不知道它的输入是什么、权重多少;
  • 不申诉:你几乎无法问"为什么我被判定为这类人";
  • 自我实现:给你推的内容塑造了你,塑造出的你又被用来验证模型的预测——预测变成了原因本身。

这就是"预测"比"测量"危险得多的地方:测量描述一个已经发生的你,预测则在参与制造那个还没发生的你。

反测量提问:**这个系统是在观察我,还是在替我决定我该成为什么?**如果它决定了你看到的世界,那它已经在塑造你了。

收束:测量本身不是敌人

写到这里,必须踩一脚刹车,否则又要滑向那个熟悉的陷阱——“所有测量都是压迫”。

错。测量是文明的底层能力。

  • 比奈最初是为了帮助落后的孩子,这个初衷是对的;
  • 没有标准化测量,现代医学无法做临床试验,药物安全无从谈起;
  • 没有统计,公共卫生体系无法追踪传染病、无法评估政策;
  • 职场考核、绩效透明也有真实价值:它让"任人唯亲"至少比完全没标准时更难。

问题从来不在"测量"本身,而在四件事:

  1. 目的:它是为了帮助被测量者,还是为了筛选和排序他们?
  2. 权力:谁定义标准?谁受益?被测量者有没有申诉权?
  3. 外溢:这个分数有没有被用到它原本不该用的地方(考分决定命运、信用分决定租房)?
  4. 内化:被测量者有没有把这个数字当成了自己?

测量是工具,问题是它经常被当成判决书。

你手里应该有的三件东西

对照八个案例,每个都配了"反测量提问"。把它们压缩成三个可以随身携带的问题:

  1. 谁在量我?(Who measures)——量我的人,为谁工作?
  2. 量的是哪一部分?(What is measured)——被漏掉的那部分去哪了?
  3. 这个数字要去哪里?(Where does it go)——它会不会走出原本的用途,变成我的标签?

这三个问题,不能让你摆脱被测量——现代生活里没人能。但它能让你从"被测量的对象"变回"知道自己在被测量的人"。这两者的区别,就是福柯所说的那一点点自由。

从上篇到下篇:一条完整的线索

两篇合起来,是一个完整的故事:

  • 上篇(概念史):现代社会用一套话语,把结构性问题翻译成个人品质问题——“你要主动成为更好的自己”。
  • 下篇(物质史):这套话语靠一台台测量装置落地——智商、秒表、问卷、档案、信用分、排名、算法。
  • 合起来:话语负责让你内疚,装置负责让你可追踪;两者配合,人就成了既自我管理、又可被管理的对象。

现代治理的公式因此可以最终写成:

制造标准 → 测量个体 → 公开差异 → 个体自我规训。

福柯管最后一步叫"治理术":最强大的权力,是让被统治者把统治者的目标当成自己的目标。而测量装置,是这句抽象论断在现实里最具体的载体。

给四十岁以后的人:你不需要一个总分

最后落到具体的你。

如果你读到这里,大概率你也被测量过很多次——高考分数、绩效考核、征信记录、平台评分、看到别人成功时的自我比较。这些数字里,有些你已经内化成了"我这个人就值这么多分"。

但真正的解药不是"从此不看分数",而是三句话:

  1. **分数是对某个场景的适配度,不是对人的估值。**高考分是对高考的适配度,绩效是对当期岗位的适配度。你不是你的适配度。
  2. **被漏掉的部分,往往才是你真正稀缺的部分。**测量系统通常只能量到"可标准化的能力",量不到判断力、审美、长期信任、跨领域连接——而这些恰恰是 AI 时代最难被替代的东西。
  3. **瞬时分数不是趋势,更不是命运。**一篇被 100 个人读的文章,和一个连着写了三年的人,不是同一种存在。系统的钟表是回合制的,人生是长期制。

测量无法避免——AI 时代它只会更密集。唯一的自由,是当那个分数出现时,你知道它是什么、它从哪来、它想让你变成什么。

然后仍然选择:打你自己的那一副牌。


延伸书单:比奈《智力的实验研究》 · 古尔德《人的误测》 · 泰勒《科学管理原理》(1911) · 韦伯《新教伦理与资本主义精神》 · 福柯《规训与惩罚》《安全、领土与人口》 · 迈克尔·刘易斯《魔球》 · 凯茜·奥尼尔《算法霸权》(Weapons of Math Destruction) · 韩炳哲《倦怠社会》

系列阅读:本文属「AI时代个人重构指南」系列—— 知识—权力—自我:现代社会如何塑造人(上) · AI的"iPhone时刻"不会到来——这反而是好事 · 八零后AI再入场战略:别再当围观者