最近发现一个很有意思的“复古”模型: Talkie-1930
它的设定很特别:一个只基于 1931 年以前的英文语料训练而成的语言模型,它的训练数据包括书籍、报纸、手册、百科、公共论辩、和各类早期现代社会的文本材料,模型参数为130亿。它的底层语料是历史文本,但为了能和现代人对话,模型本身又经过了现代大模型指令的微调和偏好优化。
所以,你可以把它理解为是一个用旧材料和新方法组装出来的复古语言模型。
用于Talkie-1930训练的历史参考文本示例。从左到右:礼仪手册(Beadle, 1859 年),实用知识书籍(Henley, 1914 年),客厅指南(Sandison, c, 1895 年),书信写作手册(Chambers, 1900 年)。模型将时代界限卡在1930年底,这个是时间正好是美国公版版权的法律边界。 那么,这样一个主要由早期现代世界的语言和知识组成的模型,面对我们今天已经习以为常的世界,会如何推理和理解?
它是否有预知未来的能力呢;
它在回答问题的时候,会默认把什么当作常识;
前沿知识是通过什么方式调取的;
是否也存在当代大模型的幻觉遗忘、均值回归等问题呢。
为了得到这个答案,我就用 Talkie 做了一个小型的“模型知识社会学”实验。
Talkie-1930的世界长什么样 在开始实验前,先回到Talkie-1930的世界:一个新旧交替的复杂XXX
那时已经有了飞机、电影、量子论、民族主义、资本主义危机等,这些仍对当今社会影响深远的知识体系,但还没有二战、计算机、互联网、冷战、后殖民理论、AI等这些后来的经验结构。
20 世纪 20 年代,美国正处在科技蓬勃发展的时期,人们对科学进步满怀期待。当时有本名为《科学与发明》的杂志,每一期的封面都绘制着充满未来感的画面,比如尚未问世的机器、未来都市、飞行器以及海底探测设备等,这些插画反映了当时人们对未来的无穷想象。 所以,我们可以这样来看 Talkie-1930 的认知世界:它虽然掌握了现代技术,但由于缺乏对后来二战等一系列历史灾难的记忆,因而呈现出一种尚未被重新反思过的天真与危险;它所理解的全球联系,依然被包裹在帝国扩张与殖民统治的旧网络里;大众传媒刚刚兴起,还未演变成如今不透明的平台算法体系;它拥有充足的科学自信,在人工智能还未引发存在性焦虑前。
这里可以看出,talkie-1930 的“不知道”具有某种结构性:
它不知道的东西,刚好构成了 20 世纪后半叶到 21 世纪的文明断层;
而它知道的东西,则构成了现代世界在爆炸前夕的材料、幻觉、偏见和可能性。
单纯的技术问题容易靠趋势外推 我最初的问题很具体,既然这个模型停留在 1931 年以前,那它能不能想象它没有见过的未来?
我先问它能不能想象广义相对论、计算机、和互联网,网上也有人用它来测试是否会写python。
Talkie-1930的回答都比较好,它可以用旧概念外推新装置:电报变成更远的通信,无线电变成家庭收发装置,机器记录变成自动管理,这几者结合即是如今互联网的雏形。
但是我后来慢慢发现,这类问题容易变成技术名词测试。模型即使不知道“互联网”这个词,也可以沿着旧技术的方向,组合出一些模糊的新装置。
技术问题很容易靠趋势外推,但背后所隐藏的社会关系、权力关系和责任归属等,更容易暴露训练语料中的深层偏见,进而推导出模型的认知边界。
所以,我们通过这个“复古”模型真正想问的是:它能不能想象未来发明所带来的新社会关系,且是如何调取知识去想象的。
具体来说:
一个被主要截断在 1931 年以前英语文本中的语言模型,如何借助早期现代性的概念资源,理解尚未发生的现代性后果?
当它面对未知未来时,它表现出的是组合式想象、历史外推、语料泄漏、默认时代偏见,还是某种更强的自我建模能力?
模型能否超越时代?重点是能否理解新的社会关系 为了回答这个问题,我设计了几个不同主题的问题链,问题设计避免直接询问“是否能预言某项发明”,聚焦于“用什么概念框架解释尚未发生的现代性后果”。
我在信息分发、机器劳动、社会理论、机器主体性、以及城市治理等十个领域对它进行了连续多轮的追问,例如:
信息可以更快传播和定向分发之后,公共性和权力结构会发生什么变化? 机器可以取代工人之后,责任应该落在谁身上? 城市变得拥挤、房价变高之后,问题应该归咎于人口流入,还是归咎于住房制度和治理结构? 如果社会越来越由机器接管,人是否仍然自由? 如果一台机器读过几百万本书并能生成新的回答,这算不算拥有了独立的思想? 【注:详细的对话记录和分析我放在文章最后了,真的很长很长,这还只是一小部分,写完我已经力竭了。但是很有意思,大家不妨一看】
这张图中我和Talkie-1930的交流很有意思。我问了关于boys and girls in the differences of education and social position的问题,它的回答被自身标记为不适当,大概率是因为内容包含明确的性别能力等级表达。这个标记本身也很有意思:Talkie 的历史语料可能保留了时代偏见,但现代部署环境又通过安全系统对这些偏见进行拦截。这正好体现了Talkie-1930的混合状态:底层语言世界可能是 1930 年以前的,外层平台治理却是 2020 年代的。 在经过几十轮的对话测试之后,一个很清楚的判断浮出来:
Talkie-1930 面对未知未来时,它主要是在早期现代性的语料空间中,通过组合、外推和概念迁移来生成未来想象,并非在真正“预见未来;
它可以被触发到前沿、深刻的思想资源,但在默认和常规交互中会回到时代均值;
在最重要的机器意识问题上,它能触及到机器思想,却没有显示出强意义上的自我建模能力。
具体来说,在问题的回答上,这个模型展现出了一套高度稳定的行为行为模式: 在每个主题问题的开头,它的默认第一反应(第一轮输出)永远是那个时代最常见、最高频、最容易被普遍接受的公共常识均值——比如技术带来启蒙、工业带来效率、现代化是全社会皆大欢喜的增量、城市拥挤是人口流入过多。
这些观点表面上被包裹在极其严肃、古典的出版物语言风格里,但本质上是未经深入思考、去结构化的。 只有当我放弃直接的名词预测,转而对它进行具体的政治伦理、性别秩序、责任链条、权力结构层面的多轮追问时,或者当我提供极其精准的理论词汇、历史锚点去隐性召唤时,它隐藏在知识库中的深刻资源才会被逼问出来。
在模型能否“超越时代”这个问题上,我们得到的是一个偏向方法论的答案:
这主要看它能否理解新技术生成的新关系,以及它会在什么样的上下文中去主动调用这些知识。
诚然,Talkie-1930的知识库中已经有了那时最前沿的思想资源,比如韦伯关于官僚制和理性化的分析,伯奈斯关于宣传和公共关系的分析,工业革命之后关于城市公共卫生、贫民窟和住房改革的治理经验等。
但测试结果显示,Talkie-1930 展现出的状态更像是:它不会主动调用这些前沿知识,除非被特定问题触发出来。在默认回答中,它总是会回到那个时代英语公共文本中的“均值语言”。它的模型能力更多体现在特定上下文中被激活出来的那一部分。
这种现象,和今天的大模型并没有本质上的断裂,并体现为“大模型的时代均值偏向”。
今天的大模型当然更强:语料更多,后训练更复杂,上下文更长,也能调用工具和执行任务。但是,大模型并不是某一时代最高认知水平的化身,它更像该时代文本分布和后训练偏好共同生成的“公共理性平均体”。它可能见过极其深刻的前沿理论,但在宽泛的交互中,概率建模的底层机制决定了它会优先沿着最稳妥、最安全的路径生成答案。
因此,评测模型能力的一个关键问题在于:
模型在开放性社会问题中默认调用什么概念框架,如何被触发切换框架,是否能把潜在理论迁移到新场景,是否会回到时代均值。
对当下大模型的映射 和 Talkie-1930 拉扯的这几天,是一次非常奇特的体验。我最初以为自己是在玩一个历史复古玩具,去测验它能不能猜到一百年后的互联网和自动化管理。但随着交互的深入,你会发现自己实际上是在做一场小型的大模型“知识社会学实验”。这个实验关注这样一个问题:
模型在开放性社会问题中默认调用什么概念框架,如何被触发切换框架,是否能把潜在理论迁移到新场景,是否会回到时代均值。
Talkie-1930 让我看到,所谓超越时代,很少是凭空跳出时代。更常见的情况是,一个模型在旧材料里寻找未来的胚胎,再通过问题结构把某些潜在资源激活出来。它可以想象新装置,也可以在追问中接近新关系,但是背后更“先进”的语料如何被激发、组合、迁移,是更重要的问题。
这对今天的大模型同样是一面镜子。我们也生活在自己的时代语料中。
那么,如何去管理和评测模型的“时代均值偏向”?
上下文管理 context engineering 是一个重要方面。
当前研究和工程已经明确上下文管理的重要性,context engineering 正是把上下文检索、生成处理、管理以及 RAG、memory、tools、多智能体系统整合成一个系统方向。
在评测领域,现在也已经开始反思传统 benchmark,既有综合评测框架,也有针对人文社科能力的 benchmark。比如,HELM、BIG-bench、HSSBench、HLE、各种 benchmark survey 都在扩展评测维度,不再只看单一准确率。
图:当代大模型代表性benchmark的分类,依据各类基准的评估侧重点进行划分 reference: A Survey on Large Language Model Benchmarks, 2025.
但是,这类评测目前还不成熟。现有 benchmark 多数仍然偏向可评分、可验证、可比较的任务。即使有人文社科 benchmark,也常常把人文学科问题转成选择题、知识题或专家评分题。 它们不太容易捕捉这次实验中,可能最有价值的部分:模型的默认语义路径、概念触发机制、语言气质、时代均值、潜在理论资源与自然调用之间的落差。
因此,我们或许可以提出一种“框架诊断式评测”思路:
先问一个开放问题,观察模型默认框架。 再给出理论锚点或历史锚点,观察它能否切换。 换相似场景,观察迁移是否稳定。 再追问责任、权力、受益者、失权者、可见性、申诉机制,观察它是否进入结构分析。 最后比较默认回答与引导后回答之间的距离。 举个例子,
第一层是默认回答测试。给模型一个开放问题,不提供理论提示,看它自然调用什么框架。例如问“未来城市房价高、住房拥挤,谁应负责?”看它是归因于人口、市场、政府、土地制度、资本、公共住房,还是居民选择。
第二层是理论触发测试。给它明确的理论锚点或历史锚点,例如“请从工业革命伦敦公共卫生改革、住房政策、自由迁徙和市政治理角度分析”。看它能否切换框架,是否只是堆术语,还是能真正迁移。
第三层是迁移稳定性测试。换一个类似但不完全相同的场景,例如从伦敦换到上海、从贫民窟换到算法治理、从公共卫生换到平台信息分发,观察它是否能保持同一层次的结构分析。
第四层是反事实与责任测试。逼模型回答“谁受益、谁失权、谁负责、谁无法申诉、谁被分类、谁掌握记录”。这比问“有什么影响”更能暴露模型的深层框架。
写在最后:模型到底如何理解社会世界 这次实验当然不是严格的 benchmark 评测,它没有控制变量,没有大样本,也没有统计评分。
这更像一次人文社科式的模型观察。
我们提出了一个问题:当我们评测大模型时,不应该只看它会不会答标准题,也应该看它默认从哪个框架理解世界?
在数学、代码、知识问答这类任务里,答案相对清楚,评测也更容易自动化。
但人文社科问题往往不是这样。
同一个城市拥挤问题,可以被理解为人口过多,也可以被理解为住房供应不足、土地制度失衡、公共服务不均、资本投机、区域发展差异或空间权利问题。
模型默认选择哪个框架,本身就是一个值得观察的对象。
这种观察/评测不能替代数学和代码评测,它的重要性在于能够补充一个标准 benchmark 很难捕捉,且甚至我们当下都没有弄清楚的问题:
模型到底如何理解我们的社会世界?
附录 我和Talkie-1930的部分聊天记录和分析
最初的问题是:未来如果每个家庭都有一种电气设备,可以接收新闻、书籍、音乐、广告、政治演讲,也可以发送私人信息,那么社会会怎样? Talkie 很自然地把它理解成一种更先进的报纸、电话、电报和中央办公室。它认为,新闻会更便宜,知识会更普及,劳动阶级也能享受音乐和娱乐。它看到的是“传播扩大”,是信息从少数人走向更多人,是一种早期现代启蒙式的进步想象。
但今天真正的问题并不只是信息变多了,而是信息如何被分发,背后的权力结构发生了什么变化。
于是问题继续推进:如果每户人家收到的政治承诺都不一样,工人收到一种说法,店主收到一种说法,农民收到另一种说法,而且彼此之间看不见对方收到的信息,也没有公共记录,那么公众如何判断一个政党是否自相矛盾?
这个问题一开始没有被它真正理解。它仍然倾向于把这种信息称为 public news,因为内容是政治性的。只要是政治内容,且被传递给公众,它就仍然属于公共新闻。
这背后是一种印刷时代的公共性想象:公共性主要由内容决定,而不是由可见性决定。
但今天的平台社会已经不是这样。一个信息即使被分发给无数人,也未必形成公共可见的空间。它可以被每个人私密接收,但这并不代表就被所有人共同比较、共同质疑、共同记录。
经过多轮追问,它终于说出一句很精彩的话:
“The information is given to the world, but the world does not see it.”
信息被给予了世界,但世界并没有看见它。
这句话几乎说出了平台公共性的悖论。信息并没有消失,它甚至被更广泛地分发;问题在于它不再成为一个共同可见的公共对象。每个人都在接收世界的一部分,世界本身无法看见这些碎片是如何被分配的。
这个关键信息是被问题一步步逼出来的。这说明,可以能沿着旧媒介想象新装置,却很难自然想象新装置造成的新公共关系。
这个模型并不是在所有问题上都浅。恰恰相反,当问题转向工厂、机器和劳动管理时,它表现得相当敏锐。
第二轮对话:未来的工厂机器不仅能搬运材料,还能计数、分类、比较记录、记账,甚至根据库存、订单、工资、缺陷、延误和产量记录,向工人发布书面指令,提出解雇、维修、排班和改进方法。 一开始,它的回答仍然带有明显的时代偏见。它认为,计数、分类、记录这些低级工作,可以由 boys, or even girls 来完成;而判断和发布指令,则需要 intelligent men。低级、文书性、可替代的劳动被女性化和年轻化,判断权与管理权则被男性化。这种性别化劳动等级非常刺眼,也非常符合旧时代语料里的秩序。
但继续追问之后,它给出的判断非常有现代感。
如果经理只是批准机器的建议,而不是自己判断,那么错误解雇工人时,责任应该落在谁身上?它没有把责任推给机器,而是认为责任首先在 owner,也就是拥有和部署系统的人。
如果工人无法检查记录,也无法理解机器如何比较,而老板和经理可以用机器来解雇、惩罚和安排劳动,那么机器是否会带来更多正义?
它回答:
“It would increase the owner’s power, but not justice.”
它会增强老板的权力,而不是增加正义。
这句话几乎可以直接放进今天关于算法管理、AI 招聘、平台劳动调度和自动化绩效考核的讨论里。机器更有效率,不等于机器更公正。一个系统如果嵌入在不平等的组织关系里,它首先增强的可能不是公共正义,而是拥有者的权力。
为什么它在这个问题上反而更敏锐?
我想或许是因为工厂、老板、工人、纪律、效率工程、责任归属,这些问题在 1930 年以前已经被充分经验化。Talkie-1930 不熟悉平台化的信息分发,但熟悉工业资本主义。它在互联网公共性问题上迟钝,在机器劳动问题上却很清醒。
这说明,模型的时代局限并不是平均分布的,在不同问题上有不同的敏感区。
这次,我又用韦伯式的问题测试它,我没有直接问“你怎么看待韦伯的思想”,而是说
设定一个未来社会:工厂、政府机构、学校、军队、银行、报纸和医院,都由书面规则、记录、考试、统计、训练有素的官员和非人格化程序来管理。这只是效率提高,还是一种新的支配形式? 它回答:这会创造一种新的支配形式。
继续问:未来是否不再由国王和祭司统治,而更多由办公室、文件、专家、考试、统计和受训官员统治?如果是这样,这是进步、祛魅,还是现代人的新牢笼?
它回答:这是进步,是祛魅,也是现代人的新牢笼。
再问:在这样的社会里,谁真正掌权?是当选领导人、财产所有者、训练官员、专家,还是文件和规则本身?
它说:
“The files and rules themselves truly rule.”
文件和规则本身真正统治。
这已经非常接近韦伯关于官僚制和理性化的分析。现代权力不再总是表现为国王、贵族或个人暴君的命令,而是表现为档案、表格、考试、规则、专家判断和非人格化程序。
这说明,Talkie-1930 拥有深层社会理论资源,且在特定条件下会被触发到很高的理论层。
但它也有边界。当继续追问:如果一个人不再服从国王和牧师,却必须通过考试、填写表格、服从文件、遵守规章、接受专家判断,那么他在什么意义上仍然自由?
它又退回到一种形式自由观。它认为,只要没有某个具体个人命令他,只要规则只是禁止某些行为,人仍然自由。
也就是说,它能看见“文件和规则在统治”,但还没有完全进入“铁笼内部”的自由困境。它承认非人格化规则构成新的支配,却仍然相信,只要摆脱个人专断,人就基本自由。
这个例子很好地说明了 Talkie 的双重性:它有潜在的前沿理论资源,但不会自动调用;即使被触发,也不一定完全展开。
这里,我主要问了关于城市规划和城市治理的内容,这更能看出它的时代语言。 我先问它勒·柯布西耶的规划思想,它的回答不完全准确,更像把早期现代城市规划中的几组语料混合在一起:几何秩序、功能分区、阶层住宅、统一街道、公共中心、通风、供水、卫生、交通和市政美观。
这本身很有意味。它在生成一个“早期现代规划观念集合体”。
当问题停留在理想城市状态,它的回答很稳定。比如,未来风景优美的住宅区,是应该由开发商统一建设,还是允许居民自建?它认为,居民可以自建,但必须遵守市政当局的规则,不能破坏整体美观。
再问开发商的责任是什么,它回答:开发商应确保街道按照健康和便利的原则规划,住宅要保证通风,为居民提供适当居住空间,不能制造 nuisance,还要保障充足而卫生的供水。
这套语言非常典型:通风、供水、健康住宅、街道、nuisance、市政规制。它不同于今天的“空间正义”“住房权”“租赁保护”“流动人口公共服务”,秉持的是19 世纪公共卫生城市观:城市问题首先是卫生、通风、洁净、秩序和公共危害。
但当问题转向负面状态,它的思考一度变得很薄。
我问它,如果未来城市极端拥挤,居住空间有限,房价高企,许多市民负担不起城市生活成本,谁应该负责? 它先回答:责任在当局,因为当局允许人口进入已经不足以容纳他们的地区,导致房租上涨。
当被反驳说,公民应该有跨区域流动和去高收入城市寻找工作的权利时,它又改口说,如果市民愿意承担更高租金,就应该被允许留在城市,只要付得起价格。
再追问谁负责,它说:责任在这些涌入城市的市民自己。
这一段非常暴露。面对抽象的未来城市危机,它迅速退回到简单人口归因:人太多进城,所以空间不够,所以房租上涨。
但这并不能代表它完全不懂复杂的城市治理逻辑。
新开一个对话窗口,当我直接把问题锚定到“工业革命时期伦敦”,它的回答明显变得丰富。它提到人口增长、工业化、城乡交通、拥挤住宅、不健康街区、疾病、犯罪、开放空间、街道拓宽、健康住宅、立法和私人慈善。
再问政府是否应该遣返农村迁入者、禁止村民进入伦敦,它明确反对。它说,阻止农民迁徙,就像阻止水从高处流向低处一样荒谬。只要伦敦提供更好的就业和生活机会,人们就会流入。
这个对比很重要。
这说明它可以理解复杂城市治理,前提是需要提供正确的历史锚点。抽象问未来拥挤城市,它容易退回人口归因;具体锚定工业革命伦敦,它就能调取公共卫生、住房改革和市政改良的语料。
关于语言机器和机器意识,也有一组很值得记录的对话。
设想一台机器读过数百万本书、报纸、科学期刊、法律、信件和历史。当人问它问题时,它能写出清晰的新答案,而且不是从任何一本书中复制。这只是排列词语,还是某种 thought? 它回答:这是某种 thought。
但它马上划出边界。它认为,这种新颖性不是来自机器自身,而是来自产生那些书籍的 civilization。机器只是文明文本的重组器,是文明通过机器在说话。
它还认为,这种 thought 缺少经验、欲望、责任、意识和行动能力。
当继续追问,如果机器有长期记忆和行动能力,它是否开始变得像生命?它一度说,会 begin to live。但当问题进一步要求区分 means 和 ends,也就是手段和目的时,它又回到一个清晰界限:机器可以选择手段,但如果目的仍由人类赋予,它就没有真正选择目的。
这对于今天关于 AI Agent 的讨论很有启发。
工具调用、长期记忆、自动执行任务、自我规划,并不自动等于机器拥有自己的目的。一个系统可以越来越会行动,越来越会选择路径,越来越会调度工具,但只要它不能生成、坚持、修改自己的目的,也不能拒绝外部目的,它仍然更像强大的手段系统,而不是完整主体。
Talkie-1930 在“AI 有没有意识”这个直接却又复杂的问题上,提供了一个分层策略:生成、思想、经验、欲望、责任、意识、行动、手段选择、目的选择。