Token导航 LogoToken导航

历史学者谈人工智能与历史学的观察实验

更新时间 2026-10-05来源 澎湃新闻正文 1.8万字阅读约 56分钟3 张图片

前不久,我去广州参加一个以人工智能与历史学为主题的研讨会。

乘出租车去机场的路上,司机主动向我搭讪,一路向我诉苦:“AI现在太厉害了,马斯克开发的无人驾驶出租车要是大规模推广,我们恐怕都要失业了……”我很惊讶,一方面佩服司机大叔对Tesla Robotaxi的了解,另一方面也感受到了各行各业对AI的恐慌。司机接着和我聊起来:

“来广州做什么?”

“来学习一下人工智能与历史学。”

“律师啊,你们律师也要被AI取代了吧?”

“不不,不是律师,是历史。”

“历史和AI有什么关系?这么高科技的东西,关你们什么事?”

我一时语塞,竟不知道该怎么解释。因为我明白,若再强行抛出“OCR”“数据库”这类词,接下来大概率就是尬聊了。

不过,和出租车司机这场偶然的对话之后,我想,是时候把这些问题梳理一下了。大概从ChatGPT问世起,我就在持续关注人工智能与人文社会科学研究的相关论著。去年底,OpenClaw横空出世,能直接帮人操控电脑,功能十分惊艳,我便开始下功夫自学。当时我发现,历史学者对这个工具的使用还比较滞后,想找个“师傅”都难。后来,一位放弃博士学位、专职炒股的师兄和我说,他正在用AI炒股,用的就是OpenClaw。我对炒股没有兴趣,但很想用它帮我从网上抓取史料。他建议我先从国产的入手,我就此成了WorkBuddy较早的用户之一。起初我主要是从网上抓取、整理史料,效果非常惊人,以前我可能要一周才能做好的事情,它不到一个小时就完成了,而且更准确、更详细;甚至我在外出差,也能通过它控制我的电脑,继续整理史料。这让我的好奇心和探索欲倍增。当时国内外各大Agent接踵而起,大模型也越来越多,我几乎都去试用或购买相关API,慢慢摸出了些门道。

有一天,我发现大部分Agent都有“定时任务”的功能,摸索了一会儿后意识到,这不就是私人订制的“微信公众号”吗?于是我设置了不少任务,其中收获最大的,是每日关于AI与历史学研究的推送。我大致设了几个任务,让Agent检索全球人工智能的进展、人工智能与历史学的论著,以及人工智能与人文社会科学研究的论著,并且一天至少翻译两篇给我读。有些虽未全文翻译,但只要我觉得重要或有趣,就会想办法找来全文细读。久而久之,我每天都要读大量相关文献。通过这些文献,我真的是大开眼界:机器补全两千年前残缺的希腊铭文,准确率居然超过了专业的历史学者;甲骨文考释用上大模型,拿下了计算语言学年会的最佳论文;伦敦帝国战争博物馆2万多小时的口述史访谈,AI只用了22天便整理完毕;甚至一封在挑战名单上挂了21年的二战德军密电,也被大模型用10个小时破开……这样的消息,几乎每周都有。

阅读的早期,我心中的疑问也越来越多。比如,人工智能的原理是什么?全球人工智能的前沿走到了哪里?它与历史学结合的特征、瓶颈与趋势是什么,中国的情况又如何?它究竟能为历史学研究做什么,又有什么是做不到的?其他学科与人工智能结合的经验,能否让历史学借鉴?如今,我心里多少有了些答案,便借这篇文章展开来谈。

一、人工智能降低了历史学者的编程门槛

在中国的教育体制下,从中学到大学,不管什么专业,可能都上过计算机的必修课。相较于充满趣味的文史知识,计算机语言显得有些乏味,这对许多文科生是个不小的挑战。因此直到现在,不少历史学者面对AI,仍带着一种本能的胆怯。据我观察,身边大部分朋友对AI的使用,还停留在“聊”的层面,即用手机App或网页版一问一答,很少进入“干活”的工作流,谈不上让AI替研究做些稍复杂的辅助。事实上,由于AI的发展,编程对普通人的门槛已大为降低。放在以前,你可能要先接受相当长时间的计算机培训,才能掌握C语言、Python这些工具;而如今,你只要用大白话告诉AI你的需求,它便会替你写成代码,把活干完。

如果历史学者愿意再多了解一些入门级别的概念,则很快会克服这种胆怯与迷茫,阅读相关方法论或者探索性的论文,也不会感觉吃力。第一个问题自然是,究竟什么是AI?这不是历史学者需要过于纠结的问题,你需要知道,AI不是最近几年才出现的,早在1956年达特茅斯会议,这个概念就已出现,大意是“让机器完成需要人类智能的任务”。我们现在所接触到的AI,基本取的是较为狭义的理解,即2022年11月30日ChatGPT上线以来的大语言模型及其多模态延伸,也被称之为生成式人工智能。此前的AI是实验室和工程师的,此后第一次进入每个研究者触手可及的范围。说到底,这些大模型都是读过海量文本之后学会“语言的统计”的机器,能像人一样说话,不等于像人一样知道。

对历史学者而言,有四个词需要稍微了解。词元(Token),是机器眼里的字,模型读进多少、写出多少、按什么计价,全以它为单位,中文一个字约合0.6到0.7个词元。多模态(LMM),如今文字、图像、声音进了同一个模型,它不光识字,还认得手稿、看得懂拓片、听得清录音,史料的OCR、文书识别,靠的都是这一手。检索增强生成(RAG),先让模型去指定的库里查材料,再据以作答,答话还能带上出处,好比把闭卷考试改成了开卷考试,又像一位守规矩的查档助手,调哪件档案,说哪句话。智能体(Agent),是会动手的AI,能替人读写文件、执行代码、操纵浏览器,一桩多步骤的差事自己拆开来办,我开头讲的抓史料、每日推送,便是它的手笔。有个公式说得很直白,Agent = Model + Harness,模型还是那个模型,套上一副“马具”,才从会说话变成会干活。

至于AI是怎么运转的,历史学者不必深究Transformer那一套,知道它的脾气就够了。它不是在数据库里检索答案,倒像一位读过海量书报的老先生,一个词接一个词往下续,你起个头,他就顺着讲,所以同一个问题问两遍,答案可以不一样,他也没有“查到”“没查到”一说,只有“接着讲”。他的学问全来自读过的书,可能英文书读得多,中文书读得少;而且书是某年某月之前读的,此后的事他一概不知,却照样讲得煞有介事。这位老先生还被调教得格外殷勤,有问必答,从不肯说“我不知道”,他自己也分不清哪句是记得的、哪句是猜的、哪句是编的,三种话一个腔调,这就是幻觉(Hallucination)的由来。最后是他的案头,行话叫上下文窗口(Context),一次谈话里能摊开的材料就这么多,你把一部书的全文给他,他便靠这部书说话,答得有板有眼,不给,他就凭印象发挥。

用大模型做研究,目前大概有三种方式。最常见的是对话,像智能客服,问一句答一句,有记忆、好上手,适合临时提问、整理想法,但上下文有限,长文得不断重开。稍进阶的是调用API,像自己炒菜,材料、要求、格式配好发过去,每次独立、互不相干,能批量、能固定格式,兼具流程化与工程化。目前更主张尝试智能体,它类似于包工头,你只需要交代目标,它自己规划、拆步骤、调工具。这两年大模型竞争白热化,迭代极快,替人操作电脑的智能体一个接一个。至于选哪个,我的体会是三条:一是长上下文优先,装得下整部书、整个库的,才适合当历史研究的模型,眼下的GLM-5.3,上下文已做到131万词元,故颇受文史研究者青睐;二是涉史料的批处理尽量走国产或本地部署,既是性价比的考量,也能避开一些“莫须有”的麻烦。三是榜单只做初筛,拿自己最难的史料各跑一遍,合不合手,一测便知。不少网友还建议各取所长,如Claude写正文、GPT审逻辑、DeepSeek做摘要、国产跑批量,最后人工把关,这可能也有些道理。

总之,关于历史学与人工智能,我有几个不成熟的观点。其一是AI平等,大模型或Agent并无高低贵贱之分。之前有朋友和我说,“我一直在用WorkBuddy,总被用Codex的人看不起”,我的回应是,你首先得知道这些工具是给谁造的,它们大多为编程和开发而生,服务于各种应用,并不是专门为历史学者设计的;历史学相对复杂的任务,对人工智能来说,可能是较低阶的处理,至少在现阶段,使用者无需“嘚瑟”,也不必自卑。其二是AI为最会教人的老师。现在很多朋友不知道如何让AI与历史学相结合,其实与其到处问人,不如把你的困惑用大白话告诉AI,它会耐心而准确地教你各种使用方法,很快就能上手;事实上也不限于怎么用AI,几乎任何问题它都能教你,这极大地降低了自学的门槛。其三是不必有AI焦虑。曾有朋友问我:“每次有人问你怎么用AI,你都毫无保留,不怕别人超过你吗?”我当时回复:“AI不是什么秘密武器,门槛只会越来越低,很多产品已经开箱即用。现在的情况,就类似于上世纪90年代末,有的人还在手写论文,有的人早已用上了电脑,随着电脑性能的提升和价格的下降,加上大家都学会了五笔或拼音打字,进入新世纪后,很快就都改用电脑写论文了。”其四是要大胆地用起来。历史学界对人工智能的利用仍极为有限,态度甚至可以说是保守,而革命性的变化已经到来,还在不断刷新我们的认知,今天它做不到的,明天很可能就做到了,你不试试,怎知它的奇妙?

二、历史学者正在用人工智能做什么?

人工智能在学术界已经取得了许多瞩目的成绩,其中影响力较大、曝光最多的可能更多是在理工科方面。我每日的推送里,也是这些消息最先刷屏。例如令我印象深刻的有:2024年10月,诺贝尔化学奖颁给了做蛋白质结构预测的科学家,物理学奖落在了神经网络的开创者头上,一年两奖都与人工智能有关,学界为之震动。得奖的功臣AlphaFold,到第三代论文刊于《自然》(Nature),连蛋白质与药物分子之间的相互作用都能预测了;DeepMind的材料模型一口气发现了220万种新晶体;气象模型GenCast在97.2%的预报目标上胜过欧洲中期天气预报中心(ECMWF)的传统集合预报;2025年7月,高级版Gemini参加国际数学奥林匹克竞赛(IMO),达到金牌线。AI甚至还介入了癌症的治疗,默沙东与Moderna宣布,全球首个由AI设计的个性化癌症疫苗闯过了三期临床,算法从患者的肿瘤测序数据里挑出最可能引发免疫反应的新抗原,一人一针,配上免疫疗法,二期试验里把黑色素瘤复发或死亡的风险降了近一半……这让我想到一句话“隔行如隔山,AI却好像无山不翻”。

回到历史学研究,这种“出圈”的成果似乎不多。原因是多方面的,DeepMind政策团队有篇长文《猜想机器》(Conjecture Machines),把这件事说得较为透彻:AI提猜想,又快又便宜;验证猜想,仍然要靠实验室、设备和制度性的审查,用原文的话说,“反驳依然是物理的、制度的”,因而昂贵而缓慢。不过,理工科的验证回路再慢,也是闭合的,预报可以拿实测对照,新材料可以合成出来验证,考题和标准答案都在那里。历史学不太一样,史料是稀缺的、一次性的,普查不会再做一遍,证人很少再讲一遍,没有海量带标注的练习题;也没有天然的标准答案,古文献缺的那个字,谁也没法对答案;这门学科要的是解释,而AI的训练目标,往往都指向预测;史料解读很讲究“语境”,大模型又习惯于时代错置,拿今天的语感读前朝的文书,恰是历史研究所忌讳的。

通过与其他学科的对比,我们大致看清了历史学在人工智能时代的特征。那么这几年,学界到底拿AI做了些什么?在长期跟踪阅读相关研究,并结合自己使用实践的基础上,我认为先要弄明白的,是历史学者为什么要用AI,目的是什么。历史学研究日渐“科学化”,有着漫长而大同小异的环节和流程,引入任何新工具,无非是想减少重复低效的基础劳动,把时间和精力集中到思考和论证上去。至于研究本身,目的大概有二,一是尽可能还原历史,考据之学是典型;二是得出新的历史解释,这也是如今绝大多数研究者的写作所追求的。总而言之,历史学研究的终极目标,是为人类提供可信的回忆,并创造新的知识。目前历史学者对人工智能的种种用法,大体都没有偏离这个目标。而AI还在一路进步,它对历史学的影响,正是先改变最基础的前端环节,再一步步渗入更靠后的流程。

人工智能并非一夜兴起,早在ChatGPT出现以前,历史学者就已经在用计算机做研究。其中较具代表性的是二十世纪五六十年代,历史学者重算美国奴隶制的经济账,动用计算机评估铁路对美国经济增长的贡献,计量史学名噪一时,也从此争议不断。那时候几乎没人想过让机器理解历史,只指望它把史料收拾整齐。因而用力最集中的仍是史料环节,较初阶的是多元史料的数字化与识别;稍微进阶一些,则是引入其他学科的方法,如用GIS处理历史地理,用社会网络分析做关系史。待史料积累到相当规模,便有学者着手开发定制系统、建立数据库,譬如1990年代弗吉尼亚大学的“山谷计划”(Valley of the Shadow),把南北战争时期一南一北两个县的家信、日记、报纸统统搬上网;2003年上线的“老贝利在线”(Old Bailey Online),则把伦敦中央刑事法院自1674年以来的庭审记录做成全文可检的数据库。当然,最为中国学界熟知的,应数海外汉学研究者牵头开发的CBDB(中国历代人物传记资料库)、MARKUS古籍标注平台和“虚拟上海”(Virtual Shanghai)等。到了2010年代,数字人文进入爆发探索期,学界已不满足于“把纸变成数据”,开始从检索走向计算,从计算走向知识图谱,大规模文本挖掘蔚然成风,一时间涌现出众多以数字人文为名的项目。如谷歌把数百万册扫描图书做成词频曲线,日本国立情报学研究所的人文开放数据中心(CODH)把江户古文书“くずし字”办成Kaggle识别竞赛,Wevers与Smits则发表《视觉数字转向》(DSH),宣告用神经网络研究历史图像……这股风也吹到了国内,翻检各级社科基金的立项目录,以“数字人文视野下……”为题的课题连年增多。不过数字人文再热闹,门槛依旧相当高,掌握相关技术的人极少,成果也就相对零散。

2022年是重要的分水岭。修复古希腊铭文的Ithaca登上《自然》,证明机器已能在史学的核心工序上与人协作;岁末ChatGPT发布,让大部分历史学者都用得上AI。此后,生成式人工智能(AIGC)异军突起。起初,多数人的用法还停在聊天框里,多半出于好奇,问它各种史学问题,看它答得对不对。也有些学者稍加摸索后,利用其翻译外文史料与论著、古文今译、写Python脚本处理文本、给长论文做摘要、出课堂讨论题。这看似“旧酒新瓶”,只是门槛降低了许多。几乎与ChatGPT问世同时,历史学者坎斯坦纳(WulfKansteiner)便断言这类模型可以替学者生成各类“中间产品”,但“结构上说不了真话”。随后,加州大学圣克鲁兹分校的布林(Benjamin Breen)做了个更具体的试验,在历史课上让ChatGPT搭建历史场景,让学生与虚构角色交谈,课后进行“挑错”,作为一个新形式的史料批判训练。2023年9月,《美国历史评论》组织“人工智能与历史实践”论坛,引起较大反响,这也成为日后相关研究引用率最高的文章之一,当时八位学者各执一词,争论多,结论少,反映出当时的混沌现象。同年10月,斯洛文尼亚的两位研究者以本国中学毕业考试的历史题为底本,测试六个聊天机器人的人文科写作,结果GPT-4最接近及格线,其余全军覆没。在当时看来,AI的功用仍相当有限,它像一位耐心却不太可靠的助教,流畅有余,只会重组,不会原创。

图片

修复古希腊铭文的Ithaca

不过,很快有学者意识到,历史学研究并非每个环节都需要“原创性”,不妨先让AI做些基础性的杂活。这几年,关于人工智能与历史学结合的宏观讨论不计其数,相关的案例研究最近也开始显现。综合这些文献和自己的使用实践,我认为,目前人工智能对历史研究方式影响最大的关键环节大概有以下几个。

其一是学术史的搜集与整理。学术史是研究的前提,也是学术对话的基础,但它往往也是最耗时的环节之一。无论是前辈学者做卡片,还是我们现在习惯用word文档做学术史编年,几乎都要经过定题、摸库、检索、获取、编年、成文等多个步骤,其中绝大部分都得靠人力劳动,尽管研究者再怎么努力,可能还是会面临搜不全与读不完的困境。AI介入后,这些工序大都可以交给机器。学术史的梳理如今可总结为八步流程,如选题摸底、建立检索矩阵、多路侦察、核验获取、编年入库、读薄、理清学脉、沉淀封装Skill等。这并非纸上蓝图,我已成功试验多遍。谷歌、OpenAI甚至把“深度研究”做成产品,一句指令,模型自己拆题、分头检索、汇成带引文的报告。在现在的研究条件下,学术史回顾理应是全球视野的,无论什么选题,都应弄清谁在做、有何观点、还留什么空间、从何处接入对话,即便题目相近,也能换个视角或挖得更深,研究质量也会有所提升。

其二是史料的搜集与识读。以往要打听到材料藏在哪里并不容易,网上新公布的资料容易错过,海外档案更隔着重洋,得托人、付费、办签证。如今各国馆藏与研究机构陆续把目录或影像挂在官网,AI能替你跨语言检索到它们的存在,再按图索骥发一封邮件,常常不出国门就能看到些研究线索。更有效的是滚雪球,读到一篇相近的论文,AI顺着注释里引用的史料一路追下去,常会有意外之喜。识读方面,早已不是当年的OCR所能概括,现在更常说的概念是手写文本识别(HTR),其背后是自带视觉的多模态大模型,手稿、竖排报刊、多语种档案都能直接看图认字。据评估,谷歌的Gemini在历史文献识读上的准确率与稳定性双双领先;开源轻量模型则进一步降低了文献识读成本,如PaddleOCR-VL不到十亿参数就认得一百零九种语言,本地部署不再是难事。落到操作上,一般有三种选择:材料不多时用客户端,把五页档案、几张报纸直接交给带视觉的AI,边认边看原图边精校,这种“人盯着改”的半自动,大概会比全自动可靠;材料成千上万时走API处理,写段简单程序或搭个工作流,读图、调用、存档、按日期页码自动命名一气呵成,睡前排好任务,一夜醒来便能看到数十万字的文档;涉密或长期项目则本地部署,材料不出自己的机器,更安全可靠些。除此之外,现在的史料类型是多元的,针对录音转文字,人工智能也有所进展,自动语音识别(ASR)技术也被广泛利用,这对口述史料的整理帮助极大。至于这些多元文献的识读准确率,目前学界多有探讨。我的体会是,规整的印刷本、端正的手稿,轻量本地模型足敷使用;潦草的手稿仍得仰仗第一梯队的大模型。

其三是建立个人数据库。以前材料攒多了,惯常的做法是做成Word版长编,按时间或专题排开。但人的精力有限,资料的发现无穷,长编再长也读不完,多半是存着备查。个人建库更是门槛较高,既要会编程,又对软硬件有要求。AI介入后,创造了全新的研究条件,资料它能替你全部读完,建库也无需编程,用大白话说清需求,模型便替你设计字段、写好程序、顺手做个检索界面。至于字段怎么设、档号拆不拆、地名用今名还是旧名,它也给方案,但拍板的仍是你。这条路学界已有诸多实践。我自己陆续做了近十个数据库,最大的一座约2.7亿字,一个SQLite文件尽数装下,全文检索即查即得。库建好只是开始,检索要两层并行,精确匹配保底,语义检索补漏。再利用MCP这类协议把数据库接到对话窗口,它就成了本地的私人知识库,问它问题,先查库再作答,并附上出处,比起漫无目的的通用搜索引擎,它给的是有来源且可追溯的专业知识,甚至能替你把全库读完,从材料里挑出你没想到的问题。

其四是论文写作,这也是目前争议最大的环节。《科学》主编2026年撰文,直言AI正让学术出版“更慢、更差、更贵”;同年一份机器学习顶会的评审被检出两成纯由AI代笔,令学界哗然。最近负责学术论坛收稿的朋友,可能大都遇到过AI稿泛滥的现象?对于该问题,迄今为止学界并无共识,所能确定的几条规则故而大相径庭,如爱思唯尔允许在稿件准备中借力AI,前提是人工核验并如实披露,而波兰的《历史季刊》则禁止以AI生成学术文本、文献综述、论点乃至摘要,未披露使用即视同抄袭,并对编辑和审稿人制定了同样严格的规定。用AI辅助学术写作,如今明显两极分化,一种是“裸用”,仅凭几句指令让模型搜罗全网信息拼出一篇论文,表面齐整,实则错误连篇,其中大量属于学界所说的幻觉,即虚构文献与伪造引文;另一种则把前期工作做足,资料准备充分,指令完备(角色、任务、材料、输出格式、约束),并把相关史料整理为可控的资料库,必要时提前以大规模语料训AI,再人机协同写作,成稿质量便完全不同。行文至此,我突然想起网上流传的一句话:“用不好就是学术不端,用得好便是科研利器”,于此似有几分道理。相关研究也显示,AI在语言准确与写作效率上效果稳定,一旦进入高阶论证与篇章组织,便出现了参差不齐的情况,必须高度依赖人工监督。因此,越接近表达层,AI越成熟;越接近问题与论证,人越不能退出。

其五是成稿之后的审读把关。文章写完,大多人容易陷入“当局者迷”的状态,放进抽屉沉淀一阵再读,能改的仍然有限。请导师朋友看,人情珍贵而反馈一次性,人家也不好意思回回说重话。拿初稿投出去等外审意见,这种代价颇高,往往除了模板一致的退稿信外,难见其他。AI的出现,正让这一局面有所改观。卢森堡大学的数字历史研究中心(C²DH)为《数字历史学刊》(Journal of Digital History)造了一个“证据优先”的AI评审工作区,让模型对来稿的每条史实先找证据再表态,80条真实的编辑判定中,严格答对者占70%,正确或基本正确者占86%,编辑部认为有用者占九成,AI审稿之效,已可概见。受此启发,我“蒸馏”了自己的导师,把与博导多年往来的邮件、他分享的经验文稿与我随堂记下的大量笔记整理入库,再汇入同门相传的备忘录,以及海内外资深学者谈治学与写作的访谈,以导师为主体,制成一位随叫随到的“审稿人”。拿新写的文章请它审,意见之尖锐、风格之相近,令我十分惊讶。

以上五个环节,是按工序拆开来讲,2025年以来,又出现两个新趋向,使得历史学研究的各流程均有所变化。其中影响最大的是智能体(Agent)的流行,你只需下达一份较为详细的指令,它便把此前要一个环节一个环节分别去做的事,自动串成一条流水线。这股风从编程界刮起,2025年因此被称作智能体元年,Claude Code、Codex先后把“替人写代码”做成订阅产品;岁末年初,顶着龙虾标志的开源智能体OpenClaw一夜刷屏,“私人AI助理”的说法广泛流传,号称用手机下指令,就能控制电脑干活。国内厂商随即跟进,如今大部分大模型开发者也上架了配套智能体,因此大部分人都能轻易使用上Agent。历史学这边,最能体现改变的是报刊史料的获取,智能体可以模仿人类的行为登录数据库检索,发现文献后,有全文的抓取全文,没有全文的调看图像并自动截图,送本地或云端OCR,再对所得文字校对排版,产出可直接使用的文本,跑完一轮,它还能反过来报告哪些史料是你库中从未用过的,其中哪些堪称“亮点文献”。学界的相关探索亦不少,牛津团队的Chronos让历史学家用自然语言指挥智能体从扫描档案中批量抽取数据,每一行结果都能回溯到原页,规整的登记簿上近乎全对;普林斯顿团队把HistAgent带上ICML,给模型配齐检索、翻译、OCR等工具去答历史题,成绩远胜裸模型联网作答。数字人文界甚至为此造了新词Agentic DH,主张研究者当AI的指挥者,并对产出负责。2025年以来关于AI与历史学的讨论,智能体确实占去大半篇幅,称之为工作流的爆发,并不为过。

另一个新趋向是历史专用模型开始成批出现。前面说过,大模型的毛病之一是拿今天的语感读史料文献,新一批模型干脆从训练语料下手,隔绝未来。TypewriterLM只读1913年以前的英语,号称杜绝“时间泄漏”;TimeCapsule只吞1800至1875年的伦敦文本,参数并不大;还有经济史团队索性以兰克(Leopold von Ranke)命名自家的Ranke-4B,思路相同。它们的共同设定,是让模型“不知道未来”,把时代错置变成可控的变量。另一路是领域小模型,有学者为东亚古典汉文专门训练的HanmunRoBERTa,一张消费级显卡即可运行,在自家基准上持续胜过通用大模型,较为颠覆认知;奥地利科学院与Mistral合造的古希腊语模型Apollo,经二十位纸草学家、铭文学家与语文学家盲测,77%的补全不逊于人工。这些进展合在一起,反映出一个新变化,历史学者当初对AI的种种疑虑,如时代错置、语感污染、不解古文,正在被逐一解决,而优化者不再只是大厂工程师,研究者开始亲自下场。历史学者与AI,由此不再是单纯的使用者与工具,而进入了相互塑造的新关系。

三、AI的暂时局限与历史学争论

当然,人工智能并非完美无缺,在目前的技术条件下,它仍有很多局限。就我的阅读与亲身经历而言,AI翻车的案例几乎和成果一样多。这些局限要分两层看,一层属于工程技术,如识别还可以再准些、幻觉还可以再少些……我相信假以时日总有办法优化;另一层却源于学科特性,历史学追求解释,回答的是“何以如此”,AI的训练目标指向预测,回答的是“接下来是什么”。两套问答暂时合不到一处,大模型与史学理想中的助手之间,仍有相当距离。

就目前而言,历史学者用AI,用得最多的可能是处理史料,眼下最普遍的局限也与此相关。识读仍不容乐观,潦草的手写体与古文字尤其如此。东南大学等机构2026年在计算机视觉顶会CVPR上发布了MCHDoc基准,以15700多张高清图像测试各家模型,载体涵盖古籍纸、简牍、书法、碑刻、缣帛、甲骨六种。同一个模型,认古籍纸的准确率有56%,认简牍便掉到18.8%。我自己平时处理的多为1949年后的手写档案,规整者尚可,潦草之件的识别率至今很低。而最让研究者无奈的,恐怕还不是识别不出,而是猜着写。AI按其运行原理,总要输出流畅的文字,凭它强大的联想能力,识别史料时会靠猜测补齐空缺,有学者名之曰“流畅化遮蔽”。哪怕你限定了条件,大批量任务中也未必严格执行,最终看到的文本,与原始史料相去甚远。做世界史研究的,还要面对手写的小语种文献,问题只会更严重。有学者测试过乌拉圭的微缩胶卷档案,视觉模型会把档案里的人名悄悄换成常见人名,字符错误率指标毫无波动,语义早已面目全非。文字之外的史料同样如此,耶鲁大学福图诺夫大屠杀证词视频档案的团队用Whisper转写1847份证词,词准确率约85%,但模型习惯把口语“洗”干净,拉迪诺语的证词被按现代西班牙语的拼写“纠正”,“呃”之类的语气词被成批删除,有人统计,仅这一项就删去了近五千次。

AI很难有历史学的“问题意识”。历史学专业的研究生,多半领教过导师的“拷打”:你的问题意识是什么?这实在是个抽象的概念,以我的资历,至今不敢谈什么是问题意识,但我知道这需要长期的历史学训练,读足够多的史料与前人研究,反复琢磨。它的源头,多半是泡在材料里积下的困惑、现实关怀与学术脉络三者的交汇,积累到某一天忽然贯通,那一刻的顿悟,便成了文章的问题与主线。AI的确能把你的资料全部读完,能把你的史料库过上好几遍,也能挑出其中“反常识”的内容,前文说过,智能体甚至能替你从全库材料里挑出“没想到的问题”,可这些大多只能被视为研究线索。斯坦福团队组织过一场大规模的盲评试验,请一百多位研究者比较AI与人类专家各自提出的研究点子,结果出人意料:AI的点子竟被评为更新颖,但细看便露馅,这些点子彼此高度雷同,可行性也明显偏弱。这虽不是直接以历史学科为测试对象,但道理基本相通,点子可以批量生成,困惑无法凭空捏造。从线索到问题这一跃,AI暂时还跨不过去。

更深一层的局限,是AI读不懂史料背后的逻辑。年轻学者大都挨过这样的批评:“你的论文完全跟着档案走,你成了史料的傀儡!”话虽尖锐,却有其理,资深学者之所以一眼看穿,是因为他们阅档无数,深知史料的表达与历史的真实未必一致。档案写得堂皇,背后可能是另一回事。如果不理解,现在回顾一下,关于你自己的纸面记载、你眼前的新闻,是不是与现实总有出入?所以史学训练的第一课,从来不是急着问史料写了什么,而是先问它是怎么生产出来的,谁写的,给谁看,为何这样写,背后是怎样的权力与利害?AI恰恰短在这一环,它读史料,纸面怎么写它就怎么信,写出的历史跟着史料的立场走。它或能凭大模型的知识挑出时间、制度、官职一类的硬伤,却不知道这份史料为何被如此制造。还有一层是名实之辨,史料中的名词往往名不副实,有婉辞,有蔑称,有行话,还有同一名目下的不同实物。书写者受方言与文化程度所限,又留下满纸错字。别国的史料我不敢妄言,中文史料里这类例子比比皆是。而AI一旦在源头理解错了,很难在后续环节自我纠正,识错一个字,检索便归零。名实一错,抽取、统计、解释节节皆偏,错误沿着工作流一路传下去。美国学者安德伍德(Ted Underwood)测过各模型对1831至1930年间英语语境的把握,没有一个能令人信服地表征那个时代的词义与用法。年轻学者做史料的傀儡,尚可点醒;AI做傀儡而不自知,才是真麻烦。也正因如此,史学才要向人类学、社会学学习,一再强调走向田野。书斋里难解的现实语境,田野里能看到资料的另一副面相。何况史料上的涂改、报刊的油墨与纸张,人手可以摩挲,上海的用料与小小县城的用料之别,背后牵着印刷业的资本与权力,这些隔着屏幕的AI基本无法感知。

历史学者对AI的运用,可能还会影响历史书写。以档案为例,它多是官方机构的产物,生产时就有刻意的筛选,能留下纸面记录的,基本又是识字群体与精英。那些不识字的、编户齐民之外的人,很少被记录,古今中外大抵如此。历史学者并非不知道这件事,近代以来的史学早就不甘为帝王将相作家谱,如今的历史人类学、社会史、口述史、微观史,一代代学者想方设法研究历史中的普通人,只是相关材料并不好获取。到了AI时代,这个困难并未得到更好的解决,反而可能生出新的变数。眼下被大量OCR的资料,基本是成色较好的报纸与档案,很少见到民间契约文书一类更基层的材料,这既因为它们散藏四方且开放有限,也因为笔迹杂乱,难以批量识别。在今后的历史研究中,好认、好调用的材料可能会被一用再用,未开放的档案、难认的手稿、方言里的声音,连同没留下多少文字的普通人,在新环境里再一次被边缘化。因而有学者将之称为“算法沉默”(algorithmic silence),AI不是在制造偏见,而是在继承和放大档案里固有的偏见,底层工人的记录本就碎片化,算法的检索反倒可能进一步降低它们被发现的几率。从前决定谁能被记住的,是哪些史料被保存,往后恐怕得看哪些数据被喂给了机器。

还有一些局限,不像认不出字那样显眼,无法逐一展开,挑几条我实践中印象最深的来说。第一个是黑箱问题,传统史学研究有清晰的工序,找资料、整理资料、写成论文,文章里的每一条史实和解释,基本都能回溯到具体的史料与作者的思路。AI不一样,你喂给它材料,它的确能交出一段流畅的文字,甚至一篇像模像样的论文,可它是怎么从材料走到结论的,谁也看不见,也没法回溯。第二个是难以复现,模型几个月就换一代,闭源开源都一样,提示词差一个字,结果可能就变。如今已有期刊和出版社要求作者留存提示词与生成记录备查,写作时若没留底,事后便很难复原。第三个是地基不稳,你赖以工作的OCR工程、云端模型,背后或是公司,或是资助,公司会关门,资助也会中断,整条流程跟着塌,譬如HathiTrust研究中心运营了十五年,最近资助一撤,说停就停,令人扼腕。第四个是取舍与立场,面对互相抵牾的史料、针锋相对的学界分歧,AI难作裁决,它擅长讲一个听起来合理的故事,不擅长在冲突的叙事之间做判断。其立场也未必中立,有团队挑了21项至今归属存疑的发明,用12种语言去问11个模型,共得七万多条回答,结论是用哪种语言提问,答案便偏向哪种语言保存的叙事。第五个是稳定性,大批量资料喂进去,上下文一长便出故障。做党史、国史、战争史等研究的同行大概都有体会,即便处理最基本的史料,也可能因“敏感词”问题而中断任务。这并非我们独有,美国马里兰大学的团队让大模型归纳枪击暴力幸存者的访谈,44%的请求被护栏拒绝,部分受访者最高65%的经历因此没能进入分析。AI介入历史学的局限,肯定不止这些,限于我的学识与实践,眼下只能举出这几条较为明显的。需要说明的是,技术迭代极快,今天的局限,也许明天就解决了。

AI介入历史学研究,进展与局限并存,争论也随之而起。生成式人工智能问世之初,学界的争论集中于“AI到底能不能取代历史学家”。学者们做了不少试验,限于当时的技术条件,形成了一个较为明显的共识:AI无法取代历史学家。只是各家给出的理由并不相同,有说能力不济的,有说责任无处安放的,也有说价值不该让渡的。而如今大模型月月迭代,智能体又已登场,AI切实进入了大部分历史学者的日常,再争论这些“能不能”,意义已经不大。使用的人越多,争论的点自然也越多。眼下的论战,大概集中在这几点:AI能不能当历史学家,它讲的历史可不可信,方法该跟着怎么改,学生的基本功该怎么教,成果该怎么认定,语料该归谁所有,还有谁的饭碗先被端走……这些争论并非一成不变,有的很快会有令人信服的答案,有的将长期悬而未决,成为史学研究的热点话题。而随着探索深入,新的争论还会不断冒出来。争论固然意味着迷茫与未知,却也映照出全球历史学者的积极探索。创新不停,争论不止,这对任何一行都是好事,历史学也不例外。

四、AI史学在中国

以上许多例子多取自海外,中国的情况又如何?说回我开头提到的那个研讨会,9月19日,广州东郊,第十三届青年史学家论坛开幕,今年的主题索性就叫“数智史学的应用与创新”。69篇青年学者的论文,过半与人工智能有关:有人给清史造智能体,有人用大语言模型量化分析唐代墓志,有人让AI释读古埃及文献,有人专门讨论人工智能与上海史研究的方法论转向,还有人用生成式AI重建中世纪英格兰的庄园档案库。这场会议几乎是中国史学界与AI关系的一次集中亮相。这说明中国学者并不甘于旁观,也在积极投入其中。

事实上,中国史学界与计算机的缘分,同样不始于ChatGPT。早在上世纪九十年代,大型古籍数据库便已起步,约二十年前,就有学者倡导“E考据”,主张借电子资源介入传统史学,计量史学与数字人文在中国学界同样热闹过,围绕它们的学理交锋,许多延续至今。

生成式人工智能问世之初,最先作出反应的,是国内那批做过数字人文的学者。不过最早响起讨论的地方不是学术期刊,而是微信公众号这类自媒体,这也是中国的特征之一。随后澎湃新闻等媒体组织了多轮笔谈,《探索与争鸣》这类敏锐的杂志也率先组稿,此后,相关讲座与期刊规定不断涌现。

2024年以来,讨论明显升级。《史学理论研究》2024年第3期组织生成式人工智能专题笔谈;《光明日报》2025年2月10日用一整版刊出立场相反的两文,一篇讲共生共构,一篇泼冷水讲并非无往不利;《历史研究》2025年初新设“人工智能与史学发展”专栏,当年第5期又排开一组笔谈;《史学月刊》同年刊文正式提出“数智史学”,主张以此为历史学自主知识体系的构建方向;《近代史研究》则开出“大数据与近现代史研究”专栏。到2026年初,中国历史研究院期刊方阵公布新一年重点选题,“人工智能与历史研究”赫然在列。据不完全统计,还有相当多的期刊在筹划同类专栏。就在前几天,《中国社会科学》2026年第8期刊出“数智时代历史学的新进展”专题,一次推出《进入人工智能实验室的历史学者》《人工智能赋能史学研究的实践路径与边界反思》《从数据库到智能体》三篇论文。笔谈、专版、专栏、选题指南、专题,一路升级,人工智能从一个需要被解释的新名词,变成了主流期刊普遍认可的重点选题。理论文章之外,一些实践与平台也陆续落地。令我印象最深的有几家,如复旦大学发布的“炎黄”,据称是全球首个聚焦早期中华文明的多模态大模型,古籍、考古图像、历史地理与古DNA一起喂进去;北京大学的“山海璇玑”、安阳师范学院的“殷契行止”、南京农业大学的“荀子”、东北师范大学的满语大模型、南京大学的数智文献处理平台,字节跳动的识典古籍、敦煌的“数字藏经洞”……这些尝试大小不一,路径各异,有的长于研究,有的便于普及。

图片

图片

与全球其他国家相比,中国的人工智能与历史学结合也存在一些独特性。其中较明显的一条是国家工程化驱动,海外的探索大多靠项目申请与基金会资助,而中国不太一样,方向与经费多由顶层设计供给。这条路有利有弊,利的一面有目共睹,如冷门绝学的AI化已渐出成果,前面说的那些大项目与知名平台,多半是这么来的。但也有些代价,如官方课题结项普遍要发核心期刊,而C刊版面紧且周期长,优质而新颖的研究在漫长的流程里迟迟不出,等刊出后,大模型已经换了几代,当初讨论的问题未必成立。中国学界关于人工智能与历史学的成果,看起来为什么这么少?这恐怕是一个重要原因。海外同行用预印本先把结果挂出来,再慢慢走评审,中国史学期刊还没有这样的通道。此外,官方经费一旦停止、课题一旦结项,能接着做下去的还有多少人,谁心里都没底。

还有个特征与学术传统相关,中国目前的AI与历史学探索,仍呈现出一种“文献本位”。欧美长于“远读”与社会科学化分析,中国的力气多花在古籍整理与考据的自动化上,如自动标点、校勘、缀合、校重、识别……这可能也导致断代与学科的失衡,古代史成果斐然,近现代史与世界史的讨论却明显偏冷,缺乏应有的深度。这大概与史料开放程度有关,档案一块最典型,不少机构馆藏动辄以百万卷计,数字化以千万画幅计,而在线可查的只是零头。即便到馆查阅,也常因各种理由受限,更遑论批量下载与机器调用。考古材料可能也类似,发掘报告积压数年是常事。世界史研究较为依赖进口的外文数据库,年费年年看涨,订阅说断就断,还普遍设了下载上限,机器批量分析的难度同样很大。

此外,规范滞后于使用。ChatGPT冲击来临之初,史学期刊普遍沉默,当年的AI使用声明几乎都出自科技与医学类刊物。直到2025年2月,才有历史学期刊发布国内首份史学AI规范,至今跟进的仍不多,真正执行的可能更屈指可数。海外的一些文科期刊,据说已经要求作者在投稿的同时,提供代码、提示词、生成记录等附件。此外,国外还有学者主动撰写《在历史实践中使用生成式人工智能》(Using Generative AI in Historical Practice)等论著,里面不仅分享使用技巧,还尝试提出一些规范,这在某种程度上起到了约束作用。当然,国内外的学术生态不同,本无优劣之分,但应取长补短。

如果长期关注国内成果与动态,可能还会发现一个特征,研究者似乎是“高连续性的小共同体”。翻一翻近年的文章便知,持续讨论AI与历史学的,来来回回不过二三十人,群体稳定,地缘也集中,主要在北京、上海、南京、广州等地。原因自然是多重的,与政策支持和个人兴趣等因素相关。但还有一层值得留意,无论学者个人还是期刊编辑部,对这条探索之路可能仍持观望状态。个人更多还在试用,谈不上写成文章,编辑部心存疑虑,用稿也就谨慎,产出少,研究者自然更不肯投入。

就目前所发表的成果而言,存在理论多而实证少的特点。眼下所见的中文学界相关论文,相当一批还是理论、综述与展望,其讨论仍属于“经验型”,少见以人工智能为工具的实证研究;尤其用新技术研究老问题、并拿出新看法的,屈指可数。之所以推崇后一种研究,是因为学术积淀较深的问题有旧说可对照,最能看出新方法的功用。最近的各类学术论坛较能暴露这一点,会议论文集没有期刊的滞后,但翻开来却仍是宏观讨论居多,再看各文的学术史回顾,引去引回就那几篇,且缺乏对海外学界的关注与对话,这不仅反映出中国学界的研究总数太少,研究质量也有待提升。

还有一个特征,现在看起来似乎不是很明显,但随着人工智能的发展,这个问题可能会更突出,即教育未能跟上研究。我大致梳理了一下,海外关于人工智能与历史学研究的课程,数量已经相当可观,而且有较为成熟的课纲,甚至培养了相关专业的研究生,但在中国,人工智能引入大学历史学课堂,并且传授实质性的方法与进行实践,可能仍然较少。据传,复旦大学历史学系2026年春开过一门,但这样的例子并不多。

五、余论

行文至此,大概要说结论了,但我恐怕很难下什么结论。原因很简单,人工智能仍在快速发展,而大部分文科专业与之结合,尚在探索期,眼下任何急着下的结论,可能很快就会被技术推翻。如果还能再遇到那位送我去机场的司机,哪怕我已经尽可能详细地梳理了人工智能与历史学研究的进展与特征,我仍不敢轻易回答他那句“历史和AI有什么关系”。此时我又想到另一个问题。有人问过我,对于人工智能,你是乐观派还是悲观派?我想,我是乐观与悲观并存吧。

先说乐观。人工智能对历史学的改变是肉眼可见的,它极大地解放了研究者的时间,许多低效的工作可以交由AI处理,很多以前对大部分学者构成巨大障碍的问题,现在算不上障碍了,尤其是在史料的获取、整理与分析一层。研究者便有更多的时间和精力,去做以往不敢做的题目。AI也扩大了学者的知识汲取面。以往我自己很难想象,电脑能每天自动向我“推送”全球最新的研究动态与论著,虽然很多只是碎片化阅读,但对于自己研究的思考,总归有益。总之,在AI的助力之下,历史学研究应该会更为深入。

再说悲观,或者说个人的隐忧。我最先想到的是学术不公可能会加剧。以往有前辈学者说过,研究历史不需要太聪明,有中等智力即可。确实,对很多研究生和青年学者而言,肯花时间精力在上面的,迟早会看到进步、取得成果;经济条件的差异固然一直存在,但那时候更多拼的是勤奋。而如今由于AI的介入,有些名校本地部署了一流的大模型,师生免费使用,token近乎无限,还有些人自费订阅最顶尖的服务,而更多普通学子与年轻学人并没有这种机会。技术上的差距,很快就会传导至学术研究之中。当然,学术不端也可能更多、也更隐蔽。一方面是主动的不端,习惯了AI辅助的人可能依赖捷径,在史学论文的各个环节,尤其撰写环节直接让AI生成,可抄的样本更多,抄袭剽窃的手段也更为精巧。另一方面是被动的,作者未必故意,但AI的幻觉至今十分普遍,已不止编造文献,那很容易核查出来;更隐蔽的是张冠李戴,尤其在学术史回顾里,它把两篇相近研究的观点互相安错,将一篇的论点按到另一篇头上,若非深耕于此、反复核对,很难发现。这虽非作者有意,仍属学术不端的一种。当然,我最担心的还是历史学的课堂。这对很多教师已是巨大的挑战,AI在某种程度上可以替代一些“水课”,也能极大地辅助学生自学,但并非每门课都是水课,也不是每项技术都能靠自学掌握。以我现在的观感,很多人非常熟悉技术,却并不真的懂历史;也有人熟知历史,对新技术的掌握又不足。就现阶段而言,前者的危险可能略大于后者。

最后说几句呼吁。最想说的是,历史学者应该多尝试。无论你还停留在问答式使用,还是已经走向工作流,都应该坚持试下去。先不必高尚地谈推进伟大的历史学研究事业,这至少能让你的好奇心不断得到满足,甚至逐步打开一个新世界。对很多人而言,当年选择历史学这门专业,不就是因为该死的好奇心实在太重了吗?

另外,要多看海外的成果。人工智能与历史学的研究,海外已积累了相当一批,数量远超中文世界,不追着读,讨论很容易变成自说自话。同时,不要只盯着历史学的一亩三分地,多看看其他学科与AI的结合。每个学科各有特性,其他学科在很多地方走得比历史学更远,虽不能直接移植,但某个时候可能会突然给你启发。

还有,历史学者终究要学一点技术。AI虽把编程门槛打了下来,但基本的原理最好还是自学一些。举个例子,这可能事关你的史料安全。最近接连有几件丑闻被用户和媒体曝光:一些AI工具把用户的数据打包上传,我亦是受害者之一,字数庞大的史料库连同未刊稿,都被传了上去。如果当初对技术多懂一些,也许就不会这么被动。最后我想说,在生成式人工智能时代,还是要保持自主的写作。现如今,原汁原味、哪怕错字病句较多的文字,都显得弥足珍贵。

文章标签智能体大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多