识典古籍

我用AI校古籍:在识典古籍参与古籍校对与整理的方式

普通人也能当“校书官”。AI 先整理、你来逐字校对、难点交给专家,众包让古籍整理从书斋走向大众。

人人可参与AI+众包高校认可贡献值激励文化传承
🗓️ 更新:2026-10-06 📖 4806 字 📱 适用:多端用户

在识典古籍,除了"读"古籍,你还可以亲手"校"古籍。由全国高等院校古籍整理研究工作委员会、北京大学数字人文研究中心与字节跳动公益等共同推动的"我用AI校古籍·我是校书官"活动,把 AI 的文字识别与自动标点结果交给普通志愿者逐字核对,再由专家终审把关。下面把这件事的来龙去脉、参与流程、激励机制与真实规模讲清楚——文中所有数字都注明了来源与时间口径,且各来源之间存在差异,具体规则请以官方当期公告为准。

核心要点

  • "我用AI校古籍·我是校书官"是依托识典古籍智能整理平台的公益众包项目,2024 年正式开放公众参与。
  • 机制是"AI 先初步整理、志愿者对照底本逐字校对、难点提交专家",北大数字人文研究中心副主任杨浩把它比作把"传统手工作坊"变成"流水线工厂"。
  • 参与者分初阶组(校对 OCR 结果)与进阶组(文字精校、标点校对);手机端可做基础校对,精细整理更适合电脑网页端。
  • 据公开信息,2024 年"我是校书官"至年底累计参与 10129 人,覆盖全国 1300 多所高校。
  • 参与设贡献值与文创激励(古籍徽章、校书俑玩偶,最高荣誉"金典典"),是否获奖、如何兑换一律以官方当期规则为准。
  • 古籍数字化远未完成:影像化与文本化之间还隔着海量的校对工作量,这正是众包协作的意义所在。

什么是"我用AI校古籍·我是校书官"

识典古籍本身是一个"古籍智能整理数字化平台",也可以理解为一款古籍数字化阅读与整理应用。它由北京大学数字人文研究中心提供学术指导与古籍图文数据,由字节跳动(抖音集团)提供技术与资金支持,是纯公益性质的项目,官方明确"永久免费、没有广告"。

在这个平台上,除了供人阅读,还有一条"整理流水线"向公众开放。平台先把古籍影印本切分、识别成可检索的文本,再自动断句、标注人名地名,然后邀请普通人去核对机器的结果。这条线被赋予了两个名字:偏活动化的是"我是校书官",偏项目化的是"我用AI校古籍"。二者指向同一个内核——让关心传统文化的人,不只当一名读者,也当一次"校书官"。

"校书官"并非凭空造出的时髦词。中国古代设有"校书郎"一类职官,专司典籍校勘整理,刘向、刘歆父子校书的故事更是书林掌故。今天把这个身份交给公众,是把一项古老的手艺,用现代协作的方式重新交到普通人手里。值得注意的是,这条脉络并非今天才有:1930 年代,洪业主持的"引得编纂处"提出古籍要"可检索、可验证、可复用",而今天的众包校对,某种意义上正是那一代学人理想的当代续写。

谁在发起:权威机构、高校与公益力量

从公开信息看,这项活动并非单一公司或单一学校的"自娱自乐",而是由学术机构、高校与公益力量联合推动,因此它既带着学术的严谨,也带着公益的开放。

技术底座是"北京大学—字节跳动数字人文开放实验室"。早在 2022 年 3 月,双方就合作成立该实验室,字节跳动向北京大学教育基金会捐赠,支持古籍数字化工作;同年 4 月,中办、国办印发《关于推进新时代古籍工作的意见》,明确提出"推进古籍数字化"。政策、学术与技术三股力量在同一年交汇,为后来面向公众的校书活动铺好了地基。2024 年 9 月,字节跳动公益与北大数字人文研究中心正式发起"我用AI校古籍"项目,依托识典古籍智能整理平台运行。

"AI+众包":古籍整理为什么需要大众参与

很多人会问:AI 既然能识别古籍,为什么还要人来做?答案是——AI 把"从零到八成"的部分做得又快又好,但从八成到"可以放心引用"的那一段,恰恰最费人力,也最需要人。

据官方披露,识典古籍的三项核心 AI 能力准确率已相当高:文字识别(OCR)约 96%–97%(行业平均约 93%–94%),自动标点约 94%,命名实体识别(识别人名、地名、书名、官职等专名)接近 98%。这些数字意味着机器已经能"看懂"大部分内容,但剩下的海拔最高、最琐碎的部分,仍需人来处理。

所谓"智能+众包",其完整链条大致分三步:

第一步:AI 初整理
系统把古籍影印图像切分、识别为文本,并自动断句加标点、抽取专名,形成一份"毛坯稿"。
第二步:志愿者校对
参与者对照古籍底本影像,逐字核对机器结果,改错字、补漏字、纠正标点,把"毛坯"打磨成"可用文本"。
第三步:专家把关
志愿者拿不准的疑难之处提交专家复审,最终形成可检索、可引用的整理成果。

北京大学数字人文研究中心副主任杨浩有一个生动的比喻:这套流程把古籍整理从"传统手工作坊"变成了"流水线工厂"。作坊式整理,一位学者一辈子也许只能精校几部书;而流水线把工序拆开、把标准统一,让成千上万人各司其职,同一时间可以推进体量惊人的工作量。这就是为什么"整理古籍"这件事,第一次有了邀请大众参与的可能性。

参与方式与流程

对普通参与者来说,路径并不复杂。总的思路是:先有账号,再报名,然后边学边做,做完提交。下面把常见步骤拆开说明。

  1. 准备账号:电脑端访问识典古籍官网、手机端下载识典古籍应用,用手机号等方式完成登录与注册。阅读和检索本身无需注册,但整理功能需要一个账号。
  2. 报名活动:关注"我是校书官""我用AI校古籍"的当期招募公告,按公告入口报名;在校大学生通常可通过"到梦空间"应用报名对应的高校专场。
  3. 学习培训:参加平台提供的入门培训与示例练习,了解校对规范、底本对照方法、标点规则与疑难处理流程。
  4. 领取并校对任务:对照古籍底本影像,逐字校对 AI 生成的文本,修正识别错误、补齐缺漏、调整标点。初阶任务多在手机端完成,精细整理通常建议用电脑网页端。
  5. 提交与复核:提交校对结果,由系统与专家进一步复核;被认定有效的贡献将计入个人的贡献值。
一个必须说清的细节:据平台说明,识典古籍应用早期并不支持古籍整理活动——精细的逐字校勘更适合大屏与键盘,因此整理工作长期以网页版/整理平台为主。也就是说,想认真"校书",电脑端往往比手机更合适。各端功能如何、是否开放整理,请以官方最新说明为准。

初阶组与进阶组:两条不同的参与路线

活动通常把参与者分成两支,任务难度、适合人群与产出各不相同。下表据公开信息整理,仅帮助理解分工,具体分组与任务以官方当期说明为准。

对比维度初阶组进阶组
主要任务校对 OCR 识别结果,纠正明显的错字、漏字文字精校与标点校对,处理断句、异体字等更细的问题
任务难度相对友好,门槛较低更高,需要耐心与一定的文字、文史基础
适合人群零基础或时间有限的爱好者、学生有文史功底、愿意长期投入的进阶参与者
常用操作端手机端即可上手更适合电脑网页端/整理平台
大致产出形成可检索的粗校文本形成质量更高的精校文本,供进一步审校

一句话概括:初阶组负责"把明显的错捡出来",进阶组负责"把细处的对错抠清楚"。两支并非高低贵贱之分,而是流水线上的不同工位,缺一不可。新手完全可以从初阶做起,熟悉规范之后再尝试进阶任务。

贡献值与激励:从一枚徽章到"金典典"

为了让长期投入有反馈,活动一般设"贡献值"体系,并配套阶段性激励。据公开信息,常见做法包括:

请务必以官方当期规则为准:贡献值如何计算、奖励如何兑换、名额与门槛如何设定,均由活动方每期公布。本文只做机制层面的介绍,不构成任何承诺,也不承诺任何收益。

古籍数字化的困境与规模

要理解"众包校书"为什么重要,先要理解古籍数字化的真实进度。据公开信息与学界通行口径,中国现存古籍大约有 20 万种;其中已完成影像数字化的约 8 万种,而真正做成可供检索的文本的,仅有约 3 万到 4 万种。"影像"与"文本"之间隔着什么?隔着的正是海量的校对与整理工作。

影像数字化,相当于把古籍"拍下来",读者看到的是照片,机器还不能直接检索、引用;文本数字化,则是把每一页的字变成可搜索、可复制、可校勘的文字。后者要慢得多,因为每一页、每一行、每一个字都要经过识别与核对。古籍又偏偏以繁体、异体、避讳字与大量生僻字著称,标点、断句、人名地名的判定也处处是坑,单靠算法难以保证质量。

这正是"AI + 众包"被寄予厚望的原因:AI 把工程量最大、最机械的部分扛下来,把最需要人的判断那一小段交给大众与专家。于是,"整理古籍"从少数人皓首穷经的事业,变成了可以众人拾柴、日积月累的长期工程。

放到更长的时间轴上看,这种协作带来的加速度是明显的:2022 年 10 月,识典古籍网页版测试版上线时首期整理了《四部丛刊》等 390 部经典古籍、共 3000 余万字;到 2026 年初,据公开信息,平台累计上线约 4.7 万部古籍资源,并持续增长。体量在数年间翻了很多倍,其中就包含着众包校对的持续投入。当然,不同来源对各时点的收录量有不同表述,请以官方页面实时显示为准。

也正因如此,校书不是"抢红包",而更像一场接力。它不需要你一次做很多,但需要很多人各自做一点。对古籍来说,多一个认真的校对者,就多一页能放心被检索、被引用的文字。

成果数据:这些年众包"校"出了什么

数字会说话。下表把可核验的公开数据集中列出,并标注来源与时间口径。需要提醒的是,不同来源的统计范围与口径不完全一致,个别数字之间存在差异,请结合来源理解。

口径 / 活动参与人数成果规模来源与时间
"我是校书官"活动上线首月报名破 3000 人;至 2024 年底累计 10129 人,覆盖全国 1300 多所高校粗校古籍 1643 部(超 6 亿字),精校古籍 184 部(2451 万字)公开信息,2024 年
"我用AI校古籍"活动据称吸引 3.7 万名志愿者参与完成 15 亿字粗校、2 万部古籍整理百度百科口径,公开信息
智能整理活动累计累计约 3.8 万人参与(含近 1500 所高校约 2 万名学生与 1.8 万名社会志愿者)累计粗校 15 亿字、精校 1 亿字公开信息

把这些数字放在一起看,能读出一个清晰的信号:众包校对已经不是小圈子里的"尝鲜",而是形成了可观的规模。上万人、上千所高校、数以亿字计的校对量——这背后是无数普通人在业余时间里一页页核对出来的成果。当然,也要客观看待:"粗校"与"精校"的质量层级并不相同,这些数字体现的是工作量与参与度,并不等同于全部达到了可直接引用的学术标准。

常见问题

参与"我用AI校古籍"需要付费吗?

不需要。识典古籍是公益免费项目,永久免费、没有广告、无内购;阅读与检索无需注册,参与整理功能才需要一个账号。任何以"收费带你校古籍""付费进内部队"为名的说法都值得警惕。

用手机能校对古籍吗?

基础任务在手机端可以完成,但据平台说明,应用早期并不支持古籍整理活动,精细的逐字校勘更适合电脑网页端。因此"校书"通常优先推荐电脑端;具体各端是否开放整理、功能如何,请以官方最新说明为准。

校对古籍需要很强的专业背景吗?

不一定。初阶组主要校对 OCR 识别结果、纠正明显错漏,门槛相对友好,认真参加培训即可上手。若涉及断句、异体字、版本校勘等深层问题,则需要更多文史积累;拿不准的地方可以提交专家复核,不必勉强下判断。

初阶组和进阶组能同时参加吗?

一般建议先从初阶组熟悉规范,再根据个人时间与能力尝试进阶任务。是否允许同期跨组、每组任务如何分配,由活动当期规则决定,报名前留意招募公告即可。

贡献值可以兑换成钱吗?

据公开信息,贡献值对应的是阶梯奖励与文创纪念(如古籍徽章、校书俑玩偶),以及"金典典"这类荣誉,而非常规意义上的现金回报。参与前请勿抱着"做任务赚收益"的预期,一切以官方当期规则为准。

在哪里报名?在校生和上班族有区别吗?

总体入口是识典古籍的网页版或应用,按当期活动公告报名。在校大学生通常可以通过"到梦空间"应用报名高校专场;社会参与者同样可以报名,只是入口与任务批次可能不同。具体以官方公告为准。

校对时遇到拿不准的地方怎么办?

不必硬猜。可以对照古籍底本影像逐字确认,标注存疑并提交,由专家后续复审。这套"志愿者校对—专家把关"的分工,本就是为处理疑难而设计的,提出疑问是负责任的表现。

校对的成果会被公开吗?会署名吗?

整理成果最终用于完善平台上的古籍文本,供公众免费阅读与检索。至于个人署名、贡献展示等细节,不同活动、不同期次的做法可能不同,请以官方当期说明为准,本文不作断言。

普通人能得到什么,以及写在最后

如果抛开"荣誉"与"奖励",一个普通人投入时间去校古籍,究竟能收获什么?这几样是比较实在的:

需要客观地说,参与校书并不会让你"一夜成名",也不是一份能带来可观收益的兼职。它更像一种文化志愿行为:你付出的是一点点业余时间,留下的却可能是被长久使用的整理成果。

回望整件事——AI 把古籍整理的门槛降了下来,众包把分散的人力聚了起来,专家把关守住了质量底线。2022 年,政策提出"推进古籍数字化";几年间,平台把数以万计的古籍送上网络;而今,"我用AI校古籍"又把最后一公里的校对,交到了你我的手里。如果你愿意,不妨打开识典古籍,报名做一次校书官,从校对一个字开始。

识典古籍我用AI校古籍我是校书官古籍校对古籍整理众包协作AI古籍文化传承