在识典古籍,除了"读"古籍,你还可以亲手"校"古籍。由全国高等院校古籍整理研究工作委员会、北京大学数字人文研究中心与字节跳动公益等共同推动的"我用AI校古籍·我是校书官"活动,把 AI 的文字识别与自动标点结果交给普通志愿者逐字核对,再由专家终审把关。下面把这件事的来龙去脉、参与流程、激励机制与真实规模讲清楚——文中所有数字都注明了来源与时间口径,且各来源之间存在差异,具体规则请以官方当期公告为准。
核心要点
- "我用AI校古籍·我是校书官"是依托识典古籍智能整理平台的公益众包项目,2024 年正式开放公众参与。
- 机制是"AI 先初步整理、志愿者对照底本逐字校对、难点提交专家",北大数字人文研究中心副主任杨浩把它比作把"传统手工作坊"变成"流水线工厂"。
- 参与者分初阶组(校对 OCR 结果)与进阶组(文字精校、标点校对);手机端可做基础校对,精细整理更适合电脑网页端。
- 据公开信息,2024 年"我是校书官"至年底累计参与 10129 人,覆盖全国 1300 多所高校。
- 参与设贡献值与文创激励(古籍徽章、校书俑玩偶,最高荣誉"金典典"),是否获奖、如何兑换一律以官方当期规则为准。
- 古籍数字化远未完成:影像化与文本化之间还隔着海量的校对工作量,这正是众包协作的意义所在。
什么是"我用AI校古籍·我是校书官"
识典古籍本身是一个"古籍智能整理数字化平台",也可以理解为一款古籍数字化阅读与整理应用。它由北京大学数字人文研究中心提供学术指导与古籍图文数据,由字节跳动(抖音集团)提供技术与资金支持,是纯公益性质的项目,官方明确"永久免费、没有广告"。
在这个平台上,除了供人阅读,还有一条"整理流水线"向公众开放。平台先把古籍影印本切分、识别成可检索的文本,再自动断句、标注人名地名,然后邀请普通人去核对机器的结果。这条线被赋予了两个名字:偏活动化的是"我是校书官",偏项目化的是"我用AI校古籍"。二者指向同一个内核——让关心传统文化的人,不只当一名读者,也当一次"校书官"。
"校书官"并非凭空造出的时髦词。中国古代设有"校书郎"一类职官,专司典籍校勘整理,刘向、刘歆父子校书的故事更是书林掌故。今天把这个身份交给公众,是把一项古老的手艺,用现代协作的方式重新交到普通人手里。值得注意的是,这条脉络并非今天才有:1930 年代,洪业主持的"引得编纂处"提出古籍要"可检索、可验证、可复用",而今天的众包校对,某种意义上正是那一代学人理想的当代续写。
谁在发起:权威机构、高校与公益力量
从公开信息看,这项活动并非单一公司或单一学校的"自娱自乐",而是由学术机构、高校与公益力量联合推动,因此它既带着学术的严谨,也带着公益的开放。
- 全国高等院校古籍整理研究工作委员会:长期统筹全国高校古籍整理与研究工作的机构,为活动提供方向与学术背书。
- 北京大学数字人文研究中心:提供学术指导、古籍底本与图文数据,并参与组织培训与成果审核。
- 字节跳动公益:提供资金与技术支持,负责平台工程、AI 能力与活动运营。
- 多家古籍研究机构与高校图书馆:共同参与底本供给、任务分发与成果把关。
技术底座是"北京大学—字节跳动数字人文开放实验室"。早在 2022 年 3 月,双方就合作成立该实验室,字节跳动向北京大学教育基金会捐赠,支持古籍数字化工作;同年 4 月,中办、国办印发《关于推进新时代古籍工作的意见》,明确提出"推进古籍数字化"。政策、学术与技术三股力量在同一年交汇,为后来面向公众的校书活动铺好了地基。2024 年 9 月,字节跳动公益与北大数字人文研究中心正式发起"我用AI校古籍"项目,依托识典古籍智能整理平台运行。
"AI+众包":古籍整理为什么需要大众参与
很多人会问:AI 既然能识别古籍,为什么还要人来做?答案是——AI 把"从零到八成"的部分做得又快又好,但从八成到"可以放心引用"的那一段,恰恰最费人力,也最需要人。
据官方披露,识典古籍的三项核心 AI 能力准确率已相当高:文字识别(OCR)约 96%–97%(行业平均约 93%–94%),自动标点约 94%,命名实体识别(识别人名、地名、书名、官职等专名)接近 98%。这些数字意味着机器已经能"看懂"大部分内容,但剩下的海拔最高、最琐碎的部分,仍需人来处理。
所谓"智能+众包",其完整链条大致分三步:
- 第一步:AI 初整理
- 系统把古籍影印图像切分、识别为文本,并自动断句加标点、抽取专名,形成一份"毛坯稿"。
- 第二步:志愿者校对
- 参与者对照古籍底本影像,逐字核对机器结果,改错字、补漏字、纠正标点,把"毛坯"打磨成"可用文本"。
- 第三步:专家把关
- 志愿者拿不准的疑难之处提交专家复审,最终形成可检索、可引用的整理成果。
北京大学数字人文研究中心副主任杨浩有一个生动的比喻:这套流程把古籍整理从"传统手工作坊"变成了"流水线工厂"。作坊式整理,一位学者一辈子也许只能精校几部书;而流水线把工序拆开、把标准统一,让成千上万人各司其职,同一时间可以推进体量惊人的工作量。这就是为什么"整理古籍"这件事,第一次有了邀请大众参与的可能性。
参与方式与流程
对普通参与者来说,路径并不复杂。总的思路是:先有账号,再报名,然后边学边做,做完提交。下面把常见步骤拆开说明。
- 准备账号:电脑端访问识典古籍官网、手机端下载识典古籍应用,用手机号等方式完成登录与注册。阅读和检索本身无需注册,但整理功能需要一个账号。
- 报名活动:关注"我是校书官""我用AI校古籍"的当期招募公告,按公告入口报名;在校大学生通常可通过"到梦空间"应用报名对应的高校专场。
- 学习培训:参加平台提供的入门培训与示例练习,了解校对规范、底本对照方法、标点规则与疑难处理流程。
- 领取并校对任务:对照古籍底本影像,逐字校对 AI 生成的文本,修正识别错误、补齐缺漏、调整标点。初阶任务多在手机端完成,精细整理通常建议用电脑网页端。
- 提交与复核:提交校对结果,由系统与专家进一步复核;被认定有效的贡献将计入个人的贡献值。
初阶组与进阶组:两条不同的参与路线
活动通常把参与者分成两支,任务难度、适合人群与产出各不相同。下表据公开信息整理,仅帮助理解分工,具体分组与任务以官方当期说明为准。
| 对比维度 | 初阶组 | 进阶组 |
|---|---|---|
| 主要任务 | 校对 OCR 识别结果,纠正明显的错字、漏字 | 文字精校与标点校对,处理断句、异体字等更细的问题 |
| 任务难度 | 相对友好,门槛较低 | 更高,需要耐心与一定的文字、文史基础 |
| 适合人群 | 零基础或时间有限的爱好者、学生 | 有文史功底、愿意长期投入的进阶参与者 |
| 常用操作端 | 手机端即可上手 | 更适合电脑网页端/整理平台 |
| 大致产出 | 形成可检索的粗校文本 | 形成质量更高的精校文本,供进一步审校 |
一句话概括:初阶组负责"把明显的错捡出来",进阶组负责"把细处的对错抠清楚"。两支并非高低贵贱之分,而是流水线上的不同工位,缺一不可。新手完全可以从初阶做起,熟悉规范之后再尝试进阶任务。
贡献值与激励:从一枚徽章到"金典典"
为了让长期投入有反馈,活动一般设"贡献值"体系,并配套阶段性激励。据公开信息,常见做法包括:
- 阶梯式奖励:按贡献值或完成任务量分档,逐级解锁对应激励;不同期次的档位设置可能不同。
- 文创纪念:如古籍主题徽章、校书俑玩偶等实体文创,多作为阶段性或里程碑奖励。
- 最高荣誉:据公开信息,贡献达到 1000 小时以上的参与者,有机会获得被称为"金典典"的荣誉奖杯。
- 活动节奏:整理活动常按春季、暑期、秋季等阶段推进,不同阶段的任务与奖励各有安排。
古籍数字化的困境与规模
要理解"众包校书"为什么重要,先要理解古籍数字化的真实进度。据公开信息与学界通行口径,中国现存古籍大约有 20 万种;其中已完成影像数字化的约 8 万种,而真正做成可供检索的文本的,仅有约 3 万到 4 万种。"影像"与"文本"之间隔着什么?隔着的正是海量的校对与整理工作。
影像数字化,相当于把古籍"拍下来",读者看到的是照片,机器还不能直接检索、引用;文本数字化,则是把每一页的字变成可搜索、可复制、可校勘的文字。后者要慢得多,因为每一页、每一行、每一个字都要经过识别与核对。古籍又偏偏以繁体、异体、避讳字与大量生僻字著称,标点、断句、人名地名的判定也处处是坑,单靠算法难以保证质量。
放到更长的时间轴上看,这种协作带来的加速度是明显的:2022 年 10 月,识典古籍网页版测试版上线时首期整理了《四部丛刊》等 390 部经典古籍、共 3000 余万字;到 2026 年初,据公开信息,平台累计上线约 4.7 万部古籍资源,并持续增长。体量在数年间翻了很多倍,其中就包含着众包校对的持续投入。当然,不同来源对各时点的收录量有不同表述,请以官方页面实时显示为准。
也正因如此,校书不是"抢红包",而更像一场接力。它不需要你一次做很多,但需要很多人各自做一点。对古籍来说,多一个认真的校对者,就多一页能放心被检索、被引用的文字。
成果数据:这些年众包"校"出了什么
数字会说话。下表把可核验的公开数据集中列出,并标注来源与时间口径。需要提醒的是,不同来源的统计范围与口径不完全一致,个别数字之间存在差异,请结合来源理解。
| 口径 / 活动 | 参与人数 | 成果规模 | 来源与时间 |
|---|---|---|---|
| "我是校书官"活动 | 上线首月报名破 3000 人;至 2024 年底累计 10129 人,覆盖全国 1300 多所高校 | 粗校古籍 1643 部(超 6 亿字),精校古籍 184 部(2451 万字) | 公开信息,2024 年 |
| "我用AI校古籍"活动 | 据称吸引 3.7 万名志愿者参与 | 完成 15 亿字粗校、2 万部古籍整理 | 百度百科口径,公开信息 |
| 智能整理活动累计 | 累计约 3.8 万人参与(含近 1500 所高校约 2 万名学生与 1.8 万名社会志愿者) | 累计粗校 15 亿字、精校 1 亿字 | 公开信息 |
把这些数字放在一起看,能读出一个清晰的信号:众包校对已经不是小圈子里的"尝鲜",而是形成了可观的规模。上万人、上千所高校、数以亿字计的校对量——这背后是无数普通人在业余时间里一页页核对出来的成果。当然,也要客观看待:"粗校"与"精校"的质量层级并不相同,这些数字体现的是工作量与参与度,并不等同于全部达到了可直接引用的学术标准。
常见问题
参与"我用AI校古籍"需要付费吗?
不需要。识典古籍是公益免费项目,永久免费、没有广告、无内购;阅读与检索无需注册,参与整理功能才需要一个账号。任何以"收费带你校古籍""付费进内部队"为名的说法都值得警惕。
用手机能校对古籍吗?
基础任务在手机端可以完成,但据平台说明,应用早期并不支持古籍整理活动,精细的逐字校勘更适合电脑网页端。因此"校书"通常优先推荐电脑端;具体各端是否开放整理、功能如何,请以官方最新说明为准。
校对古籍需要很强的专业背景吗?
不一定。初阶组主要校对 OCR 识别结果、纠正明显错漏,门槛相对友好,认真参加培训即可上手。若涉及断句、异体字、版本校勘等深层问题,则需要更多文史积累;拿不准的地方可以提交专家复核,不必勉强下判断。
初阶组和进阶组能同时参加吗?
一般建议先从初阶组熟悉规范,再根据个人时间与能力尝试进阶任务。是否允许同期跨组、每组任务如何分配,由活动当期规则决定,报名前留意招募公告即可。
贡献值可以兑换成钱吗?
据公开信息,贡献值对应的是阶梯奖励与文创纪念(如古籍徽章、校书俑玩偶),以及"金典典"这类荣誉,而非常规意义上的现金回报。参与前请勿抱着"做任务赚收益"的预期,一切以官方当期规则为准。
在哪里报名?在校生和上班族有区别吗?
总体入口是识典古籍的网页版或应用,按当期活动公告报名。在校大学生通常可以通过"到梦空间"应用报名高校专场;社会参与者同样可以报名,只是入口与任务批次可能不同。具体以官方公告为准。
校对时遇到拿不准的地方怎么办?
不必硬猜。可以对照古籍底本影像逐字确认,标注存疑并提交,由专家后续复审。这套"志愿者校对—专家把关"的分工,本就是为处理疑难而设计的,提出疑问是负责任的表现。
校对的成果会被公开吗?会署名吗?
整理成果最终用于完善平台上的古籍文本,供公众免费阅读与检索。至于个人署名、贡献展示等细节,不同活动、不同期次的做法可能不同,请以官方当期说明为准,本文不作断言。
普通人能得到什么,以及写在最后
如果抛开"荣誉"与"奖励",一个普通人投入时间去校古籍,究竟能收获什么?这几样是比较实在的:
- 一次真实的学术训练:你会被迫逐字看清每一处异体、每一个标点,这种"慢阅读"的体验,是平常刷屏式阅读给不了的。
- 一种可触摸的文化参与感:古籍不再是书架上的摆设,你亲手改对的一个字,可能正被后来者检索、引用。
- 结识同好:活动聚集了高校学生与社会志愿者,围绕古籍的讨论、答疑与协作,本身就是一个小型的学习社群。
- 耐心与细致:校对是一件反浮躁的事,能坚持下来的人,往往也多了一份对文字的敬畏。
需要客观地说,参与校书并不会让你"一夜成名",也不是一份能带来可观收益的兼职。它更像一种文化志愿行为:你付出的是一点点业余时间,留下的却可能是被长久使用的整理成果。
回望整件事——AI 把古籍整理的门槛降了下来,众包把分散的人力聚了起来,专家把关守住了质量底线。2022 年,政策提出"推进古籍数字化";几年间,平台把数以万计的古籍送上网络;而今,"我用AI校古籍"又把最后一公里的校对,交到了你我的手里。如果你愿意,不妨打开识典古籍,报名做一次校书官,从校对一个字开始。