❌

阅读视图

「吾与点」| 使用攻略(二):创建数据集、知识库、智能体和小程序

PKUDH 2026-09-30 20:30 北京

「吾与点」是由北京大学数字人文研究中心研发的人文智能平台。我们希望做的,是把 AI 真正放进人文研究的实际工作流中:从材料整理、信息抽取,到知识组织、智能问答和可视化展示,让研究者能够更高效地处理和使用自己的研究资料。

最近,我们对「吾与点」进行了一次比较大的升级——3.0 版本正式上线啦!

这次更新不只是界面变化,而是围绕研究过程中的几个关键环节,对平台能力进行了进一步补充和强化。主要包括:

标注环节引入智能体与外部知识库注入

在标注过程中,研究者可以结合智能体能力与外部知识库,辅助完成信息识别、抽取与标注。

新增并强化知识图谱能力

标注项目、数据集和知识库现均支持图谱化组织与展示,并可借助智能体辅助完成实体识别、关系抽取与知识组织。

增加项目完整导入与导出功能

支持项目整体迁移、备份与复用,便于研究成果在不同阶段持续管理和使用。

小程序与问答智能体支持模型切换

在小程序和问答智能体中,研究者可以根据不同任务需求选择和切换模型,使用方式更加灵活。

2.0 版本停止更新

后续功能迭代与使用体验将主要围绕 3.0 版本持续完善。

为便利大家更系统地了解新版「吾与点」的功能与使用方式,我们将分两期进行介绍,并结合《明代名人传》、历代瓷器图像、《屈原贾生列传》与《朝鲜王朝实录》四个案例,展示不同类型的研究材料如何在平台中被整理、组织,并进一步进入研究应用。

在上一期中,我们介绍了如何借助「吾与点」,将大段连续文本、图片等不同类型的研究材料,一步步整理为结构化数据与知识图谱。

当原本分散在不同材料中的人物、地点、事件与关系逐渐变得清晰,一个新的问题也随之出现:整理好的数据,接下来还能做什么?

对于研究者来说,数据的结构化并不是终点。随着研究不断深入,我们往往需要将整理好的内容进一步汇聚成数据集,围绕特定主题建立可持续积累和检索的知识库;也可以基于已有研究资料搭建专属智能体,辅助后续研究;甚至进一步将研究成果转化为更直观、更易传播的可视化小程序。

从“整理资料”到“组织数据”,再到“使用数据”,研究材料可以逐渐从静态的信息记录,转变为能够被检索、关联、分析和展示的研究资源。

这一期,我们从结构化数据继续出发,看看如何在「吾与点」中进一步构建数据集、知识库与智能体,并将研究成果转化为可交互的可视化小程序。

PART1 数据集-知识库-智能体

步骤1:创建数据集

打开【数据集】页面,选择【创建数据集】或【导入数据集】。

选择【创建数据集】时,填写数据集名称,并选择【表格数据集】或【图数据集】。

在【选择数据源项目】中,关联前期已整理好的结构化数据。

补充描述、标签等信息后,点击【创建】。

如已有数据文件,也可选择【导入数据集】,上传文件并填写基本信息。

设置数据集权限后点击【导入】,即可完成数据集创建。

点击【数据浏览】,进入数据浏览页面。

通过【简单筛选】,可在所有字段中快速检索相关信息。

需要精确查找时,切换至【高级筛选】,按不同字段设置筛选条件。

点击【智能搜索】,进入智能搜索页面。

根据需要选择【混合搜索】【语义搜索】或【全文搜索】,即可快速定位数据集中的相关内容。

步骤2:创建知识库

数据集主要建立在前期整理好的结构化表格之上,用于集中管理一组相对独立的数据;知识库则是在数据集基础上的进一步整合,可将上一步创建的数据集与其他相关数据集关联起来,形成一个围绕特定研究主题或研究任务的资料集合。

操作时,打开【知识库】页面,点击【创建知识库】。

填写知识库名称和描述等信息,并设置【私有】或【公开】权限。

在【选择数据集】中关联前一步创建好的数据集,根据需要设置主题样式后,点击【创建知识库】。

创建完成后,进入【数据浏览】,可通过【简单筛选】或【高级筛选】快速查找知识库中的数据。

点击【智能搜索】,根据需要选择【混合搜索】【语义搜索】或【全文搜索】。

输入检索内容,并设置结果数量,即可在知识库中快速定位相关信息。

步骤3:创建智能体

打开【智能体】页面,点击【创建智能体】。

填写智能体名称和简介等信息,并设置【私有】或【公开】权限。

根据需要关联已有【知识库】和【数据集】,作为智能体的知识来源。

设置开场白和预置问题,并选择主题样式,完成后点击【创建智能体】。

进入智能体对话页面,在聊天框中输入问题,即可基于关联数据进行智能问答。

对话支持文字、图片输入,并可在左侧查看和继续历史对话。

数据集-知识库-智能体成果展示

以“历代瓷器图像”项目为例,前期整理好的结构化表格可以进一步建立为数据集,用于对研究数据进行统一管理、浏览与检索。在此基础上,还可以将已有数据集与其他相关数据集、原始资料进一步整合,形成面向特定主题或研究需求的知识库,为具体研究目标提供更集中、更系统的资料支持。进一步地,还可以基于这些数据与知识搭建专属智能体,通过自然语言提问,辅助研究者调用和分析已有研究资料。

PART2 可视化小程序

步骤1:新建小程序

打开【小程序】页面,点击【新建小程序】。

填写小程序名称、描述等信息。

根据使用需求,将小程序设置为【私有】或【公开】。

按需添加标签,并关联已有的【数据集】和【知识库】。

确认配置后,点击【创建小程序】,进入后续搭建与编辑页面。

步骤2:用自然语言描述小程序需求

进入小程序编辑页面,在输入框中用自然语言描述页面布局、功能和数据展示需求。

如有参考材料,可点击【附件】上传图片或文件,辅助说明需求。

根据任务需要选择合适的 AI 模型,确认后开始生成小程序。

生成后可继续通过自然语言提出修改要求,逐步调整页面样式、功能和交互。

完成后可保存版本,并通过预览功能查看小程序效果。

步骤3:实时预览并持续调整

在左侧输入框中继续用自然语言描述需要调整的内容。

右侧【实时预览】会同步展示当前小程序的生成效果。

根据预览结果,继续调整页面布局、功能、数据展示方式和视觉样式。

每次提交新的需求后,系统会更新小程序,并同步刷新预览,直到效果符合需求。

步骤4:打开小程序并分享成果

完成小程序制作后,进入小程序详情页面。

可点击【打开】直接查看小程序,也可以扫描页面中的二维码进行访问。

如需分享,可点击【复制链接】,将小程序访问地址发送给其他用户。

也可以直接分享【二维码】,方便他人扫码查看和使用小程序。

可视化小程序成果展示

以“历代瓷器图像”项目为例,整理后的研究数据可以进一步转化为可视化小程序,以更直观的方式呈现研究成果。小程序围绕瓷器图像与相关信息,设置【叙事观展】【藏品探索】【时代脉络】【关系图谱】等模块,既可以按专题浏览具体藏品,也可以从时代、纹样、器型及其关联关系等不同维度展开探索。

除“历代瓷器图像”外,我们还基于《明代名人传》制作了另一款可视化小程序,用于呈现人物关系与地理分布等研究信息。「吾与点」平台为小程序生成固定URL,可在全网开放访问:

历代瓷器图像

https://app.wuyudian.net/mp/porcelain-miniprogram-1788414898675

《明代名人传》

https://app.wuyudian.net/mp/miniprogram-1763708735626

这些案例也展示了「吾与点」小程序在研究场景中的更多可能:不仅可以将数据转化为更直观的浏览与查询界面,还可以根据研究内容自动构建社会网络交互、地理分布视图、统计图表、关系图谱、时间脉络等多种可视化应用。

研究者无需从零搭建复杂的可视化系统,就可以围绕自己的数据和研究问题持续调整页面与功能,让小程序成为连接数据整理、分析探索与成果展示的研究助手。

通过这种方式,原本以表格和文本形式存在的数据,被转化为可浏览、可查询、可关联的可视化研究成果,既方便研究者进一步分析,也有助于研究内容的展示与传播。

「吾与点」

为人文研究者和文化机构提供

专业、先进、便捷的生产力工具

让智能服务人文

阅读原文

跳转微信打开

  •  

「吾与点」升级到3.0啦!| 使用攻略(一):大段连续文本,如何一步步整理成结构化数据与知识图谱?

PKUDH 2026-09-24 19:00 北京

「吾与点」是由北京大学数字人文研究中心研发的人文智能平台。我们希望做的,是把 AI 真正放进人文研究的实际工作流中:从材料整理、信息抽取,到知识组织、智能问答和可视化展示,让研究者能够更高效地处理和使用自己的研究资料。

近期,我们对「吾与点」进行了一次比较大的升级——3.0 版本正式上线啦!

这次更新不只是界面变化,而是围绕研究过程中的几个关键环节,对平台能力进行了进一步补充和强化。主要包括:

标注环节引入智能体与外部知识库注入

在标注过程中,研究者可以结合智能体能力与外部知识库,辅助完成信息识别、抽取与标注。

新增并强化知识图谱能力

标注项目、数据集和知识库现均支持图谱化组织与展示,并可借助智能体辅助完成实体识别、关系抽取与知识组织。

增加项目完整导入与导出功能

支持项目整体迁移、备份与复用,便于研究成果在不同阶段持续管理和使用。

小程序与问答智能体支持模型切换

在小程序和问答智能体中,研究者可以根据不同任务需求选择和切换模型,使用方式更加灵活。

2.0 版本停止更新

后续功能迭代与使用体验将主要围绕 3.0 版本持续完善。

为便利大家更系统地了解新版「吾与点」的功能与使用方式,我们将分两期进行介绍,并结合《明代名人传》、历代瓷器图像、《屈原贾生列传》与《朝鲜王朝实录》四个案例,展示不同类型的研究材料如何在平台中被整理、组织,并进一步进入研究应用。

在学术研究中,研究者面对的,往往是大量未作处理的原始材料。可能是一部人物传记、几百页史料,一批档案、论文、PDF,甚至还有图片、Excel和不同来源的数据。材料很多,但格式各异、信息分散,真正与研究问题相关的内容,往往隐藏在大量连续文本和非结构化资料中。

面对纷繁复杂的研究资料,研究者通常会围绕自己的研究问题反复阅读、筛选和整理:哪些信息值得关注?哪些人物、地点或事件需要记录?不同材料之间又存在怎样的联系?

当材料数量越来越多,尤其面对大段连续文本和成百上千页的 PDF 时,这种依靠人工逐条梳理的方式往往十分耗时。AI的出现,让批量阅读、信息识别和初步整理变得更加高效,但研究问题是什么、需要提取哪些信息、数据应该如何分类,仍然需要由研究者决定。

在「吾与点」中,以上问题可以通过一种更清晰的人机协作方式来解决:研究者负责提出研究问题、定义数据标准,AI则辅助完成大规模材料的识别、抽取与整理。这样既能提高材料处理效率,也能保留研究者对研究对象、分类方式和最终结果的判断权。

本期,我们就从实际研究材料出发,看看如何借助「吾与点」的多模态智能表格与知识图谱功能,对大段连续文本进行整理与组织。

PART1 多模态智能表格

步骤1:图像文字识别

点击【新建任务】,进入任务编辑页面。

选择【导入图片】,批量上传需要处理的 PDF 材料。

上传完成后,选择AI生成单元格,提取 PDF 页面中的文字内容。

导出文本时,右键选择【导出图像文本为文件】。

导出格式选择【TXT(纯文本)】,即可获得后续数据整理所需的文本材料。

步骤2:项目表格配置

进入【我的项目】页面,点击【新建项目】,创建多模态智能表格项目,也可直接导入已有项目。

进入【表格配置】,根据研究问题设置需要提取的字段及字段类型。

根据任务复杂度,可选择【简单模式】、【高级模式】或【智能体模式】配置 AI 生成规则。

图片材料的处理步骤基本与文本类似。

在表格中增加【图片】字段,完成字段配置后批量导入图片。

步骤3:导入已有数据&AI生成所需字段

完成表格配置后,新建或导入任务,并将原始文本导入对应字段。

材料导入完成后,即可调用 AI 按照预设字段批量识别、提取并生成所需信息。

步骤4:导出结构化数据

点击【导出项目】,进入项目导出页面。

根据后续使用需求,选择合适的导出格式,如 CSV、TSV、XLSX 等。

确认导出内容与数据版本后,点击【开始导出】。

导出完成后,即可获得整理后的结构化数据,用于后续分析、共享或进一步研究。

结构化数据成果展示

分别以《明代名人传》中的大段连续文本和历代瓷器图片及相关文本内容为原始材料,借助「吾与点」提取人物及人物关系信息、器物名称与属性信息,并整理为可进一步分析的结构化数据表。

PART2 知识图谱

步骤1:新建知识图谱项目

进入【项目列表】,点击右上角【新建项目】。

填写项目名称,并根据需要补充项目描述和标签。

在项目类型中选择【知识图谱构建】。

确认项目信息后,点击【创建】,即可进入知识图谱配置流程。

步骤2:实体及关系配置

进入知识图谱项目后,先完成实体类与关系类配置,明确后续需要识别的对象及其关联方式。

可选择【智能配置】,根据研究对象、材料范围、标注目标和示例文本,由 AI 辅助生成实体类与关系类。

也可选择【手动添加配置】,根据研究需求自行创建实体类、关系类及相关属性。

如果已有适合的知识图谱框架,可直接选择【使用预置配置】,快速套用平台提供的配置模板。

已有配置文件的项目,还可以通过【导入配置】直接复用原有的实体、关系及属性设置。

配置完成后,即可进入后续任务创建与文本标注流程。

步骤3:新建&导入任务

进入【任务列表】,点击【新建任务】。

填写任务名称与任务描述,并在【文档正文】中粘贴待处理文本。

点击【上传TXT】导入文本材料。

如果已有任务,可通过【导入任务】直接导入,无需重新创建。

确认文本内容无误后,点击【创建】,即可进入后续标注与关系抽取流程。

步骤4:发起智能标注

进入任务后,点击工具栏中的【智能标注】。

根据需要补充标注指令,例如限定标注范围、实体类型或关系类型。

确认指令后,点击【开始标注】,由 AI 自动识别文本中的实体及其关系。

标注完成后,可在正文中查看识别结果,并结合实体类、关系类进行人工检查与修正。

切换至【图谱浏览】,即可查看当前任务生成的实体关系网络。

步骤5:导出项目

完成实体与关系标注后,点击【导出项目】。

根据后续使用需求,选择合适的导出格式,如 Turtle、JSON-LD、RDF/XML、GraphML、GEXF 等。

如需用于网络分析或表格整理,也可选择 Gephi CSV、Gephi Excel 或实体列表格式。

确认导出格式后,点击【开始导出】,即可获得知识图谱项目数据,用于后续备份、迁移、网络分析或可视化展示。

知识图谱成果展示

以《屈原贾生列传》和《朝鲜王朝实录》为原始文本,借助「吾与点」完成实体与关系抽取,并分别生成了人物生平关系网络和多主体历史事件关系网络。

「吾与点」

为人文研究者和文化机构提供

专业、先进、便捷的生产力工具

让智能服务人文

阅读原文

跳转微信打开

  •  

《历史的智能演绎》| 如果穿越回三国时代,你将以谁的视角指点江山?

PKUDH 2026-09-02 19:00 北京

如果穿越回三国时代,你将以谁的视角指点江山?又怎样重新演绎那段波澜壮阔的历史?

2026年春季,在北大,数字人文中心联合历史学系,在人工智能研究院开设了一门跨学科课程:"历史的智能演绎",课程融合历史文献研读、数字人文方法与人工智能技术,以《三国志》及相关史料为核心材料,从历史文本的专业阅读出发,逐步开展史料数据构建、生成式表达,构建历史人物智能体,最终展开多智能体互动实践,演绎往昔的历史场景。

从《三国志》出发,构建历史人物智能体

为了让历史人物在史料与时代语境的约束下“开口”,学生需要从史料中梳理人物、事件、时间、地点及其关系,将文本信息转化为结构化数据。在此基础上,为不同历史人物设置相应的知识范围、角色立场与行为逻辑,并进一步探索多个历史人物在同一情境中的互动与推演。课程关注的并不是简单利用AI重新生成一段历史叙事,而是希望探索:历史知识经过数据化、结构化和智能化处理之后,能否从静态文本进一步转化为可互动、可体验、可推演的历史世界。

历史学、数字人文与人工智能,在同一课堂相遇

历史人物智能体的构建,是一个跨学科问题。要让一个由AI驱动的历史人物真正建立在史料与时代语境之上,既需要历史学对材料、人物与时代关系的判断,也需要数字人文对数据和知识的组织,还需要人工智能与人机交互技术将这些内容转化为可以对话、互动和推演的系统。

《历史的智能演绎》的课程由信息管理系的王军老师和历史学系的胡鸿老师主讲,数字人文方向的王兆基博士和魏晋南北朝史方向的范轩轩博士承担教学支持与学生团队指导,不同的学术视角共同进入课程设计与教学实践之中。同学们来自元培学院及人工智能、化学、工学、历史学、中文、管理学等不同学科,在跨学科的探讨和碰撞中,师生们共同推动课堂实践的开展。

这些不同学科与角色汇聚到同一条实践路径上:从史料出发理解人物与时代,将历史信息组织为数据和知识,再进一步转化为具有知识边界、角色立场和行为逻辑的历史人物智能体。

从史料阅读,到学生手中的智能体设计

在《历史的智能演绎》中,学生并不是简单地使用现成的AI工具,而需要从历史材料出发,将研究问题逐步转化为可以被验证和实践的数字方案。围绕《三国志》及相关史料,学生首先开展人物与事件研究,整理人物、时间、地点及其关系;随后进行数据结构设计和知识组织,并尝试将这些历史判断转化为人物智能体的知识范围、角色设定与交互规则。

这也意味着,构建一个历史人物智能体的第一步,并不是写下一段提示词,而是重新回到史料。人物在某一时期掌握哪些信息?他的判断受到哪些身份、关系和现实条件的影响?哪些内容来自正史材料,哪些来自后世文学与大众文化的重新塑造?这些原本属于历史阅读的问题,在智能体实验中被进一步具体化。当模型出现时间错位、知识“穿越”或人物立场偏移时,学生需要重新检查史料、人物设定和知识范围,并对智能体进行不断调整。从史料阅读、数据整理,到人物建模与互动测试,课程让历史研究中的材料意识与问题意识进入了新的数字实践过程。

左右滑动查看更多

周瑜小组作业展示

从单一人物,到可互动的历史情境

在完成人物智能体的基本构建后,课程进一步探索多个历史人物之间的互动。学生需要结合具体历史情境设置规则,让拥有不同身份、知识范围和角色立场的人物进入同一系统,并观察不同角色之间可能产生的交流、判断与行动。在这样的实践中,历史不再只以一条已经完成的叙事线呈现。人物之间的信息差异、关系网络和行动逻辑,都可以成为新的观察对象。

多智能体互动并不是为了任意“改写历史”,而是希望借助新的技术形式,更清楚地呈现历史人物所面对的条件、关系与选择,并进一步讨论:哪些推演仍然建立在史料和历史逻辑之上,哪些已经超出了合理的解释边界。从“阅读历史”走向“构建历史演绎系统”,课程尝试让一些原本隐藏在文本中的人物关系、知识差异与行动逻辑,以新的形式被观察和讨论。

左右滑动查看更多

从课堂实践,到“人文+AI”的方法探索

《历史的智能演绎》所展开的,并不只是一次将AI引入历史课堂的尝试。课程从史料阅读出发,经由数据整理、知识组织与智能体构建,将历史研究中的材料、人物关系与解释过程转化为可以进一步分析、互动和推演的数字实践。在这一过程中,AI并不是取代历史研究,而是促使学生更加明确地思考:模型依据什么材料工作,历史人物的知识与行为如何被限定,以及技术生成的结果如何回到史料和历史语境中接受检验。

从静态文本到智能体与互动情境,这门课程也提供了一个具体案例:在生成式人工智能时代,人文学科如何在保持材料意识与研究方法的基础上,探索新的知识组织方式与表达形式。

让历史“开口”,更要让历史有据可循

从《三国志》中的历史文本,到一个可以进行对话与互动的历史人物智能体,中间并不是一次简单的技术转换。它需要史料阅读,需要数据组织,需要知识构建,也需要对人物、时代和历史解释保持持续判断。生成式人工智能为历史知识的表达提供了新的可能,而数字人文所关注的,是如何让这些可能建立在可靠材料、严谨方法与人文理解之上。

当历史人物真正“开口”之后,重要的不只是他们能够说什么,更是我们能否回答:他们为什么这样说,以及这些回答从何而来。从静态文本到智能体,从历史阅读到互动演绎,《历史的智能演绎》正在课堂中探索历史知识进入智能时代的一种新路径。

阅读原文

跳转微信打开

  •  

北京大学数字人文研究中心师生参加 2026 年国际数字人文会议( DH2026 )

PKUDH 2026-08-09 18:00 北京

北京大学数字人文研究中心师生参加2026年国际数字人文会议(DH2026)

2026 年 7 月 27 日至 31 日,数字人文国际联盟( ADHO )第三十六届年度国际会议 DH2026 在韩国大田会议中心举行。 DH 年会是国际数字人文领域历史最久、规模最大、影响最广的学术会议。本届会议由韩国数字人文学会承办,以 " Engagement " 为主题,采用线下与线上结合的形式,共设置 111 场平行会议、 404 场学术报告和 88 项海报展示。

北京大学数字人文中心实验室主任、北大信息管理系位通老师带领博士生王兆基、潘娅婷,硕士生杨晓勇、裴清妍、王宇琪、王商,本科生陈怡然等参与了本次会议,现场汇报了 5 篇录用论文。

参会的北京大学数字人文研究中心师生合影

  会议议题

生成式人工智能是本届会议讨论较为集中的议题。相关研究涉及大语言模型和视觉语言模型辅助文献整理、历史文献 OCR 与 HTR 文本校正、自动标注、检索增强生成、多模态信息抽取、档案检索和模型评测等环节,会议还设置了 RAG 系统构建、本地大语言模型、人工智能研究中的数据主权、小数据研究伦理和人机协作等专题。本体、知识图谱和开放数据基础设施也是本届会议的重要内容,相关议程包括联邦式 Wikibase 知识系统、 TEI 与 RDF 编辑、 IIIF 资源利用、链接开放数据、数据溯源本体以及 Graph-RAG 等。此外,本届会议还涵盖社区档案、少数群体记忆、多语言资源和数据伦理等主题。

  研究背景

北京大学数字人文研究中心近年来围绕中国古典文献、知识组织、文化计算和智能人文等方向开展研究。本次参会的 5 篇论文以中国古代类书、考古图录、儒家经典、早期汉译佛经以及中古佛教丧葬与舍利遗产为对象,综合运用本体、知识图谱、大语言模型、智能体、自然语言处理、文体计量和 GIS 等方法,同时保留领域专家对特征设计、结果校验和人文解释的参与,集中反映了中心近期在古典文献数据化与文化遗产计算分析方面的研究进展。

  论文汇报

长论文

汇报人:位通、裴清妍、陈怡然

本体驱动的大型中国古代类书数字重构

Ontology-Driven Digital Reconstruction of Large-Scale Ancient Chinese Encyclopedia

作者:位通、裴清妍、陈怡然、王商

该研究针对大型古代类书体量庞大、知识结构复杂、条目之间关联不易呈现等问题,引入领域本体对类书中的概念、实体及其关系进行组织,探索古代类书知识内容的结构化表达与数字化重构方法。汇报还展示了团队构建的类书平台,具备智能辑轶、异文检索和向量检索等功能,为人文学者提供实用高效的工具。

短论文

汇报人:王兆基

超越相似度:基于大语言模型智能体标注的〈论语〉与〈汉书〉互文关系可解释性研究

Beyond Similarity: Bridging the Interpretability Gap in Intertextual Analysis with LLM-Driven Annotation — A Case Study of the Analects and the Book of Han

作者:王兆基、司宛玉、王军

该研究针对数字互文分析较多依赖文本相似度、难以进一步解释引用功能与思想立场的问题,构建了涵盖复用形式、复用层面、来源标记、互文功能与立场的五维标注框架,并利用大语言模型智能体对《论语》与《汉书》进行穷尽比对,抽取互文关系、定位原文出处并完成逐条标注,标注结果经领域专家审定。在识别文本关联的基础上,研究进一步分析了经典话语在史书中的应用方式及其思想功能,并已将这一流程扩展至二十四史全库,全部结果可在公开平台上查验。

长论文

汇报人:潘娅婷

早期汉译佛经译者风格的可解释计量框架:以安世高存疑译经的归属判定为例

An Interpretable Stylometric Framework for Early Chinese Buddhist Translator Styles: A Case Study on the Attribution of Disputed Works of An Shigao

作者:潘娅婷、张馨月、王军

该研究针对早期汉译佛经低资源、译者归属考辨依赖定性判断等问题,提出融合专家知识的可解释文体计量框架。在早期的五位译者共计 37 部可靠译经中通过交叉留一实验,发现基于欧洲语言提出的经典文体计量方法 Delta 存在明显局限性,而融合了虚词、句式、句末字和词性 n 元组等领域专家定义的语言特征计算框架具有显著区分效果,并在对安世高存疑译经的归属判断上为传统文献学考据提供了语言学证据。本研究不仅为佛经译者考辨提供了新的框架,也为探索汉语文献风格计算提供了新的论据。

短论文

汇报人:潘娅婷

量化佛教的本土制度化:中古中国佛教丧葬与舍利供养实践的 GIS 分析

Quantifying the Institutional Localization of Buddhism: GIS Analysis of Buddhist Funerary Practices and Relic Veneration in Medieval China

作者:潘娅婷、侯星如、王军

该研究以高僧传记和金石文献为主要材料,构建佛教丧葬与舍利实践的知识体系,并利用大语言模型提取遗存类型、时间、地点和形制等信息。在专家校验的基础上,研究运用 GIS 分析相关实践的时空分布,考察佛教丧葬制度与舍利供养在中古中国的发展及其区域差异,可视化了中古时期佛教在中国的传播与本土化。

长论文

汇报人:杨晓勇、王宇琪

多模态考古图录数据化研究

Research of Multimodal Archaeological Catalogue Datafication

作者:位通、杨晓勇、唐一扬、王宇琪

该研究针对扫描版考古图录版式复杂、图题对应关系隐含、术语表达不统一及图文语义难以对齐等问题,提出融合本体、版面分析与多模态大语言模型的数据化框架。研究首先构建细粒度青铜兵器本体,随后利用版面检测、 OCR 和图神经网络完成图文识别与图题配对,并在本体约束下抽取器物构件、形态、年代和出土信息,生成结构化知识库。实验在 1380 页自建数据集上开展,图文匹配 F1 值达到 0.9318 ;研究进一步以 329 件商周青铜戈为例进行 15 维形态编码,分析其构件组合与形制演变。

  结语

本届会议汇聚了来自世界各地的数字人文学者,与会学者围绕各项议题展开了交流。此次参会集中展示了北京大学数字人文研究中心的研究成果,也使中心师生进一步了解了国际数字人文领域近期关注的研究问题和技术方法。会议期间,团队成员与相关领域学者就知识组织、人工智能辅助分析、文化遗产数据化和空间人文研究等问题进行了深入探讨,为后续研究与合作积累了经验。

排版:李秋莹

阅读原文

跳转微信打开

  •  

「吾与点」工作坊在韩国梨花女子大学举行

PKUDH 2026-08-05 18:17 北京

北京大学数字人文研究中心团队在王军教授的带领下赴韩,在梨花女子大学举办为期三天的「识典古籍」与「吾与点」数字人文工作坊,随后转往成均馆大学参加论坛,主持、发言、汇报,收获满满。

2026 年 7 月 22 日到 26 日,第五届东亚古籍数字人文国际论坛(DHEAC 2026)在韩国首尔举行。北京大学数字人文研究中心团队在王军教授的带领下赴韩,在梨花女子大学举办为期三天的「识典古籍」与「吾与点」数字人文工作坊,随后转往成均馆大学参加论坛,主持、发言、汇报,收获满满。

▍一、工作坊 · 走进梨花女子大学

梨花女子大学创校于 1886 年,是韩国顶尖的综合性学府,也是全世界规模领先的女子大学之一;其中国语言文学系历史悠久,是韩国汉学教学与研究的重要基地。本次工作坊得到梨花女子大学中文系沈小喜(Shim Sohee)教授和论坛筹备人许喆教授的大力支持。沈教授现任梨花女子大学中国语言文学系教授、中国文化研究所所长。

北京大学授课团队由北京大学数字人文研究中心的三位老师和两位博士生组成,包括:王军、杨浩、位通、潘娅婷、王兆基。团队以理论讲解、跟做示范、自主实践、汇报点评四步教学法,带学员在零代码的前提下,完整体验从原始人文材料到智能研究助手的全流程。工作坊吸引了来自梨花女子大学、高丽大学、成均馆大学、香港浸会大学、香港都会大学、浙江大学、南京林业大学等多所高校的三十余名教师、研究人员与研究生参与,学员来自多个国家和地区,学科背景多元,有效促进了数字人文的跨地区、跨学科交流。

Day 1 · 识典古籍平台:人工智能时代的古籍整理与研究

第一天由杨浩老师主讲识典古籍平台。识典古籍平台由北京大学数字人文研究中心与字节跳动公益联合打造,是目前全球范围内领先的古籍智能化整理与数字化阅读平台。课上,杨浩老师系统演示了古籍整理全流程,涵盖 OCR 识别、自动标点、命名实体校对与多版本校勘等,学员随堂实操,亲自动手尝试将一部古籍完成数字化整理。以往需要专业训练、耗时费力的整理工作,如今借助平台即可高效完成,学员普遍反映上手轻松,短时间内便掌握了古籍智能整理的基本方法。

Day 2-3 · 吾与点平台:让材料变成数据,让数据成为助手

第二天与第三天,团队为学员详细讲授吾与点智能数据平台。吾与点平台是北京大学数字人文研究中心自主研发的智能学术研究平台,面向人文研究者提供从原始材料、知识库构建、智能体设计到应用程序开发的一站式解决方案。平台以智能表格完成多模态数据抽取,以知识图谱梳理概念与关系,以数据集、知识库实现语义检索,以智能体提供问答式研究助手,并以小程序完成零代码可视化,贯通数据生成、组织、问答与呈现的全链路。

位通助理教授首先讲授知识图谱理论与「吾与点」的智能体驱动知识图谱抽取功能。知识图谱部分从节点、关系、属性与三元组等基础概念讲起,以研究问题为出发点搭建领域本体,再从文本中抽取实体与关系。位通助理教授以《朝鲜王朝实录·世宗庄宪大王实录》为例完整演示,全程由平台的智能体一键完成从文本到图谱的构建,学者只需专注本体设计与结果把关。

潘娅婷博士生接着讲授智能表格。智能表格把研究问题的原材料抽取成表格字段,让 AI 依字段读取材料、生成结构化数据,文本、PDF、图像均可处理,同样升级了智能体模式,应对复杂抽取更为从容。

向右滑动查看更多内容团队为学员详细讲授吾与点智能数据平台

第三天,潘娅婷与王兆基博士生带领学员将数据整合为完整的研究闭环。数据集与知识库将多项目表格集中管理,支持关键词、语义与混合检索,让数据支持智能查询。智能体则让数据学会说话,基于个人知识库搭建问答助手,自然语言提问即可获得带信源的回答,并支持联网检索与图表生成。小程序功能进一步让数据看得见,零代码即可生成统计图、地图、检索页面等可视化应用,并内接 CHGIS、CBDB、国家版本数据中心等主流数据库,助力于统计数据可视化、社会网络分析、GIS分析等。

潘娅婷演示了完整流程:先用智能表格将古籍图像转换为多模态结构化数据,再基于此创建智能体与小程序,让数据自动聚合,分析结果直接呈现为交互式网页。王兆基提供了实时技术答疑,帮助学员们积极跟练操作,让每个人都能用吾与点平台赋能自己的人文研究。

学员展示:三天所学,落到实处

经过三天的充分学习,学员们熟练掌握了识典古籍与吾与点的核心操作,课程尾声的作品展示环节,有学员整理历代方志、本草、笔记所载的物产与相关人物,做成可检索、可漫游的小程序《物华天宝·人杰地灵》;有学员将方言按地域分布落到地图上,做成可视化作品,一眼看清方言的空间格局;有学员为南宋词人姜夔(白石道人)的词作搭建可视化小程序,词句与格律一目了然;还有围绕明清诗词、文化遗产等主题的多件作品。从零基础到独立完成一个小型数字人文项目,在吾与点平台的赋能下,只需要三天即可掌握并产出成果。

向右滑动查看更多内容来自中国大陆、中国香港和韩国的Workshop学员分别展示基于「吾与点」平台的数字人文成果

结业致辞 · 王军教授谈智能时代的人文研究范式

工作坊最后,北京大学数字人文研究中心主任王军教授作结业致辞,题为《智能时代的人文研究范式:从图书馆目录到智能体》。

王军教授从媒介的三次变革谈起:人类知识的载体历经口头传统、书写与印刷、数字时代,如今步入智能时代,每一次媒介变革都伴随知识形态的迁移。他指出,大模型时代的知识以参数化的形式存在,内化于模型的参数空间,以概率关联与生成能力呈现。由此,人文研究的问题域获得三重扩展:演化研究借全域语料考察思想、概念、制度与文体跨越千年的宏观演变,关联研究跨文本、跨模态、跨文明建立联系,生成与模拟研究走向历史场景重建与历史人物智能体互动。

谈及研究范式,王军教授将传统治学的线性链条(阅读、摘录、分类、卡片、写作)与当下人机协同的循环(材料导入、自动结构化、智能体推理、动态交互、生成性研究)并置,提出一个鲜明判断:在新范式中,提出问题与建构意义的价值,已远超单纯的知识占有。这套理念的落地正是吾与点平台,平台以高质量人文材料为底、大模型智能建模为中枢、智能体生成与交互为前端,一条统一工作流贯通数据处理、知识建模与多智能体推演,真正实现人智协同。这场致辞兼具历史纵深与技术前瞻,赢得在场师生的热烈反响,许多学员会后表示深受启发。

致辞之后,王军教授为完成课程的学员逐一颁发结业证书,韩国梨花女子大学中国文化研究所所长沈小喜教授向王军教授回赠礼物,为此次跨校合作画上圆满句点。

梨花女子大学沈小喜教授向王军教授赠送礼物

▍二、DHEAC 2026 · 成均馆大学的学术对话

工作坊落幕,团队转往成均馆大学参加 7 月 25 日至 26 日的「东亚古籍数字人文国际论坛」。此次论坛主题为「数智赋能:未来东亚古典研究的新范式与新趋势」,来自中国大陆、韩国、日本、中国台湾、中国香港等地的学者齐聚一堂。

王军教授开幕式致辞:数智赋能背景下东亚古籍研究的协作前景

王军教授出席开幕式并致辞,代表北京大学数字人文研究中心,就数智赋能背景下东亚古籍研究的协作前景发表看法;随后主持大会报告环节,与各国专家同台论道。杨浩老师在大会报告中作《智能体在古籍书目元数据整理与知识组织中的应用与展望》发言,分享识典古籍平台资源建设实践中在古籍智能化方向的最新探索。

数字人文研究中心师生积极参与论坛

会议同时设有多场平行分会场与研究生论坛。位通助理教授担任分会场主持,主持专题报告的研讨;潘娅婷担任研究生论坛分会场主持,为各校青年学子的论文展示把控节奏。论文汇报环节,博士生王兆基、潘娅婷各自宣读论文,题目分别为《超越相似性:基于大语言模型智能体标注的〈论语〉与〈汉书〉互文关系可解释性研究》与《早期汉译佛经译者风格建模与归属考辨:一种融合专家知识的文体计量学方法》。王兆基博士生的论文荣获大会优秀论文奖。

王兆基博士生荣获优秀论文奖

▍结语

从梨花女子大学的课堂到成均馆大学的论坛,此次首尔之行在教学实践与学术交流两个层面同时展开。北京大学数字人文研究中心既向东亚同行分享了识典古籍、吾与点等平台的实践积累,也在跨国交流中收获了新的合作契机。面向未来,中心将继续推动智能技术与人文研究的深度融合,助力东亚古籍在数字时代焕发新的生机。



🔗 相关资源

吾与点 https://www.wuyudian.net/ 

识典古籍 https://www.shidianguji.com/

帮助手册 https://help.wuyudian.net/docs/user-guide.html 

智能标注平台 https://wyd.pkudh.net/

中心官网 https://pkudh.org/ 

DHEAC 官网 https://dheac.org/

更多案例与教程,欢迎关注北京大学数字人文中心的 B 站与小红书账号。

撰文:潘娅婷

编辑:王军

排版:李秋莹

阅读原文

跳转微信打开

  •  

“原境智生”项目亮相 2026 两岸青年科技文化融合展

原创 PKUDH 2026-07-07 18:01 北京

2026 年 7 月 2 日,两岸青年峰会在京开幕。北京大学数字人文研究中心的两项文化遗产活化成果受邀参展。

2026 年 7 月 2 日,两岸青年峰会在京开幕。两岸青年峰会是由国务院台办、教育部、全国青联和北京市人民政府共同主办的两岸青年交流活动。作为峰会核心板块之一,两岸青年科技文化融合展在中关村国际创新中心拉开帷幕,展览设置五大主题展区、近百件两岸青年原创作品串联百年家书、前沿科创、非遗活化与潮玩文创,为观众带来一场科技与人文交融的沉浸式体验。北京大学数字人文研究中心文化遗产活化成果“原境智生”项目的两个系统——“夜宴再生”系统、“云冈新愿”系统受邀参展。

“夜宴再生”系统由数字人文中心主任王军教授指导、博士研究生张诗曼设计开发。该系统以中国古代人物画经典《韩熙载夜宴图》为基础,运用生成式人工智能技术,打造“入画夜宴”的互动体验。《韩熙载夜宴图》以听乐、观舞、歇息、清吹、送别五个场景展开,像一部古代长卷电影,记录了一场层次丰富的夜宴。观众拍照后,系统会提取其动作、衣着颜色和配饰等特征,并生成符合原作绘画风格的人物形象。随后,观众的数字形象会进入五幕场景之一,化身画中角色,参与这场跨越千年的夜宴。项目让观众不再只是站在画外观看名作,而是以更直观、更亲近的方式理解古典绘画的叙事结构和人物魅力。

“云冈新愿”系统由数字人文中心研究员李文琦担任负责人,并组建了包括博士生张诗曼在内的跨校、跨学科团队进行设计研发。该项目获云冈研究院开放课题资助,以云冈石窟中的供养人造像为切入点,用 AI 技术为公众打造文化遗产的数字临场感。在体验中,观众可以选择一个北魏供养人角色,并通过拍照生成自己的专属形象。AI 会根据观众的面容、神态、气质和姿态进行分析匹配,再结合团队基于云冈高清供养人图像训练和微调的专属模型,将个人定制的供养人形象转化为云冈石窟风格的数字造像。观众还可以写下自己的发愿文,并打印成纪念卡,扫码溯源到对应的云冈石窟编号,实现从线上体验到线下观览的结合。

此次参展是北京大学数字人文研究中心推动文化遗产创造性转化、创新性发展的又一次成功实践。两项成果以古画和石窟艺术为对象,将生成式人工智能技术与用户具身体验相结合,探索了传统文化面向公众传播的新路径。未来,中心将继续立足数字文化遗产交叉研究,深化科技赋能文化遗产保护与活化利用,推动中华优秀传统文化焕发新的生命力。

阅读原文

跳转微信打开

  •  

《永乐大典》高清影像数据库(第一辑)荣获第六届中国出版政府奖

PKUDH 2026-06-17 11:19 北京

2026年3月,第六届中国出版政府奖获奖名单正式公布,《永乐大典》高清影像数据库(第一辑)荣获“网络出版物奖”。

2026 年 3 月,第六届中国出版政府奖获奖名单正式公布,《永乐大典》高清影像数据库(第一辑)荣获“音像电子网络出版物奖”。这是我国新闻出版领域的最高奖项之一,每三年评选一次。本届共设图书奖、期刊奖、音像制品、电子出版物和网络出版物奖、印刷复制奖、装帧设计奖、先进出版单位奖、优秀出版人物奖等七大类 240 个奖项。

《永乐大典》高清影像数据库

《永乐大典》高清影像数据库的获奖,是对古籍数字化创新实践的重要肯定。该项目由国家图书馆出版社、北京大学数字人文研究中心与字节跳动联合推进,并获邀在全国古籍整理出版规划领导小组办公室主编的《古籍整理出版情况简报》 2026 年第 5 期上专题介绍。

此次获奖成果由国家图书馆出版社申报并领奖,其成功实施离不开国家图书馆出版社、北京大学数字人文研究中心与字节跳动等多方长期协同合作。其中,北京大学数字人文研究中心承担了总体规划、学术设计、数据生产组织与技术体系构建等关键工作,为古籍数字化与智能整理提供了具有示范意义的实践范例。

▍一、让国宝"活"起来

《永乐大典》是我国古代规模最大的类书,被誉为“世界历史上最大的百科全书”。全书 22937 卷,约 3.7 亿字,然而现存仅 400 余册,散藏于世界各地。如何让这部历经沧桑、文字古奥的巨著走进大众视野,是项目团队思考的起点,而答案落在了知识可视化上。

本项目是全国古籍整理出版规划领导小组的资助项目,由国家图书馆出版社具体负责建设,并委托北京大学数字人文研究中心设计实施。中心负责人王军为此组建了与字节跳动的联合团队,由位通老师带领王凤翔博士生等人展开设计研发。项目精选 40 册高清影像,将专深的古籍知识转化为可交互、易理解的互联网产品,便于公众使用与传播。

▍二、创新设计,沉浸体验

数据库打破传统阅读模式,构建起“通识知识+专有知识”的双层模式,下设六个板块,各有侧重。

“初见”:3D 交互模型展示大典开本、卷册,与 A4 纸对比凸显其宏大规模。

平台支持高清影像与《永乐大典》原文的图文对照,读者可以一边端详古籍原貌,一边对照阅读原典文字;针对原文中艰深的人名、地名等内容,平台提供实体注解,轻点即可查看;对书中插图,则辅以语义标注,帮助读者读懂图像背后的含义。这些设计让原本只有专业研究者才能领会的隐性知识变得清晰可见,大幅降低了普通读者的阅读门槛。

▍三、三方协同,产学研典范

古籍数字化是一项系统工程,既需要权威资源支撑,也离不开学术保障、设计理念与技术研发。在这一项目中,北京大学数字人文研究中心充分发挥跨学科平台优势,承担总体规划、总体设计、数据生产组织与技术体系构建等关键工作,发挥了重要的组织协调与学术引领作用。位通老师带领王凤翔博士,全面负责项目的统筹规划、概念设计、数据整理与生产、系统设计以及学术质量把控等核心环节,把握项目的学术方向与技术路线。依托北京大学数字人文研究中心的组织协调与专业支撑,国家图书馆出版社的珍贵文献资源与字节跳动的技术研发和平台运营能力得以有效融合,共同构建起资源、学术与技术协同推进的工作机制。

在此基础上,北京大学数字人文研究中心将进一步推动人工智能技术与人文学科深度融合,逐步形成了集资源建设、智能研究、人才培养、文化传播与产业转化于一体的发展模式,探索出一条智能时代人文学科创新发展的新路径。

▍四、社会影响与未来展望

系统上线以来,月均页面浏览量超 5.3 万次,独立用户近 9000 位,曾登上抖音热榜第二位及微博热搜,并荣获 2024 年德国 iF 设计奖,入选文化和旅游部智慧图书馆创新应用优秀案例。一系列数据表明,“知识可视化赋能古籍大众化传播”的模式正得到越来越广泛的认可。

未来,项目团队将继续深耕古籍数字化领域,让更多沉睡的典籍走进大众视野,让中华优秀传统文化在数字时代焕发新的生机。

六百年前的鸿篇巨制,如今只需轻点指尖即可走近。欢迎访问下方链接,亲自走进《永乐大典》的数字世界。

《永乐大典》高清影像数据库

https://www.yongledadian.com.cn/

阅读原文

跳转微信打开

  •  

从《论语》到佛经:北大数字人文三篇论文入选 DH2026

PKUDH 2026-06-10 18:00 北京

近日,北京大学数字人文研究中心师生的三篇论文被数字人文领域国际会议 DH2026 录用。相关研究分别在中国佛教典籍、儒家经部与史部文献上展开,综合运用大语言模型、智能体、自然语言处理、GIS 等方法,对佛经译者风格、儒家经典互文关系以及中古佛教舍利与丧葬遗产的时空分布进行了探索。这些论文由北京大学数字人文研究中心博士生与宗教学、古典文献等不同学科背景的同学合作完成,体现了人工智能与传统人文学科深度融合的跨学科研究路径。

中心的研究版图已从传统经史文献进一步拓展至中国佛教典籍,形成了覆盖经典文本、历史文献与宗教文献的多元研究格局。相关工作表明,中心正持续推动人工智能技术进入中国思想史与经典文本研究的深层领域,探索以计算方法理解中华文明知识体系的新路径。

DH2026 是数字人文国际联盟(ADHO)第三十六届年度国际会议,将于 2026 年 7 月 27 日至 31 日在韩国大田会议中心举行,由韩国数字人文学会承办。DH 年会是国际数字人文领域规模最大、影响最广的学术会议之一。本届会议尤为关注生成式人工智能对人文研究的影响,鼓励在大语言模型与多模态技术背景下重新思考数字人文的研究方法与知识生产方式。

01

An Interpretable Stylometric Framework for Early Chinese Buddhist Translator Styles: A Case Study on the Attribution of Disputed Works of An Shigao

早期汉译佛经译者风格的可解释计量框架:以安世高存疑译经的归属判定为例

作者:潘娅婷、张馨月、王军

早期汉译佛经是中印文化交流的关键一环,但译者风格与译经归属考辨长期缺乏系统的量化方法。传统文献学依赖定性分析,深度模型难以适应低资源场景,也难提供文献学论证依据。本文提出一套领域专家参与的可解释计量框架,由专家定义并校验语言特征,从CBETA语料提取虚词、句式、句末字、句长分布与词性n元组五类特征,构建译者与译本的风格指纹。以东汉至西晋七位译者的三十一部可信译本为基准,经统计检验筛选出十项区分度最高的特征,刻画出从东汉的质朴口语到西晋的成熟书面语的汉化轨迹。

专家参与的汉译佛经可解释计量分析流程

本文进一步将这一框架应用于文献学研究的经典译者考辩问题,对安世高存疑译经进行归属判定。分析表明,《阿毗昙五法行经》(T1557)与《杂阿含经》(T101)可归入安世高名下,其余各部明显偏离,与文献学专家判断结果一致,并给出可追溯的语言特征,有效解决了汉译佛经的低资源挑战与可解释需求。

安世高存疑译经的归属判断可视化。可信译本(红色圆点)高度聚集(红色椭圆),存疑译本(黄色星号)中的两本落入可信译经的语言特征范围内。

02

Beyond Similarity: Bridging the Interpretability Gap in Intertextual Analysis with LLM-Driven Annotation — A Case Study of the Analects and the Book of Han

超越相似度:以大语言模型驱动的标注弥合互文分析的可解释性鸿沟——以《论语》与《汉书》个案研究为例

作者:王兆基、司宛玉、王军

互文性是理解思想传承与经典形成的关键。数字人文的互文检测已能在大规模语料中定位平行段落,却多停留于判断是否相关,难以揭示其功能与意图:一处高相似度引用,可能是理论认同,也可能是政策应用或批评对象。本文提出一套多维标注框架,把研究从检测推进到阐释。研究团队对《论语》二十篇和《汉书》约一百二十个文本单元做穷尽式两两比对,生成约两千四百项任务,由基于豆包Seed-1.6的智能体在人机协同流程中完成标注,得到四百六十四组有效互文对。框架涵盖复用形式、修辞功能、立场与证据强度等七个维度。

融合表层特征与深层阐释的七维互文标注框架及人机协同流程

研究发现,约37%的引用承担应用功能,把抽象伦理转化为行政实践,如将《论语》为政主张落实为减免赋税等政策。约60%的引用未标明出处,说明《汉书》成书时《论语》话语已内化为知识阶层共识,这种隐而不彰的引用反而透露出更深的思想权威。引用密度显示,列传最高,远超其文本占比,印证汉代正统观念主要通过官员士人的实践,而非自上而下的诏令确立。

03

Quantifying the Institutional Localization of Buddhism: GIS Analysis of Buddhist Funerary Practices and Relic Veneration in Medieval China

量化佛教的本土制度化:中古中国佛教丧葬与舍利供养实践的GIS分析

作者:潘娅婷、侯星如、王军

丧葬与舍利仪式是佛教信仰的重要物质表达,其时空演变折射出佛教在中国的本土化进程。以往佛教遗产的GIS研究多关注寺院、石窟,对丧葬与舍利着墨不多。本文提出一套本体知识引导、大语言模型信息抽取的GIS分析框架,重建中古佛教丧葬与舍利实践的时空图景。参照相关学术成果构建本体,用GPT-5.1从高僧传记与金石文献抽取丧葬形制、舍利内容与形态及时空信息,经专家抽样校验,得到近三百条记录。

GIS可视化揭示两条主线。时间上,佛教丧葬与舍利活动于隋唐臻于鼎盛,与佛教物质文化高峰同步。空间上呈现鲜明的核心边缘格局,陕西长安既是政治中心也是宗教核心,过半遗存集中于此,河南洛阳同样密集,浙江发展为南方据点。形制上,早期以林葬、石室葬为主,隋唐塔葬与土葬渐次普及,佛教由此完成从外来信仰到国家认可宗教的制度化转型。

佛教丧葬实践(蓝)与舍利供养(绿)在六个历史时期的部分省域空间分布

结语

三篇论文展现中心在古典文化计算分析上的多元路径。研究者既以大语言模型、智能体等技术处理大规模文本,也把领域专家与人文阐释置于核心,让结果回到可解释、可追溯的人文论证,为中国数字人文在古典文化与人工智能融合上的探索提供了范例。期待这些工作在韩国大田与同行展开更深入的交流。

阅读原文

跳转微信打开

  •  

《历史的智能演绎》线上公开分享会 —— 从《清明上河图》到 AI 周瑜:生成式智能如何重塑历史

PKUDH 2026-05-19 20:55 北京

图片

图片

当人工智能开始生成角色、构建世界、组织记忆与推动叙事,历史是否仍只是被阅读的文本?

北京大学《历史的智能演绎》课程,尝试以生成式 AI 为媒介,将历史研究从静态史料分析推进至“可互动、可体验、可推演”的动态历史世界。课程以《三国志》及相关史料为核心,引导学生从历史文本的专业阅读出发,逐步完成史料数据化、生成式表达、智能体构建与交互式演绎的完整实践路径。

作为北京大学“人文+AI”跨学科课程项目的先行探索,该课程由北京大学数字人文研究中心与历史学系联合开设,于2026 年春季首次在人工智能研究院面向本科生开放。课程希望探索:在生成式人工智能时代,历史是否能够从“被研究的对象”,转化为“可以进入的世界”?

本次线上公开分享会将围绕历史模拟、角色智能体与 AI 原生历史世界等前沿议题展开,邀请研究者与课程团队共同展示人工智能如何改变历史的表达方式,并讨论其背后的方法挑战与伦理边界。

时间: 2026 年 5 月 22 日(周五)19:00
平台: 腾讯会议 456-654-991

图片

↑↑↑ 腾讯会议二维码

报告人:

1. 陈钰琪

    香港大学人文社会研究所与文学院助理教授

2. 刘玥、方思童

    北京大学元培学院

特邀评议人:

    郑小悠

    北京大学历史学博士、国家图书馆研究馆员、非虚构历史作家

主持人:

    胡鸿

    北京大学历史学系教授

    王军

    北京大学信息管理系教授

图片

线上分享会安排

第一部分:特邀学术分享

主题:众生入画——生成式 AI 构筑的动态历史世界

· 主讲嘉宾: 陈钰琪(香港大学人文社会研究所与文学院助理教授)

· 分享要点: 陈教授将分享其在历史模拟与  AI 原生游戏领域的先锋探索,以《入画·清明上河图》(AI  汴京)项目为例,阐释如何通过多智能体系统、世界记忆与开放叙事机制,赋予画中人物以“数字生命”,将宏观的历史变迁转化为微观的可交互体验,并讨论历史学与人工智能之间将出现怎样新的研究边界、方法挑战与伦理问题。

第二部分:课程实践汇报

主题:公瑾重现——数字生命重构的英雄叙事与边界

· 汇报团队: 刘玥、方思童 (北京大学元培学院)

· 汇报要点: 课程组成员将展示“周瑜”AI 智能体的构建过程,探讨如何以史料为约束、以时间边界为核心,通过生成式智能技术构建“可对话的历史主体”,并进一步思考历史模拟中的真实性、人格还原与角色伦理问题。

分享会详细内容介绍

报告1:

众生入画——生成式 AI 构筑的动态历史世界

历史模拟始终面对一个核心问题:如何在宏观结构与个体经验之间建立连接?

历史研究既关注制度、地理与长期结构如何塑造文明演化,也关注偶然事件、个体选择与不可重复的历史瞬间。近年来,大语言模型、多智能体系统与生成式角色的发展,为重新连接“大历史”与“小人物”提供了新的技术路径,也使“可互动历史世界”的构建成为可能。

本报告将以历史模拟为线索,介绍从 Agent-Based Modeling(ABM)到多智能体系统(Multi-Agent System)与 AI 原生游戏的发展脉络,并重点展示正在开发中的《入画·清明上河图》(AI 汴京)项目。

图片

该项目尝试让观众真正“进入”《清明上河图》的世界:在多智能体驱动的动态环境中,与画中人物互动、经历历史事件、感受城市秩序与时代变迁。历史不再只是被阅读与观察的对象,而成为一个可以探索、参与与体验的开放世界。

报告也将进一步讨论:当 AI 不再只是用于检索、标注与分析静态史料,而开始生成可互动、可推演、可体验的历史空间时,历史学与人工智能之间将出现怎样新的研究边界、方法挑战与伦理问题?

图片

报告人简介:陈钰琪,香港大学人文社会研究所与文学院助理教授,北京大学历史学博士,哈佛大学量化社会研究所访问学者。长期从事数字人文与量化历史研究,致力于将人工智能与计算方法引入人文学科,其研究成果发表于 International Journal of Geographical Information Science、Humanities and Social Sciences Communications、Proceedings of EMNLP 等国际期刊与会议。

报告2:

公瑾重现——数字生命重构的英雄叙事与边界

通用大语言模型能够流利地谈论任何历史人物,但它们通常以“全知全时空”的方式处理历史:既知道人物当时掌握的信息,也知道后世发生的一切。

然而,真实历史中的人物,并不拥有后见之明。

历史人物的判断、决策与行动,始终受到其时代信息边界的限制。如果 AI 无法区分“当时知道什么”与“后来发生了什么”,历史人物的生成便会产生根本性的失真。

本报告将以“周瑜 RPLA(Role-Playing Language Agent)”项目为例,介绍一套基于非参数化架构构建历史角色智能体的方法路径,包括:

· 正史与演义的史学辨析;

· 人格档案与原文证据链构建;

· 时间锚点机制;

· 双层记忆架构;

· 三重知识边界控制;

· “公瑾对策”网页系统的产品化实践与评测迭代。

该项目尝试让用户面对的,不是一个知道全部三国故事的信息系统,而是一个“站在建安十五年、只知那个时代之事”的周瑜。

图片

系统以《三国志》《资治通鉴》等史料原文为知识底座,以顾颉刚“层累造史”思想为设计原点,尝试在史实约束、人格逻辑与互动体验之间建立新的平衡,使“历史人格”从抽象叙事转化为可验证、可对话、可体验的历史主体。

报告也将进一步讨论:当 AI 开始以有限视角、有据可查的方式“扮演”历史人物时,我们应如何重新理解历史真实性、人格还原标准与角色伦理边界?在“可信”与“不出戏”之间,历史角色智能体是否会形成一种新的史学表达形态?

报告团队简介:刘玥、方思童,北京大学元培学院大三,《历史的智能演绎》课程选课同学。

关于课程

《历史的智能演绎》是北京大学“人文+AI”课程项目的实验性课程之一,由数字人文研究中心与历史学系联合开设,课程设立在人工智能研究院。课程尝试探索生成式人工智能在历史研究、历史表达与公共史学中的新可能,

《历史智能演绎》是一门前沿交叉的跨学科实践课程,融合历史文献研读、数字人文方法与人工智能技术,探索经典历史文本在当代语境中的理解、表达与互动方式。课程以史料研读与史料数据集构建为基础,运用多种 AI 工具,对历史内容进行“智能演绎”。

本期课程以《三国志》及相关史料为主要研读对象,引导学生从历史文本的专业阅读出发,逐步完成史料数据化、生成式表达、智能体构建与交互式演绎的完整学习路径。通过项目制学习,学生将理解历史解释如何在不同媒介和互动系统中被重新组织和呈现。

通过“AI智能演绎”这一创新路径,课程引导学生以主动创作与互动体验的视角,深入理解与诠释经典历史文本,培养其跨学科整合能力与创新实践能力。课程邀请来自相关行业的一线实践者参与授课与指导,包括智能体主创团队、互联网大厂设计经理等,为学生提供贴近真实产业场景的实践经验与行业视野。

阅读原文

跳转微信打开

  •  

发言|众手续文脉:智能时代古籍大众整理的价值与路径

原创 PKUDH 2026-04-22 10:04 北京

北京大学数字人文研究中心副主任杨浩老师在2026年“我用 AI 校古籍”——我是“校书官”古籍大众智能整理计划启动仪式暨海外汉籍资源汇聚与典籍活化前沿论坛上发表题为《众手续文脉:智能时代古籍大众整理的价值与路径》的主题发言。发言指出传统古籍整理由精英主导、门槛高、效率低,结合 AI 与海外汉籍数字化实践,提出 “AI 赋能、大众参与、分层校勘” 路径,以 “AI 预处理 — 大众初校 — 进阶组精校” 体系兼顾普及与严谨。以 “我用 AI 校古籍” 为代表的大众参与模式,让公众与青年深度参与文脉传承,提升效率、培育人才、增强文化认同,助力构建开放共享的数字人文生态,开启人人参与的古籍传承新范式。

众手续文脉:智能时代古籍大众整理的价值与路径

杨浩

回溯中华文明的长河,古籍整理始终是赓续文脉的千秋之业。孔子删《诗》《书》、定《礼》《乐》、赞《周易》、修《春秋》,以个人的宏大愿景,开启了古代文献整理的先河。汉代刘向、刘歆父子于石渠阁校勘群籍,首创目录与校雠之学。至宋代,得益于文治的兴盛,官方开展了规模空前、体系完备的大型古籍编纂工程,先后组织编纂了四大类书。此后,明代有《永乐大典》的浩瀚集成,清代有《四库全书》的宏富汇总,民国时期则有影印《四部丛刊》《正统道藏》等嘉惠学林的壮举。及至当代,则有建国后“二十四史”的点校整理,以及新世纪《儒藏》精华编的编纂等宏大古籍整理工程。这些都是泽被学林、传承文明的文化盛举。

北大《儒藏》精华编·500种·282册

然而,回顾这一部浩荡的文献整理史,不难发现:历代的古籍整理,更多的是官方主导、学者专司的精英事业。传统古籍整理高度依赖少数具备深厚学养的专家学者,是一项专业门槛极高、耗时漫长的系统工程,是一门名副其实的“冷门绝学”。没有深厚的古代汉语功底、扎实的文字学基础和丰富的版本学经验,普通人乃至一般学者都难以企及。这使得古籍整理长期局限于极少数学术精英的寂寥书斋之中。

历代代表性古籍整理工程对比

从文献载体来说,当前正处在从纸质媒介向数字媒介全面转移的历史阶段。在这场深刻的媒介变革中,古籍整理的目标不能仅仅停留在扫描图像的数字化保存,更要将沉睡在图像中的字符转化为计算机可读取、可利用的数字文本。当前,一方面必须加速完成古籍的文本数字化;另一方面,在AI时代,还必须让AI能够接触到,并能理解这些承载着千年智慧的文字。然而,面对浩繁的卷帙与珍贵的遗存,传统的“专家主导”模式正面临着严重的效率瓶颈。要跨越这道鸿沟,迫切需要AI技术的赋能,更需要广大学生的积极参与。

一

人工智能的飞速发展,正在彻底重塑古籍整理这一古老领域的范式。高精度的光学字符识别(OCR)技术,以超越人工录入千万倍的效率,解决了最为繁重的文字转录难题;基于大数据的自动标点技术,在各类文献上展现出稳定的标点水平。技术,不再仅仅是冰冷机械的辅助工具,而是能够打破专业壁垒、重塑整理流程的利器。

智能技术的深度介入,使得原本紧密耦合、深奥复杂的整理工作被合理地拆解了。AI承担了大规模、机械性的初步识别与标点任务,而将更高层次的精细核校、学术研判、疑难辨析交给人类。这种“人机协作”的范式,不仅让古籍图像迅速转化为数字文本,更让大众的广泛参与从理想变成了现实。

人机协同工作流程图

二

如果说AI是古籍数字化的“先锋部队”,那么广泛参与的大众则是“星火大军”。“我用AI校古籍”绝非一句轻巧的口号,而是建立在“人机协作”基础上的全新文化传承模式。

回想这项活动发起的初衷,其实源于一次巨大的挑战。此前,数字人文中心获得了哈佛燕京图书馆近万种珍贵古籍的数字化授权,但面对如此庞大的文献量,仅有的少量专业人力无异于杯水车薪。面对这种困难,数字人文中心提出了一个大胆的设想,借助大众的力量,采用“众包”的方式。不难想到,提出这个想法,大家可能都有着“大众真的能参与古籍整理这样高度专业的工作”的担忧。带着这样的疑问,在小范围探讨之后,专门召开了“智能时代古籍整理与大众传播”研讨会,广泛听取学界意见,专家们给予了积极的支持。在此,要特别感谢全国高校古籍整理研究工作委员会的鼎力支持,以及“到梦空间”第二课堂平台的积极推动。正是有了各方的信任与保驾护航,“我是校书官”活动才得以在2024年7月顺利扬帆启航。现在有越来越多的承办院校的加入,“我用AI校古籍”已然有星火燎原之势。

2024年6月7日,

智能时代古籍整理与大众传播研讨会在京举办

如今,在“我用AI校古籍”活动的系列实践中,可以目睹到这样令人动容的情景:成千上万来自不同专业、不同高校的青年学子,通过轻量化、智能化的平台,满怀热情地参与到基础的文字校对中。

这种“人机协作加上人际分工”的模式,有效缓解了古籍整理长期面临的人力困境。其中更深远的价值可能在于:它构建了一种深度的、参与式的文化传播机制。以往,大众仅仅是古籍成果的被动接受者;如今,他们化身为文明传承的“在场者”。在逐字逐句的校对与比勘中,青年学子们越过千年的时光,真切地触摸了历史的温热,领略了先哲的智慧。

三

面对万千大众的参与,如何保证古籍整理的专业质量?这是作为组织者从一开始就必须直面的核心问题。因此,在大众参与的基础之上,活动设立了进阶组,构建了“AI预处理——大众初校——进阶组精校”的多层级协作体系。设立进阶组的初衷,源于一个现实挑战:专家学者的时间成本极为高昂,不可能将全部精力投入到海量古籍的初校与基础精校中。因此,开始探索一种新的可能——让经过培训的学生,去参与那些以往认为只有专家学者才能胜任的专业工作。

三层协作金字塔

进阶组的同学们,经过系统的理论学习与实操训练,承担起了更为复杂的标点校对、版本核勘与疑难处理工作。在这个过程中,哪怕是非古典文献学专业的学子,在系统的培训与人机协同的支撑下,依然能够产出符合学术规范的有一定质量的整理成果。通过这种梯队式的协作与培养,不仅保障了古籍整理的学术严谨性,更探索出了一条批量化培养古籍整理后备人才的创新路径。这是一种新形态的“教学相长”,是数字时代学术普及与创新人才培养的有机结合。

进阶组培训内容与成效

四

古籍整理不应当是束之高阁的孤芳自赏,更应是“源头活水来”的引流工程。在我看来,“我用AI校古籍”活动不仅是一次整理范式的飞跃,更是一场深刻的参与式文化传播。这种“做中学”的沉浸式体验,能够跨越学科的界限,在青年的心中播撒下文化认同与文化自信的种子。

数字人文生态系统示意

当然,哪怕经过大众整理,平台上的文献数量与整理质量仍然有较大提高的空间。因此,未来的工作将继续坚持做到“既重视数量,又重视质量”。依托这样的大众智能整理模式,能够构建起一个更加开放、共享的古籍知识生态系统。未来可以充分利用平台的技术与资源,一方面回馈学界,让更多的古籍数据反哺数字人文与传统学术研究;另一方面回馈参与的学生,进一步推动古籍整理与古籍教学的深度融合。

中华文脉的传承,需要代代学人的皓首穷经,也呼唤着千万大众的共襄盛举。从竹简木牍到纸寿千年,再到今日云端上跳跃的数字字符,文明的载体在变,但众手续文脉的精神恒久未变。今天,大众正在以AI为笔,以智慧为墨,共同书写古籍整理的时代新篇。

阅读原文

跳转微信打开

  •  

文脉新生・数智赋能:“我用 AI 校古籍”(2026年)计划启动仪式圆满举行!

PKUDH 2026-04-17 22:43 北京

2026年4月11日,由全国高等院校古籍整理研究工作委员会主办,山东大学国际汉学研究中心、山东大学古籍文献研究所与字节跳动公益联合承办的2026年 “我用AI校古籍”——我是“校书官”古籍大众智能整理计划启动仪式暨海外汉籍资源汇聚与典籍活化前沿论坛在山东大学中心校区举办。该会议由字节跳动公益团队策划并筹办,聚焦“我用AI校古籍——我是‘校书官’古籍大众智能整理计划”活动的已有成果与经验,正式启动“我用AI校古籍”2026年度相关工作。共有来自北京大学、清华大学、复旦大学、山东大学等高校的学者代表,来自68所高校、76个承办高校的教师,以及抖音平台各类知识博主约100余人参加了本次启动仪式。山东大学副校长曹现强、全国高等院校古籍整理研究工作委员会秘书长卢伟、教育部语言文字应用管理司副司长王晖、抖音集团企业社会责任部产品与运营总经理罗海岳出席启动仪式并致辞。

北京大学数字人文研究中心与字节跳动公益联合打造的“识典古籍”平台,作为全球规模领先的古籍智能化整理与数字化阅读平台,是“我用 AI 校古籍”活动的依托平台。平台深度融合人工智能技术,构建起从古籍OCR技术、自动标点、实体识别到多版本智能校勘的全流程解决方案,彻底打破古籍整理的专业壁垒,让普通大众深度参与中华文脉传承成为现实。

2024年7月,由全国高等院校古籍整理研究工作委员会、北京大学数字人文研究中心、字节跳动公益联合国内多家古籍研究机构共同发起 “我用AI校古籍 —— 我是‘校书官’古籍大众智能整理计划”,依托识典古籍智能整理平台,广泛动员高校学生与社会公众参与古籍数字化整理工作。项目自启动以来,已经历经三期稳步迭代,参与规模与整理深度持续提升。截止2026年4月,已经累计完成2万余部古籍整理,其中粗校16亿字、精校1亿字;吸引4.2万余名参与者,覆盖全国1450余所高校,总曝光超30亿次,先后获人民网、新华社、《科技日报》等权威媒体报道,并通过20余位文化达人实现广泛传播。

2026年度的大众整理活动,将由国内68所高校,76个单位参与承办该项活动,承办高校主要负责动员与组织本校相关专业学生参与本项活动。活动时间为3月26日至11月30日,分春季、暑期、秋季三个阶段开展,重点围绕海外汉籍汇聚、典籍活化传播两大方向,持续以科技赋能、创新表达推动古籍走近大众。

在活动启动仪式上,山东大学副校长曹现强介绍了山东大学在古籍整理、全球汉籍合璧工程等方面的成果,表示山东大学将持续深化AI技术与古籍整理融合,助力中华文脉永续传承。全国高等院校古籍整理研究工作委员会秘书长卢伟回顾了 “我用AI校古籍” 前几期的活动成效,介绍了2026年活动开展的重点方向,并宣布优化招募机制,推动活动专业化、规模化发展。教育部语言文字应用管理司副司长王晖高度评价AI赋能古籍整理的创新价值,结合人工智能与教育行动计划,从守正创新、以文铸魂、数字赋能等方面提出期望,鼓励多方协同打造语言文化传承品牌,让青年成为古籍传承主力军。抖音集团企业社会责任部产品与运营总经理罗海岳分享识典古籍平台功能升级情况,说明2026年将深化与各承办高校的合作、支持学者项目研究、开展征文及创作者共创等古籍活化传播活动,持续以技术降低公众参与门槛,推动古籍实现活态传承。

山东大学副校长曹现强致辞

全国高等院校古籍整理研究工作委员会秘书长卢伟致辞

教育部语言文字应用管理司副司长王晖致辞

抖音集团企业社会责任部产品与运营总经理罗海岳致辞

左右滑动查看更多

“我用AI校古籍”活动开展以来,成千上万社会大众与高校青年积极参与其中。在启动仪式上,年届74岁高龄的常兰藻先生作为大众代表来到现场分享参与“我用AI校古籍”活动的体会,作为一名退休会计,退休后因为学习《资治通鉴》的有关知识,偶然发现识典古籍平台并开始利用AI校对古籍,4个月时间已经校对完19卷、近20万字古籍。看见自己名字出现在上架古籍中,老爷子感到无比骄傲。年仅21岁的山东大学大四学生王思彤则代表青年学子发声,分享自己立足在校参与项目、借助平台参与古籍整理的实践体验,分享了利用AI技术辅助古籍整理体会到的高效便捷与参与活动得到的成长锻炼。

优秀志愿者常兰藻先生发言

优秀志愿者山东大学王思彤同学发言

左右滑动查看更多

在论坛的主题报告环节,专家学者们围绕古籍整理、数字赋能、大众参与以及学科发展等多个维度分享前沿实践与深入思考。“我用AI校古籍”活动所整理的一部分重要的古籍资源,来自哈佛燕京图书馆等海外图书馆。北京大学中文系杨海峥教授介绍了如何在海外流传古籍馆藏目录基础上,利用人工智能技术,通过海量元数据提取与流传轨迹重建,构建起大规模古籍流传数据集的过程。

新时代大型古籍整理项目北大《儒藏》工程的全本编纂正在利用“识典古籍”整理平台展开编纂工作,2025年度已经在平台上线约50种经过精心校勘整理的古籍资源。北京大学《儒藏》编纂与研究中心李畅然教授分享《儒藏》数字化与识典古籍平台的实践经验,提出提升OCR技术准确率、完善标点符号等具体技术需求,希望平台功能更加贴合专业古籍整理的需求。

北京大学数字人文中心副主任杨浩副研究员指出历史上古籍整理多由官方与学术精英主导,存在专业门槛高、效率有限、难以普及的局限,以 “我用AI校古籍” 为代表的大众参与模式,让广大青年学子与普罗大众得以加入,既提升了整理效率,也实现了沉浸式的文化传承。活动通过多层级校勘体系兼顾普及性与学术严谨性,既保障了古籍整理质量、培育后备人才,也致力于构建开放共享的数字人文生态。

全国高校古籍整理委员会副秘书长吴国武教授肯定“我用AI校古籍”活动在古籍整理发展历程中具有重大历史价值,体现出AI 技术深度赋能、大众志愿广泛参与、古籍整理范式持续革新的新形态,并指出古籍传承展现出从精英小众走向大众普惠、走向国际传播的新趋势。

北京大学中文系古典文献教研室主任杨海峥教授主题报告

《古籍流传的大规模数据集构建》

北京大学《儒藏》编纂与研究中心李畅然教授主题报告

《两条腿走路——OCR与语义两模块的协同》

河南大学出版社总编辑、河南大学文学院孔令刚教授主题报告

《古籍数字化的双向赋能与协同共生》

抖音集团社会责任部古籍项目经理张明月主题报告

《科技助力古籍保护与传承》

北京大学数字人文中心副主任杨浩主题报告

《众手续文脉:智能时代古籍大众整理的价值与路径》

山东大学国际汉学研究中心主任刘心明教授主题报告

《文本化是古籍整理的大方向》

山东大学古典研究所所长王承略教授主题报告

《中国文化典籍的家底与古籍整理定本的意义》

全国高等院校古籍整理研究工作委员会副秘书长田国武教授总结报告

左右滑动查看更多

论坛的下午场,到场学者们分享借助识典古籍平台与已有的大众整理成果,展开的学术研究与资源应用。例如:复旦大学文史研究院段志强副研究员,基于平台上整理的古籍资源,深入解读古籍中所反映的古代基层社会与普通人生活;清华大学人文学院严程副教授,利用识典古籍平台建设专题文献库“女子艺文数据库”,开展女性文献等专项研究,分享了清代多位具有独特性格的女子的生动故事;清华大学人文学院唐宸副教授分享利用数字人文方法对李白与李璘谋反事件关系的新研究,特别展示了如何利用识典古籍平台深度研究助手补上部分关键史料的例证。学者们以文献解读、案例实证、数字化工具应用等形式,系统呈现研究进展与实践心得,既具备扎实史料价值,又为新时代古籍活化利用提供了现实案例。

复旦大学文史研究院副研究员段志强

《在古籍中发现普通人的生活》

清华大学人文学院副教授严程

《盘一盘自带爽感的清穿女》

北京体育大学人文学院副教授黄二宁

《跃然纸上——唐代文献中的体育世界与大众传播的可能性》

清华大学人文学院副教授唐宸

《数字化时代的古典文献挖掘——以字节跳动“识点古籍”为例》

山东大学全球汉籍合璧工程首席专家助理陈肖杉

《形制与传播——境外汉籍流播管窥》

左右滑动查看更多

在古籍活化方面,创作者们开始频繁利用平台整理成果为根基进行创作传播。例如:抖音专攻五代历史的知识博主杨利辉,在创作过程中经常利用识典古籍平台的资源与工具展开创作,原本他制作有多种检索小工具方便创作,在利用识典古籍平台之后,自用软件多已不再更新。自媒体博主Asu、艾斯利用平台的古籍资源中挖掘 “十二花神” 等文化意象进行年轻化表达,让严谨的古籍整理成果走向大众。创作者们从古籍创作方法论、知识自媒体运营、二次元年轻化表达、小众历史趣味科普等多个维度展开分享,集中展现了前期大众参与古籍整理所形成的高质量成果,为古籍活化创作提供了坚实内容支撑。论坛的最后,创作者们还围绕古籍如何实现通俗化表达、年轻化传播与跨圈层破圈进行深入交流与讨论,认为古籍活化必须坚守学术严谨,同时力求通俗易懂而不失文化底色。

创作者子非秋月

《裁取云间墨,化得千亿身——浅谈短视频创作对古籍素材的选取与运用》

文化搬运委员会

《学术叙事的生活化转向:科普自媒体的叙事策略与实践创新》

Asu、艾斯

《谁说古籍只能藏在书斋?我们把“十二花神”变成了全网爆款》

杨利辉

《一个小众赛道的自媒体博主独白:从我和<太平年>的故事说起》

左右滑动查看更多

整场论坛展现出从大众整理产出成果,到学者利用整理成果做研究,再到研究成果反哺平台与传播的一条完整闭环。可以说,从顶层支持到学术论证,再到成果应用与大众参与,古籍整理仅靠专业学者还不够,只有借助AI技术与大众力量,才能真正破解海量文献古籍数字化难题。正是基于这样的共识与实践基础,“我用 AI 校古籍——我是‘校书官’古籍大众智能整理计划” 才得以持续推进、不断升级,成为连接学界、平台与社会大众的重要文化工程。

回望“我用AI校古籍” 活动的发展历程,从理念萌发到模式探索,其源头实际上是出于一场巨大的现实挑战。2022年3月,北京大学数字人文中心与字节跳动公益合作,开始建设“识典古籍”阅读与整理平台,旨在人工智能与计算机技术的辅助下,变革古籍整理方式,在三年内完成万种古籍的整理工作。2022年10月,识典古籍阅读平台正式上线对外发布,但资源建设是亟须解决的瓶颈难题。2023年11月,北京大学数字人文中心接受哈佛大学燕京图书馆捐赠的近万种中国善本古籍数字化书影。根据捐赠协议,这批古籍扫描书影连同所识别点校后文字,需要全部发布在古籍数字化平台上。然而,利用OCR技术对古籍图像识别之后,还必须经过人工校对才能达到更高的准确率,才能更好地被学界与大众利用,然而专业整理力量有限,人力成本奇高。因此,北大数字人文研究中心王军教授提出,必须借助人工智能技术降低参与门槛,以众包模式发动社会大众参与古籍整理,用普通大众力量破解古籍数字化难题。

传统古籍整理依赖少数具备深厚学养的专家学者,需要丰富的专业知识,专业门槛很高。大众是否能够参与古籍整理这样高度专业的工作,得到很多专家的担忧。因此,在项目正式启动前,北京大学数字人文研究中心召开多次小范围的专家论证会。2024年6月,国家古籍保护中心、北京大学数字人文研究中心、抖音公益等多家机构联合举办了“智能时代古籍整理与大众传播”研讨会。此次研讨会汇集了来自国内各大高校、图书馆和出版社的七十余位专家学者。与会学者就智能信息环境下古籍整理与大众传播的机遇与挑战进行了深入交流。活动还得到“到梦空间”第二课堂平台的支持,符合条件的同学可获得实信网认证的电子版实践证书,成为活动成功举办的重要激励机制之一。2024年7月,在古委会主办下,在各方的大力支持下,“我是校书官古籍大众智能整理计划” 第一期正式启动。

为了让这一构想切实落地见效,为项目开展筑牢基石,北京大学数字人文研究中心联合字节跳动公益推出《古籍智能通识课》《识典古籍智能整理培训课》等系列课程,课程内容涵盖古籍书史、海外汉籍、古籍整理以及历史上的大型丛书等内容,还结合识典古籍智能整理平台,讲解从OCR文字识别到文字精校、结构整理、标点校对等多个环节的技术和方法,将文献学知识转化为实践体系,将人才培养与古籍整理实践相结合。

2024年7月活动首期试行,面向大学生开展OCR校对工作,共有742所高校、超2500名学生参与,取得远超预期的阶段性成果。2024年9-12月第二期同时开设大众组、进阶组任务,参与人数突破1万人,覆盖高校增至1210所,整理规模与参与广度大幅提升,并尝试探索古籍数字化与专业教学、人才培养相结合的新模式。2025年第三期在前期经验基础上进一步拓展范围与深度,联动含清华大学、武汉大学、中国人民大学、中山大学、四川大学等22所承办高校以及1450余所参与高校,构建起 “主办单位统筹+承办高校执行+社会力量参与” 的协同机制。

可以说,“我用AI校古籍”活动不仅是一次古籍整理的技术创新,更是一场面向全民的文化传承实践。项目正逐步构建开放、共享、协作的古籍整理新生态。未来将进一步带动全国高校学生与社会公众共同参与古籍数字化整理,推动中华典籍实现全民传承、活态传承,让古籍真正融入大众的日常生活与精神文化生活,助力中华优秀传统文化创造性转化与创新性发展。

阅读原文

跳转微信打开

  •  

论文 | 从公共图书馆到公共智能:公共知识媒介演化及人文学术范式转型

原创 PKUDH 2026-04-01 11:49 北京

北京大学数字人文研究中心的研究论文《从公共图书馆到公共智能:公共知识媒介演化及人文学术范式转型》近期发表于知网。

北京大学数字人文研究中心主任王军老师的研究论文《从公共图书馆到公共智能:公共知识媒介演化及人文学术范式转型》近日发表于《中国图书馆学报》。该文从知识媒介演化的历史视角出发,辨析人工智能技术,特别是大语言模型出现的历史条件。梳理了自古腾堡印刷术以来人类信息环境的三次历史性跃迁:从印刷文献时代的“公共图书馆”,到网络化信息时代的“公共知识”,再到人工智能时代的“公共智能”。通过对印刷技术、互联网与Web 2.0、开放数据文化及大语言模型等公共知识媒介演化的分析,结合北京大学数字人文研究中心的实践案例,探讨智能技术对人文学科研究资料、研究工具与研究议题的重构作用。人工智能的出现并非偶然,而是开放文化、知识共建与技术演进长期交互作用的历史必然。在“公共智能”的支撑下,人文研究呈现出资料获取的穷尽化、形态的结构化及处理单元的原子化趋势,不仅极大地扩展了研究的问题空间,也推动了方法论层面上诠释与计算的深度融合,预示着学术范式正朝向“人机共生”的模式演化。

以下摘录论文的主要内容,全文请见:

王军. 从公共图书馆到公共智能:公共知识媒介演化及人文学术范式转型[J]. 中国图书馆学报, 1-12[2026-03-27].

https://link.cnki.net/urlid/11.2746.G2.20260325.1017.002.

从公共图书馆到公共智能:

公共知识媒介演化及人文学术范式转型

王军

01

引言

2022年ChatGPT横空出世,使人工智能(Artificial Intelligence, AI)进入全球公众的视野,也迅速成为跨学科讨论的焦点。尽管人工智能的研究早在20世纪中期便已起步,但大语言模型(Large Language Models, LLMs)的自然语言生成能力,使公众第一次直观感受到机器“理解”与“回应”人类语言的可能性。由此,学界与产业界均提出了一系列关切问题:人工智能的知识来源何在,它与人类认知的关系如何,会在多大程度上重塑学术研究,尤其是人文学科的研究范式。

本文从知识媒介演化的长时段视角来回答这些问题。可以预期,人工智能技术在未来数年内将逐渐成为继互联网之后人类社会的信息基础设施。与印刷术和互联网技术类似,大语言模型正日益成为获取信息的重要载体和入口,并重塑我们获取和学习知识的方式。随着这一趋势的发展,它将像印刷术和互联网曾经引发的那样,推动知识生产与学术范式的深刻变革。换言之,人工智能正在展现出成为新一代“泛在媒介”的潜能。而媒介不仅是信息传递的技术载体,更是塑造知识结构、社会组织与文化认同的深层动力。因此,理解人工智能的出现,需要回溯前两次重大信息环境转型:15世纪的印刷文献信息环境与20世纪末的数字化、网络化信息环境。

本文回顾印刷术对现代科学与学术制度的奠基作用,以及“公共图书馆”知识共享机制的形成过程;分析互联网与Web 2.0所孕育的“公共知识空间”,强调开放数据文化的奠基性作用;讨论大语言模型技术是如何依托开放数据文化而发展起来的,并提出“公共智能”概念;探讨智能信息环境下人文研究范式的转变,重点分析研究工具、研究材料与研究尺度的变化;结合北京大学数字人文研究中心的案例,展示智能技术在人文学科的具体应用;最后强调批判性思维的人文学术传统在智能时代不可替代的价值,以及传统人文训练是构建“人机共生”的学术生态不可或缺的条件。

02

印刷文献信息环境与公共图书馆

从人类文明史的长时段视角来看,媒介演化不仅仅是技术的迭代,更是知识生产方式与社会结构的重构动力。15世纪中叶,古腾堡(Johannes Gutenberg)活字印刷术的普及,被视为“现代性”的重要起点之一。印刷术的出现,将知识的生产和传播从手工抄写的局限中解放出来,标志着纸本印刷信息环境的确立。

在印刷术出现之前的中世纪欧洲,知识的保存和传播主要依赖修道院和教会机构,教育的主要内容是神学,核心文本是拉丁文《圣经》,且只有少数受教育的精英阶层有能力阅读拉丁原文。普通民众对宗教与世界的认识,依赖神职人员的口头解释。这种知识解释权和传播渠道的垄断不仅限制了信息的传播速度,也造成了知识获取在不同社会阶层的不平等。活字印刷术的推广改变了这一局面。印刷技术实现了文本的大规模复制,使知识的传播速度与覆盖范围前所未有地扩大。不同民族语言的《圣经》译本相继问世,识字率显著提高,人们有机会直接面对本民族语言的圣经文本,而非通过神职人员来传达“上帝的旨意”,思想解放成为可能。

机械印刷的社会影响可从出版规模的增长窥见一斑。据史料统计,1480年前后,西欧约有110家印刷坊;至1500年,这一数字增长至271家,印刷品总量达两千万册;到1500年时,西欧各地印刷机已累计印制两千多万册印刷品;进入16世纪后,产量更是增长十倍,达到约1.5亿至两亿册。而当时西欧人口仅7300万,人均印刷品2—3册。16世纪,欧洲的活字印刷机单日可完成1500至3600张的印刷。如此高的日均效率,是同期东亚雕版印刷工匠手工刷印难以企及的。

机械印刷不仅改变了知识传播的速度与规模,还推动了学术制度化的形成。手抄本因抄写者的主观添加或疏漏,往往导致同一本书的不同版本存在差异。机械印刷保证了同一版本书籍在结构、内容与分页上的一致性,这是现代学术体系中至关重要的“引用”“著作权”等概念产生的技术前提,出版、评审、引用等一系列现代学术规范,正是在这种标准化的印刷环境下逐渐形成的。正如爱森斯坦(Elizabeth Eisenstein)在The Printing Press as an Agent of Change一书中所论述的,机械印刷带来了抄写手稿所无法实现的稳定性与一致性,这种标准化为现代学术实践提供了技术基础,是现代科学与现代学术规范的制度性前提。

随着19世纪工业化印刷的普及与出版物成本的下降,欧洲逐步建立起现代意义上的公共图书馆体系,其核心特征是由公共财政支持并向社会大众免费开放,不论读者的身份和阶层差别。相比之下,中国古代虽有皇家藏书楼与私人藏书阁,但多不向公众开放,直到辛亥革命后,现代公共图书馆制度才逐步建立。公共图书馆的出现,标志着人类社会第一次在制度层面确认了知识的公共属性,并致力于为所有社会成员提供平等的图书资源。这一制度创新,不仅推动了大众教育与思想启蒙,也成为了以物理载体为核心的“公共文献资源共享”的象征。它构成了现代社会知识基础设施的重要组成部分,塑造了长达五个世纪的知识传播基本范式。

历经数百年的发展,纸本印刷信息环境孕育并推动了出版发行、新闻传播、全民教育、学术研究等诸多行业的形成与繁荣,为人类社会全面发展和平等进步提供了坚实的基础。随着通信技术和计算机技术的不断突破和普及渗透,到20世纪末,人类信息环境经历了由纸本印刷向数字化、网络化的重大转型。这一转型以互联网的普及为标志,使信息得以脱离物理载体,以二进制形式在全球范围内实时传播。

2.1互联网的兴起与信息去载体化

互联网技术产生于20世纪60年代末。到了90年代中期万维网出现,以及图形界面操作系统(如Windows)的流行,使得普通用户无需掌握复杂指令,在网页上移动鼠标、点击链接即可访问全网信息。万维网不仅改变了信息获取的速度与范围,更改变了社会运行的基本方式:购物、交通、通信、教育等服务机构逐步将业务迁移至线上,形成全新的数字社会形态。互联网的核心特征之一,是信息的“去载体化”。在纸本环境下,知识要依附于书籍、期刊等物理载体来传播,而在数字化环境中,文字、图像、音视频等内容均以数字形式存储与传输,突破了空间限制,实现了“足不出户而知天下事”的信息平权。

2.2Web 2.0与用户生成内容(UGC)

互联网早期的知识生产主要由机构主导,用户的角色是“信息消费者”。然而,2000年前后兴起的Web 2.0运动,使用户得以通过博客、视频网站(YouTube、优酷等)、社交媒体(Twitter、微博等)、大众书签(Delicious)等平台直接生成内容。2006年,《时代周刊》将年度人物授予“You”,象征每一位网民都是信息的生产者与传播者,这就是Web 2.0所标志的核心模式——用户生成内容(UGC),自此引发网络信息量的爆炸式增长。全球范围内,无论是个人还是团体,政府还是企业,纷纷在互联网上发布信息。各种语言、各个行业、各个学科的知识和资讯,以及其中所蕴含的丰富的操作过程、组织方式和处理逻辑,由此汇集于网路空间,共同绘制出一幅全球网民协力编织“世界知识”的壮丽图景。这为随后兴起的以数据驱动为核心的大模型技术提供了规模空前的数据基础和文化准备。

2.3“公共知识体”与开放数据文化

Web 2.0时代的UGC,不仅引发了信息量的爆炸式增长,也催生了集体协作的知识生产方式和开放数据文化。维基百科(Wikipedia)是最具代表性的案例。与传统由专家编纂百科全书不同,维基百科允许任何用户参与词条撰写与编辑,形成一种基于网络协作的知识生产模式。这一机制体现了“集体智慧”(collective intelligence)的理念,即无论个体的专业背景或社会地位如何,都可以参与到知识共建的活动中来。与纸本印刷时代依托公共图书馆实现知识共享相比,维基百科依托互联网平台展开的知识众包模式,使得知识共享的范围大幅扩展、更新时效性显著提升、协作的粒度也得以延伸到更细微的知识单元。这一转型意味着人类社会的知识共享机制从“公共图书资料”进入到“公共知识空间”(public knowledge space)的新时代。与前者依赖物理场所提供载体共享不同,公共知识空间以网络平台为媒介,直接实现知识内容本身的开放与共享。Web 2.0孕育了互联网的“开放数据”(open data)文化——全球范围内,无论是个人还是团体、政府还是企业,都可以在网络上访问、分享、再利用信息资源,使得知识跨越地理与文化边界,以全球化方式流动与扩散,促成了跨国、跨语种的全球知识共同体的形成。这种由网络推动的“公共知识”机制,成为大语言模型等人工智能技术得以构建的文化基础。它不仅实现了信息获取的平权化,更为机器学习提供了规模空前的开放数据资源,为数据驱动的大语言模型的出现准备好了数据基础。

03

大语言模型与“公共智能”的兴起

3.1 书目统计及典籍存佚

进入21世纪第三个十年,人工智能,尤其是基于大语言模型的生成式AI,成为继印刷术与互联网之后又一次重塑知识结构的关键技术。

虽然互联网与Web 2.0实现了知识生产前所未有的开放与共享,但知识的呈现方式仍以静态为主。即便用户能够快速检索到所需信息,仍需依靠自身的阅读与理解,将其转化为对具体问题的答案。以ChatGPT为代表的大语言模型的突破在于,它们可以直接以自然语言与用户交互,根据提示生成连贯且贴合语境的回答,从而省去了传统的“查找—阅读—整合”的过程。流畅的自然语言生成,再加上强大的上下文学习能力和广泛的世界知识,使用户第一次直观感受到机器所展现出的类似智能的表现。

(1)所谓上下文学习(contextual learning),是指大语言模型能够利用用户提供的上下文信息,包括对话历史、任务指令、文本语境,甚至示例与反馈,动态调整生成内容。这种能力使其在交互中表现出高度的适应性与针对性。

(2)所谓世界知识(world knowledge),是指大语言模型通过对大规模语料的训练,汇聚了跨语言、跨文化、跨学科的世界知识储备,涵盖自然科学与人文社会科学的广泛领域。这些知识构成了自然语言生成与理解的基础,使其能够处理从常识性问题到专业性任务的多样需求。

无论是自然语言生成,还是上下文学习,大语言模型之所以能够展现出超越性的自然语言能力,根本上依赖于其所汇聚的“世界知识”,亦即训练数据的规模与开放性。自20世纪90年代互联网普及以来,全球用户与机构持续上传文本、图像、音视频等多模态数据。这些数据在个体层面或许零散、琐碎,但在超大规模的聚合下,通过深度神经网络的模式学习与参数化表示,得以产生“智能涌现”(emergent intelligence)现象。这一现象与人类的知识积累过程具有类比性:正如学者的创造性往往源于广泛的阅读与跨领域的交流,大语言模型的创造性亦建立在对多元数据的整合与再生成之上。

因此,从人文社会的视角来看,人工智能的诞生并非偶然的技术奇点,更不是单一企业或机构的孤立创新,而是自活字印刷术发明以来,开放文化、知识共建与技术演进共同推动的历史必然。开放数据驱动的大模型技术,通过互联网平台与移动终端实现全民可及、即时交互,成为全社会成员皆可使用的“公共智能体”(public intelligence)。如果说“公共知识”阶段实现了信息与知识的获取平权,那么“公共智能”阶段则进一步推动了认知能力与思考力的平权,使人人皆可借助智能工具获得理解、分析、推理与创作的能力。由此,人类社会的知识共享机制进入了新的阶段,“公共智能”将成为继公共图书馆与公共知识空间之后,人类社会知识共享的新型基础设施。

04

智能信息环境下人文研究资料的重构

自15世纪中叶印刷术诞生以来的近六个世纪,人类信息环境的演进轨迹为我们理解智能时代的人文研究提供了重要的历史视角。现代人文学术研究的基本范式是在纸质印刷环境下逐渐确立的:通过标准化出版程序,形成了“资料收集—写作发表—出版引用—同行评议”的学术流程和相应的评价体系。这一学术范式赖以存在的基础,是以公共图书馆和学术出版体系为代表的人类知识共享机制,它为以图书与期刊为主要载体的知识进行系统性的收集、整理、传播与再生产,提供了社会性与制度性的保障。进入网络化数字化的信息环境后,信息检索效率显著提升,知识传播的速度和范围空前拓展。然而,资料的阅读、理解和消化最终仍依赖研究者个体,其阅读量和认知容量仍受限于个体生命历程与个人精力。因此,尽管网络技术极大提升了知识的可及性和流通性,学术研究的基本范式在本质上依然延续着纸本文明时期所形成的传统路径。相比之下,智能信息环境则预示着一种全新的研究格局。凭借上下文学习、世界知识储备和自然语言生成的能力,LLMs使人机协作模式发生根本性转变,从而重塑人文学科的研究工具、研究材料与研究方法。这种变革不仅体现在研究规模和效率方面,更在资料规模的穷尽性、知识单元的细粒度化,以及人机协作的共生化等方面,为人文研究开辟了前所未有的可能性。下文将结合北京大学数字人文研究中心的实践予以阐释。

4.1 资料获取的穷尽化

传统人文研究依赖学者个人所掌握的档案、文献、田野记录,其数量和范围受制于研究者的时间、精力和认知容量。在智能技术的辅助下,人文学者能够驾驭的资料规模、类型和语种得以超越个体能力的限制。具备多模态理解能力的大模型,使得对超大规模语料、图像、影音资料的检索、比对和综合成为可能,从而极大地扩展了研究的认知边界。在古典文献、古代历史等特定领域,研究者得以在几乎“全量”的资料空间中展开工作,这为学者观察宏观趋势、探索长时段历史和回应重大跨学科议题提供了新的可能。

为了全面系统地反映中国古代书目的建设和发展情况,北京大学数字人文研究中心与孙显斌合作研发了“经籍指掌:中国历代典籍目录分析系统1。它将上始《汉书·艺文志》,下讫《清史稿》的八朝官修目录加以集成,跨越汉、隋、唐、宋、元、明、清等朝代,再加上《四库全书总目》和现代编撰的《中国古籍总目》,累计299 206条古籍书目,是对中国古籍目录的一次系统整合。该系统中,在宏观层面,研究者可以观察不同历史时期生产和收藏古籍的总量变化(见图1),进而直观考察古籍总量的增长轨迹和知识体系的长时段演化,这种全景式的观察,唯有在全量数据的支持才可以实现。在微观层面,研究者可以考察任一古籍两千余年来的版本流变,追踪它在历朝目录中的记载、更名或重编;可以分析任一类目在后世的演化情况,乃至通过共现关系而关联在一起的书群的聚散离合现象。借助大数据和可视化手段,可以方便地观察中国古代两千年来古籍类目演化、版本流变和知识谱系的结构变更。

图1 历代官修典籍目录数量分布

“经籍指掌”系统汇集的是古代典籍的书目元数据信息。存世的中国古代文献数量毕竟有限的,若能将存世古代文献全部汇集起来,研究者便能在完整的资料空间中考察中国古代思想观念发生、发展与演化,从而避免个体阅读范围有限所造成的偏差。“《论语》复用可视化分析平台”2展示了这一可能性。该平台在《中国学术名著提要˙哲学卷》所收录的全部语料基础上构建,利用语义相似度计算,穷尽式地将后世文献中与《论语》原词或原句意思一致或相似的文本片段无一遗漏地找出来,既包括对原词原句的直接引用,也包括词形句形虽有变化但是意思一致或相近的间接引用,从而观察它们在后世的演化轨迹。在这一框架下,复用数据越完整,越能真实反映思想观念的历史流传全貌。据此还可以观察某一观念乃至某篇章节在不同时代的复用情形,从而揭示其在不同时代所受到的重视程度及其思想史意义(见图2)。

图2 《论语》各篇章在各时代的复用统计

4.2 资料的结构化与图谱化

人文学科的研究对象大多属于人类历史与文化的记忆材料,如史料、典籍、书画等,原本是以人类的阅读、欣赏和记忆为前提而制作与流传的。然而,当研究追溯至历史深处,需要处理考古遗存、古代文献与艺术典籍等文化遗产材料时,它们往往因年代久远、语言艰深、结构复杂而含义隐晦,即便是专业学者,也常常需要多年训练才能加以解读与阐释。资料的智能处理,核心在于将原本面向人类理解的材料重构为面向机器处理的数据。这一过程可以借助多模态大模型的文字识别、图像处理、命名实体识别与语义标注等手段,把文字、图像、影像等传统文史资料统统转化为结构化数据,并进一步构建富含语义关系的知识图谱。通过这种方式,研究者得以在大规模数据集上开展统计分析、比较研究,乃至进行推理与阐释。这为人文学科中难以直接解读的文化遗产材料开辟了新的研究路径。基于这一理念,北京大学数字人文研究中心研发了“吾与点”智能人文平台3,其核心目标在于实现人文学科研究材料的结构化与图谱化。平台内置了多种主流大语言模型的接口,研究者可以根据任务需求灵活调用合适的模型,对文本或图像等原始资料进行处理。在具体操作上,用户首先将材料上传系统,并依据研究目的自定义所需的数据结构。例如,可以设定从文本中抽取人名、地名、官职等字段,或为图像建立标注与描述的维度。平台随后调用指定模型,自动完成信息抽取与标识,随后生成二维表格,或构建包含丰富语义关系的知识图谱。这样,原本以顺序书写形式存在的文史材料,便可转化为结构化数据,实现从线性文本到表格、再到知识图谱的多层次转换(见图3)。

图3 “吾与点”平台智能生成的《史记˙孟子荀卿列传》知识图谱

更为关键的是,这一过程并不仅仅是形式上的转换,而是对材料的重新组织与语义重构(见图4)。传统文史典籍是面向人类阅读的线性文本,而研究往往需要按概念或关系进行聚合与比较。“吾与点”能够利用大语言模型的语义理解能力,从资料中抽取并关联信息,例如,识别史料中同朝为官且具父子关系的人物,汇总《三国志》中涉及战争的所有段落,或集中整理关于某一学者的记载。通过这种方式,材料得以打破原有的书写顺序,依据研究者的需求重新组合,最终形成可供计算分析的知识图谱。这不仅显著提升了人文学科的数据处理能力,也为资料的重构与深层解读提供了新的可能。

图4 吾与点平台基于“人—出生—某国”的关系对《三国志》文本聚类

4.3 知识处理单元的微细化和原子化

搜索引擎时代,机器返回文档级或篇章级的结果以响应用户查询。研究者需要进一步细读来筛选所需要的内容。进入智能时代,大语言模型凭借其语义解析能力,将分析从书籍、章节等宏观单元,进一步细化到段落、句子、词语甚至词元(token)的原子级别,从而赋予研究者精确识别跨文本的细粒度语义关联,并在大规模语料中展开定量分析和计算建模。例如,思想史研究中可追踪特定概念在不同历史语境中的微妙差异,文本学研究能够捕捉跨文本的复用、改写和风格变异,而文化传播研究则能够刻画概念、隐喻或叙事单元在跨地域与跨语种中的迁移和扩散。这种从宏观视角对大规模文化现象的考察,正体现了莫莱蒂(Franco Moretti)所倡导的“远读”(distant reading)范式——即通过计算方法揭示传统文本分析难以察觉的文学演进规律与全球性文化联系。

这一理念可追溯至基于词频统计的数字概念史研究,例如金观涛与刘青峰在“中国近现代思想史专业数据库(1830—1930)”中,对“公理”“社会”“个人”“世界”等关键概念的词频进行统计,考察它们在百年间相关文献中的传递与嬗变,进而分析词义变化所折射出的社会心理特质与时代变迁。更复杂更精细的方法是利用词嵌入表征检测跨文献的 n-gram 互文,使文本分析的尺度能够从整部文献或篇章级别下沉至段落、句子乃至词语的“原子化”层级。北京大学数字人文研究中心在一个涵盖唐以前大多数典籍及部分后世经典的大规模语料库上,检测出千万级别的互文,并通过上下文语境分析,描绘观念在超长时段中的语义演化轨迹。

例如,从《论语》中的“一箪食一瓢饮”出发,经《孟子》《新语》《盐铁论》《汉书》《论衡》等典籍不断被引用、缩写与转化,最终凝练为流传广泛的典故(见图5)。这一追踪过程展示了观念如何由具体叙事逐渐抽象化为符号化表达。又如,通过互文计算追溯《韩诗外传》中的“伪诈不可长,空虚不可守,朽木不可雕,情亡不可久”一语,发现其子句构成分别来自对《韩非子》原句“矜伪不长,盖虚不久”的化用,及《论语》原句“朽木不可雕也”的直接引用,再附上《韩诗外传》作者自撰的“情亡不可久”而形成,从而揭示了思想观念的复杂源流。

图5 采用互文计算追溯“箪食瓢饮”典故的形成

05

智能时代的研究范式

人工智能在工具层面与材料层面带来的根本性变化,必然推动人文研究范式的转型。首先,近乎全量的资料规模将极大拓展研究问题的空间,研究者得以在更大范围内提出和检验新的问题;其次,智能处理能力正在重构方法论格局,使传统人文学术依赖的“诠释”方法与算法化的“计算”分析趋向互补与融合;最后,工具的智能化发展意味着人机协作机制的演进,其终极形态将走向“人机共生”。

5.1问题空间的极大扩展

受限于个体精力与认知负荷,传统人文学者一般选择具体而微的研究问题,通过对局部材料的精读,从个案出发,以“小中见大”“一叶知秋”的方式,推演宏观结构与历史脉络。

而在智能工具的加持下,研究者能够从大规模数据集中识别模式、发现问题,并提出过去因资料规模过大而难以驾驭的问题。美国学者安德伍德(Ted Underwood)通过分析数万本文学作品,用计算方法来回答关于文学史演变的大问题,例如小说体裁如何随着时间的推移而变化、批评家对文学作品的接受模式如何演变。他在著作Distant Horizons: Digital Evidence and Literary Change中指出,通过在数以千计的文本中汇聚证据,研究者能够发现个别作品层面无法呈现的长期变化与宏观模式。

这表明,数字与智能工具使得学者能够在大规模数据集中识别规律,进而探索“大趋势”“大历史”层面的学术问题。基于大趋势的观察,研究者又可以筛选出对应的具体文本,深入细读和分析诠释,随时在宏观把握和微观诠释之间灵活切换,从而既能把握整体大势,又能穷究细节。这一范式的转型,将赋予每个研究者“致广大而尽精微”的研究能力。

5.2 诠释和计算的复合运用

传统的人文学科强调“精读”与解释。然而,正如莫莱蒂所言:“精读并不是一种可扩展的方法……远读则使我们能够聚焦于比文本更小或更大的单元:如修辞手法、主题、母题,或是文类与体系。”在人工智能技术的加持下,基于大数据的远读模式将更加流行。面对超越个体消化能力的庞大资料集,研究者需要将传统的诠释学方法与统计建模、机器学习等计算手段相结合,从而形成“量化统计—质性解释—智能辅助”相融合的研究路径。换言之,纯粹依赖解释的研究模式仍然不可或缺,但质性与量化相结合的研究范式正在逐步成为主流。这不仅要求人文学者具备一定的量化分析能力,成为具有跨学科素养的研究者,也意味着人文研究将越来越强调团队协作,人文学者与计算机科学家、数据工程师的合作将逐渐成为常态。

5.3 人机共生的协作范式

如果说搜索引擎时代的人机关系是“人机协作”,即计算机收集和提供信息并提供创作工具,而用户则理解、消化信息并自主生成知识,那么,在大语言模型的三大能力——自然语言生成、上下文理解与世界知识整合——的支撑下,人机关系将进化为“人机共生”,即人与AI共同参与知识生成,形成“增强式研究”范式。基本协作流程是:学者提出问题→ AI进行初步分析→ 学者批判性判断→ AI根据反馈进一步优化。如此循环迭代,研究者与AI不断交互从而构成一种动态的知识共创机制,显著提升知识生产的速度与质量,并拓展学术创新的可能空间。

北京大学数字人文研究中心研发的“吾与点”平台,在数据智能处理的基础上,已经升级为智能体开发平台,其核心目标是支持用户在私有数据集之上构建个性化的专属智能体。用户上传私有资料库之后,平台首先智能生成结构化表格或知识图谱,继而根据用户需求创建多功能智能体:既可作为智能助手协助用户对数据集做深度分析,亦可作为小程序向他人提供基于私有数据集的知识服务。与传统的信息传递和知识共享不同,这种“资料集—知识库—智能体”的全链路转化,为用户提供了将自己独有的分析视角、研究思路和处理逻辑也分享给他人的通道。借助这样的智能平台,用户不仅能打造学习和科研的智能助手,还可以化身为“微图书馆”,为大众提供特色服务。

06

结语

综上所述,智能时代的来临为人文学科带来了前所未有的工具与方法,使研究能够在更大规模的资料、更细微的知识单元上展开,并推动学术范式的深刻变革。然而,真正的学术洞见仍然依赖于人类所独具的历史感、价值判断、批判精神与创造性思维——这些都是任何算法无法替代的。在未来的人机共生模式中,机器的优势在于规模、速度与模式识别,而人类学者的价值则体现在问题的提出、意义的阐释以及文化与伦理的关怀。正因如此,传统人文学科的训练依旧不可或缺,文本细读、历史语境的把握、逻辑与修辞的训练,都是塑造人文学者的基本功夫,也是人机协作得以真正发挥作用的前提。换言之,人工智能的繁荣是否会削弱人文学科,在很大程度上取决于我们对人文学术根本价值的理解与坚守。如果仅把人文学科视为文字生产的工具或特定思想的附属装饰,那么其式微几乎不可避免。但如果承认并珍视人文学科在探寻人类存在意义、反思文化价值与提供伦理关怀方面的不可替代作用,就应当在智能时代更加珍视人文学术的传统价值,善用智能技术打造符合人文学术特质的数字人文研究平台,从而充分发挥人类心智与文化创造的独特力量。

*本文原标题《从公共图书馆到公共智能:公共知识媒介演化及人文学术范式转型》,有删节,网络首发于知网,参考文献从略,下载全文请登录中国知网首页检索。

阅读原文

跳转微信打开

  •  

从燕京引得到识典古籍:现代科学方法整理中国古籍的学术脉络

2026-01-12 19:00 北京

编者按:

本文是北京大学数字人文研究中心副主任杨浩,在“数智时代古籍研究前沿论坛暨‘我用 AI 校古籍’(2025 年)总结会”上的主旨报告发言稿,主题为《从燕京引得到识典古籍:现代科学方法整理中国古籍的学术脉络》。现将全文呈现,以飨读者。

杨浩老师梳理了“识典古籍”平台的构建逻辑与学术根基:平台深植于北大“整理国故,再造文明”的传统,借鉴《儒藏》工程的编纂经验,同时吸纳王军教授多年深耕于数字人文的理念,实现了传统学术与数字技术的深度融合。文中详解平台的创新范式、资源建设策略与国际合作格局,展现AI时代古籍整理的传承与革新。原文如下:

尊敬的各位来宾、各位学界同仁:

从燕京引得的一张张卡片,到如今云端的亿万字符,已经走过了一百年。识典古籍平台,不仅是新技术的练兵场,更是北京大学“整理国故,再造文明”精神在AI时代的重生。在这里,算法不再是冰冷的代码,因为其间流动着学术的温热;技术不再是机械的工具,因为其下奠基着深厚的传统;平台不再是静止的库房,因为其上正演绎着文明的重生。

一百年前,胡适先生振臂一呼,提出了“整理国故,再造文明”的宏愿,以“历史的眼光”、“系统的整理”和“比较的研究”,为中华典籍寻求新的研究方法论。他所构想的“系统的整理”,一为“索引式的整理”,要使古书人人能用;二为“结账式的整理”,要使古书人人能读。后世的古籍整理工作,皆是接踵此两条路径而展开。三为“专史式的整理”,构建全新的文化史体系,要“再造文明”。


随后的洪业先生的燕京引得编纂,实际上就是“索引式的整理”。1930年,他在燕京大学主持成立哈佛燕京学社引得编纂处,以标准化的严密流程,编纂了64种“汉学引得”。虽然那些泛黄的纸质索引如今已被数据库取代,但它们作为“史学现代化第一步”的功勋,永不磨灭。


百年后的今天,文明传承的责任依旧沉重,但AI技术的浪潮为“整理国故”带来了新的曙光。光学字符识别(OCR)、自然语言处理(NLP)等技术,使得高效、规模化地整理古籍成为现实。

“识典古籍”整理平台的设计并非无本之木。上世纪80年代成立的全国高等院校古籍整理研究工作委员会(简称“古委会”),在国家层面统筹规划,为高校古籍整理事业奠定了坚实的制度磐石。正是在这一深厚的学术土壤中,汤一介先生于2003年倾力开启《儒藏》工程,工程汇集五百学人,历时二十载,终成精华编二百八十二册。“识典古籍”整理平台正是直接汲取了这一宏大实践的宝贵经验。


《儒藏》编纂严格依据底本的“存真原则”,是识典古籍平台“图文对照、一字一据”的根本法则。《儒藏》编纂采用统一的体例,13道工序,批量整理的思路,是平台规模化运作的理论基础。此外《儒藏》编纂的校勘规范、标点体例、校点说明撰写、工作流程、质量控制等多个维度上,也都为识典古籍平台构建提供了最稳固的支撑。

《儒藏》的恢弘实践,是识典古籍整理平台“整理国故”的“道”,而北大王军教授在数字图书馆近二十年的深耕,则是走向这个目标的“术”。王军教授所提出的“从文献库到知识服务引擎”的理念,所设计的“图像化-文本化-数据化-知识化-智能化”的全链路升级方案,所倡导的“人机协同与大众参与”的开放生态构想,为“识典古籍”搭建起了数字世界的骨架。而字节跳动卓越的产品打磨与平台工程能力,则是将此蓝图落地的坚实底座。正是得益于这种强大的技术实现力,复杂的编纂设计思路才得以真正化为触手可及的现实。因此,识典古籍平台始终坚持“两条腿走路”:一条腿深植于传统古籍整理的学术土壤,另一条腿则坚实地踏在数字人文研究的前沿阵地。

更令人感动的是一种反哺。识典古籍整理平台脱胎于《儒藏》的经验,而今,成熟的技术又将回馈《儒藏》工程本身。2024年12月,字节跳动助力北京大学“《儒藏》数字化项目”正式启动,全本《儒藏》的编纂将利用识典古籍整理平台全面展开,这正是技术与学术最美好的双向奔赴。

在识典古籍阅读平台的设计上,也广泛借鉴了各类先行者的智慧。纵观现有的古籍数据库,可谓各擅胜场:有的专注于“纯文本”,以精审的文字和规范的编码见长;有的深耕于“商业图文”,以丰富的资料和先进的对照体验取胜;有的致力于“纯图像”,最大限度保留古籍原貌与版本价值;有的立足于“整理本”,在精准文字的基础上提供深度的阅读功能;更有的探索“众包协作”,汇聚大众之力共建共享。


识典古籍的野心,便在于博采众长,试图将这五种模式的精髓融于一炉,实现一场集大成的“融合创新”。

这一创新,具体体现为一场全方位的范式革命:

在作为基石的呈现形式上,不仅坚守“左图右文”的学术严谨,更将右文创新为现代标点横排,彻底打破了“存真”与“普及”之间的坚冰;


在作为骨架的文本结构上,不仅遵循国际通用的学术标准,更将每一个数字字符与原始图像字形精确锚定,真正实现了“字字有据”的深度关联;


在作为血肉的阅读功能上,不仅满足基础的检索需求,更利用AI技术让静态文本“活”了起来,人名可点、古文可译、疑问可答,赋予了古籍以鲜活的生命;


在作为灵魂的参与模式上,不仅提供单向的知识服务,更通过“我是校书官”平台,将被动的阅读者转变为主动的校勘者,让每一位参与者都成为文明传承的在场者。

为了支撑这一革命,平台上设计了贯穿全程的八大核心环节,并设立了“AI整理、粗校、精校”三级标准,实现了“先快速上线、后持续优化”的迭代模式。这彻底改变了传统出版“一经刊印、难以更改”的静态范式,让古籍整理从“刻石成碑”进化为“生生不息”的动态过程。


为将这一理念落到实处,我们探索出了一套多元化的资源建设策略,针对不同古籍的特性,施以最合适的工序。其一为“AI整理”,如同先锋部队,利用成熟的OCR与自动结构识别技术,以雷霆万钧之势,迅速将海量文献转化为可用的数字底本。其二为“批量加工”,如同机械化军团,将线下批量处理的数字化成果,通过自动化脚本,快速、成建制地导入平台。其三为“精校加工”,如同特种部队,在平台上对重要典籍进行多轮次、出版级别的精细打磨,攻克学术难关。最后,也是最具活力的一环,是“众包校对”,也即“我是校书官”模式,则如星火大军,聚则一团火,散则满天星,汇集天下之智,积众力以成浩瀚。


通过这四种建设路径,平台已完成4万余种古籍的数字化,其中对《四库全书》、《四部丛刊》、汉文大藏经(六种版本)、百衲本二十四史等核心文献进行了精准的文字校对,并施以现代标点。平台还系统收录《永乐大典》、《道藏》以及藏外道书,以及CADAL项目的上万种古籍。从通用典籍到特藏资源,一个完整的古籍数字体系已初具规模。

“学术乃天下之公器”。2023年,哈佛燕京图书馆将馆藏9000余种珍贵中文善本古籍的全部数字化书影无偿捐赠给北京大学。这不仅是数据的交接,更是洪业先生与哈佛燕京学社合作历史的延续。这些数据整理后将无偿回馈全球,真正实现了资源的闭环。继哈佛之后,普林斯顿大学、法国国立国会图书馆、CADAL项目等海内外重磅机构也纷纷加入。数据的流动,让全球汉学界紧密相连,一个开放、共享、互利、共赢的国际合作网络已然成形。


回望来路,可以清晰地看到一条学术演进的脉络:从胡适的倡导,到洪业的实践,再到汤一介先生的规模化探索,最终汇入今日识典古籍的智能化浪潮。

然而,“整理国故”并非终点,其目的在于“再造文明”。未来,平台将持续加强资源建设的数量与质量,推动全球中华古籍的数字化回归,开发各类面向学术研究的智能工具,支持跨学科、跨机构的协作研究。平台的愿景,是将识典古籍建设成为全球汉学研究的枢纽。在这里,资源得以汇聚,学者得以协作,思想得以碰撞,文明得以赓续。

《诗》云:“周虽旧邦,其命维新。”

识典古籍,正是以今日之技术,激活传统之血脉,在继承中创新,在开放中前行,在共享中致远。

谢谢大家。


北京大学数字人文研究中心副主任杨浩



阅读原文

跳转微信打开

  •  

“我用 AI 校古籍” (2025年)总结会圆满落幕,“法藏敦煌大众整理”计划同步启动!

2026-01-11 15:47 北京

2025年1月10日,由全国高等院校古籍整理研究工作委员会(简称“古委会”)主办,北京大学中国语言文学系古典文献教研室、北京大学数字人文研究中心与字节跳动公益联合承办的数智时代古籍研究论坛暨 “我用 AI 校古籍”(2025年)总结会在京圆满落幕。该会议由字节跳动公益团队策划并筹办,核心聚焦“我用AI校古籍:‘我是校书官’古籍大众智能整理计划”的亮眼成果,同步总结近三年“识典古籍”平台建设成果。来自全国各地高校、图书馆、出版社的近300名学者及古籍爱好者报名参会,北京大学党委副书记姜国华,教育部社科司、文旅部公服司、北京市委宣传部、古委会秘书处及抖音集团相关领导出席大会并致辞。


在字节跳动公益基金的资助下,北京大学与字节跳动联合打造的“识典古籍”平台,既是“我用 AI 校古籍”活动的核心支撑,也是全球规模领先的古籍智能化整理与数字化阅读平台。经过近三年建设,平台PC端网站与移动端小程序同步向全球开放,已上线4.7万部古籍资源,月服务用户超240万人,日均检索量达35万人次,总访问量突破1.47亿次。

平台深度整合人工智能技术,构建起从OCR文字识别、自动标点、专名提取到多版本智能校勘的全流程解决方案,彻底打破古籍整理的专业门槛,让普罗大众参与文化传承成为可能。

2024年7月,由古委会主办、北大数字人文研究中心与字节跳动公益联合发起的“我是校书官”古籍大众智能整理活动正式启动。依托“识典古籍”平台的技术支撑,活动累计吸引近3.8万人参与,其中高校学生近2万人、覆盖全国近1500所高校,社会公众近1.8万人,形成学界与社会同频共振的参与格局。

截至目前,活动已完成2万余部古籍的整理工作,粗校字数达15亿,精校字数达1亿,整理效率较传统模式提升数十倍。活动全程获得新华社、人民网等权威媒体聚焦报道,成功让古籍整理从“冷门绝学”转变为全民关注、全民践行的文化热潮。

目前,已有四千余个团队通过平台参与在线古籍整理,既包括北京大学《儒藏》编委会、清华大学人文学院、暨南大学文学院等专业科研力量,也涵盖多家古籍出版社及民间爱好者团队。“人机协作”的古籍整理模式,不仅有效提升了古籍整理效率,拓展了古籍整理参与主体的范围,也为专业人才培养和跨界协作提供了新的实践空间。部分高校已将“识典古籍”平台引入相关课程教学,让学生在实操中培养古籍整理技能;社会公众的持续参与也汇聚起推动古籍数字化整理与传播的社会力量,让古籍文化以更贴近当代生活的方式走进公众视野。

北京大学党委副书记姜国华在致辞中指出,作为全国首个设立古典文献学专业的高校,北京大学始终坚守古籍整理学术高地。新时代北大携手字节跳动公益打造“识典古籍”平台,以科技搭建传统与现代、专业与大众的桥梁,为古籍数字化筑牢技术底座并推动大众参与。由古委会、北大数字人文研究中心与字节跳动公益联合主办的“我用 AI 校古籍”计划,打破专业壁垒,让学子与大众共同守护文脉,既提升了整理效率与质量,也探索出专业教育与社会参与深度融合的新路径。

古委会秘书长卢伟在欢迎致辞中表示,古委会成立40余年来,统筹高校古籍整理、研究与人才培养。 “我用 AI 校古籍” 活动开辟人机协同新途径,希望未来秉承坚守传统、跨界融合的理念,共推新时代古籍事业高质量发展。

抖音集团企业社会责任部总经理杨洁在欢迎致辞中表示,字节跳动秉持务实的公益理念,聚焦古籍修复、数字化与活化传播,构建了从古籍修复、数字化到活化传播的全链条,通过抖音等平台让古籍内容触达大众,形成技术赋能与大众传播的良性生态,推动传统文化融入现代生活。

北京大学数字人文研究中心常务副主任杨浩的主旨报告《从燕京引得到识典古籍:现代科学方法整理中国古籍的学术脉络》,深情回顾百年学术传承:从胡适先生倡导“整理国故、再造文明”,到洪业先生创办“燕京大学引得编纂处”,再到汤一介先生主持《儒藏》工程,北大始终坚守文脉守护的使命。到如今北大数字人文中心联合字节跳动公益打造“识典古籍”平台,并发动 “我是校书官” 大众整理活动,正是这份传承在AI时代的创新延续。

“识典古籍”已成为全球规模最大的古籍智能化整理与数字化阅读平台。凭借平台在古籍保护与传播领域的广泛影响力,继哈佛燕京图书馆将所藏全部善本古籍数字化拷贝捐赠北大数字人文研究中心之后,法国国家图书馆于2025年11月也将所藏全部敦煌文献的数字化拷贝捐赠予北大数字人文研究中心。

敦煌遗书是中华文化的瑰宝,也是习近平总书记十分关心的流失海外典籍。姜国华副书记在致辞之后郑重宣布:“千年敦煌、指尖重光”——法藏敦煌大众智能整理计划正式启动!该计划将依托“识典古籍”平台,邀请广大志愿者参与敦煌写卷的智能整理,为全球学界提供开放共享的优质文化资源,助力敦煌学研究再上新台阶。

在全场瞩目下,北京大学党委副书记姜国华、教育部社科司科研处长卢丽君、古委会秘书长卢伟、北大数字人文中心主任王军、抖音集团企业社会责任部总经理杨洁共同为“千年敦煌、指尖重光——法藏敦煌大众智能整理计划” 按下启动键。

在发言最后,姜国华副书记倡议到:老师们、同学们、朋友们,面向未来,古籍事业的发展既需要专业学者的深耕、技术力量的赋能,也需要企业的公益担当,更离不开社会公众的广泛参与。北京大学将继续发挥学科交叉优势,与古委会、字节跳动及社会各界携手并进,推动古籍保护事业迈向新高度,让千年文脉在智能时代绽放出更加璀璨的光芒!


阅读原文

跳转微信打开

  •  

讲座回顾:AI时代的人文研究如何重构研究流程?

2026-01-09 10:01 北京

数智时代,ChatGPT等大模型呼啸而来。微软报告中 “历史学家91%的工作技能可被AI辅助” 的数据,焦虑似乎在所难免。当技术浪潮席卷,传统的治学方式是否即将被颠覆?在刚刚结束的教育部虚拟教研室“AI赋能课程建设”系列公益讲座中,北京大学数字人文研究中心主任王军教授与中国社科院大学数字史学研究中心主任向静老师,联袂带来了一场关于“数智时代史学重构”的深度对话。

王军教授在开场便直击核心:这91%并非替代,而是解放。如果学者能将繁重的资料清洗、整理工作交给AI,便能从文献资料的“伏案梳理者”,转型为研究逻辑的“框架构建者”。而实现这一身份跨越的关键,正是一套能让人文材料与 AI 技术精准衔接的专业工具 。本场对话的核心载体吾与点智能数据平台,恰为人文研究在数智时代的转型发展提供了这样的全新路径。

祛魅与赋能


AI是概率而非真理

面对ChatGPT等通用大模型的普及,王军教授首先为AI时代的焦虑祛魅。这些看似无所不能的工具,本质上是“文字接龙”的概率模型。它们追求语言的通顺连贯,却缺乏对事实的敬畏与考证意识。但这并不意味着人文研究要对技术敬而远之。恰恰相反,大模型基于海量数据的“涌现”能力,能将学者从资料搬运、清洗、整理等繁重的机械劳动中解放出来,让研究者回归问题意识与价值判断这一人文学科不可替代的主体性。

吾与点智能数据平台正是为这种人机协作的赋能需求而构建的。不同于通用大模型,它深度融合大模型技术,形成专属人文研究的技术解决方案:既能高效处理图像、PDF、青铜器拓片等多模态信息,又能将零散的非结构化文本转化为结构化数据与知识库,更创新性地搭载了智能体(Agent)封装功能。研究者可将自有史料上传至平台处理,生成专属智能研究助手。智能体既能基于材料回应学术问题,又能提供完整的信源索引,还能实现关系网络、地理空间等多维可视化呈现,让静态的研究成果具备可交互性,助力学术探索。

实践见真章

D

从史料到洞见的智能跃迁

工具的价值,终究要在实践中检验。向静老师带领团队利用吾与点智能数据平台开展的两项数字史学研究,生动展现了平台如何助力人文研究从材料处理迈向洞见生成。

在明代宦官墓志铭研究中,面对晦涩难懂的文言文本和海量信息,传统手工摘抄往往耗时数月且易遗漏关键细节。而通过「吾与点」平台的多模态OCR,平台能直接识别墓志图片,自动提取墓主姓名、籍贯、官职升迁路径等核心字段,快速生成结构化表格。

更令人惊艳的是其推理性考证能力:当史料仅记载某宦官 “早以俊秀”却无具体年份时,平台会调用大模型,结合墓主生卒年及明代选拔惯例,推算出入宫年龄约为4-20岁,并明确标记为 “推测”,填补了史料阙如。对于宦官复杂的官职迁转记录,平台还能自动生成嵌套列表,清晰呈现每一次升迁的时间、职位与部门,为后续量化统计做好充分准备。


在《明代名人传》的研究中,研究团队先在平台中定义了“同乡”“门生”“政敌”等关系类型,平台自动抽取人物实体并用小程序功能实现关系网络,直观呈现出15世纪江西籍官员政治集团。那些隐匿在浩如烟海史料中的地缘纽带与政治关联,在可视化图谱中一目了然,不仅验证了传统史学关于地缘政治的定性描述,更让隐性的历史网络成为可分析、可佐证的研究对象,推动研究从表层文本解读走向深层关系挖掘。

这场技术赋能的背后,是人文研究范式的深刻变革。王军教授在讲座中提出的观点引人深思:如果说传统学术传承强调“把思想写下来”,那么在智能体时代,更重要的,或许是把思想转化为可重复运行、持续演化的智能结构。「吾与点」的目标,就是将学者的治学材料、知识积累,乃至思考方式,固化为智能体,进而分享复用并持续迭代,使学术智慧突破时间与空间的限制,成为可交互、可演化的知识系统。

这种变革正在重塑做学问的方式:原本耗时数月的资料处理,现在经前期规则设定后,借助平台即可大幅压缩机械劳动耗时。研究过程从静态的个体探索,转变为“提取 - 校验 - 修正 - 再提取”的迭代式人机协作。研究成果也从单一的静态论文,延伸为可随时调用、随时问答的智能知识载体。正如向静老师所说,对于人文研究者而言,技术的价值在于让我们能将最核心的精力集中在创造性、开拓性的学术探索上,在坚守人文精神与学术底线的同时,高效实现从材料到“洞见”的跨越。

🔗 相关资源

  • 平台体验:吾与点智能数据平台

  • 讲座来源:教育部信息化教学能力提升课程群虚拟教研室“AI赋能课程建设系列公益讲座”

  • 讲座回放:敬请关注“中国高等教育培训中心订阅号”


Widen Your Data


让「吾与点」成为你的学术伙伴

吾与点智能数据平台目前已面向全网开放,无需复杂的技术基础,即可轻松上手体验材料处理、知识库构建、智能体定制等核心功能,让AI真正服务于学术研究与教学创新,助力每一位研究者高效挖掘材料价值、产出深度洞见。

平台网址:

https://www.wuyudian.net/

注册登录即可开启你的智能探索之旅。在这里,传统与创新碰撞,让人文研究在数智时代焕发新的生机与活力。

更多精彩案例与教程请关注 北京大学数字人文中心 B站账号:


阅读原文

跳转微信打开

  •  

工作坊回顾:用「吾与点」解锁数字人文研究新可能

2025-12-31 19:49 北京

2025年12月20日-21日,北京大学数字人文研究中心团队受邀赴内蒙古师范大学,成功举办“从材料到洞见——基于「吾与点」的数字人文实践”专题工作坊。

为推动智能技术与数字人文研究的深度融合,破解传统人文研究中的数据处理瓶颈,2025年12月20日至21日,北京大学数字人文研究中心团队受邀赴内蒙古师范大学,成功举办“从材料到洞见——基于「吾与点」的数字人文实践”专题工作坊。本次工作坊面向科学技术史的十几位同学们,以实操教学与学术研讨相结合的形式,系统分享了智能数据工具在人文研究中的应用路径,为参会师生提供了兼具理论性与实践性的学术指导。


工作坊聚焦「吾与点」智能数据平台在数字人文领域的实战应用,通过核心案例手把手教学,最终实现智能数据生成与数字人文可视化双重目标。本次工作坊以数据生成、分析阐释、成果输出为清晰实践路径,通过理论讲解、跟做示范 、自主实践、汇报点评的四步教学法,助力学员实现从技术零基础到独立完成小型数字人文项目的实践。

智能表格数据处理


工作坊伊始,北京大学数字人文研究中心团队首先对「吾与点」智能数据平台进行全景介绍,细致演示智能数据生成全流程,指导学员完成示范项目创建、导入与字段设计,讲解提示词(prompt)撰写技巧,帮助大家通过精准指令实现关键信息抽取。

随后,授课团队围绕墓志铭信息抽取、PDF文本识别、宋代画作元素抽取、嵌套表格信息抽取四大高频研究场景展开深度演练,针对性解决非结构化文本处理、PDF信息抽取、图像元素分析、复杂关联信息挖掘等人文研究痛点,让学员直观感受智能工具的学术赋能价值。

tips:「吾与点」帮助中心的“应用案例”中有工作坊案例详情与相应配置,吾与点新手用户可前往查看

全链路学术辅助工具


除基础数据处理外,工作坊还向学员们深度讲解了平台智能研究助手功能,构建完整研究闭环:

数据集:可将多个项目的表格数据集中管理,支持字符匹配、语义搜索、混合搜索等智能检索方式,还能自定义显示/隐藏列、查看版本信息,快速定位核心研究资料

知识库:可实现多个数据集的跨项目整合,无论是公开共享还是私有管理均能灵活适配,且操作界面与数据集保持一致,降低跨功能学习成本。

智能体创建:基于用户自主构建的数据集与知识库,打造专属学术问答助手,实现以自有材料为基础,精准响应个性化研究需求的智能交互。用户可将前期处理完成的结构化数据,或跨项目整合的知识库构建为智能体,让问答完全基于自身研究材料展开。

小程序生成:可关联多元数据集与知识库,通过自然语言描述需求即可生成独立可视化应用,支持柱状图、折线图、地图展示等多种呈现形式,且内接CBDB与CHGIS主流数字人文数据库,能够适配学术论文发表、项目汇报、成果展览等多元场景。

除了吾与点智能数据平台,团队还向学员讲授数字人文核心分析方法,详细拆解了社会网络分析(Gephi)与地理空间分析(QGIS)的基础操作与理论应用。此外,在知识图谱构建模块,依托吾与点智能标注平台(https://wyd.pkudh.net/),团队讲解了图谱本体的核心概念,指导学员标注数据后自动构建知识图谱,用于梳理概念关联、还原知识脉络。

自主实践阶段,学员们围绕自选主题设计字段、导入材料,并对进一步数据处理与研究展开讨论,授课团队全程巡回辅导,及时解答技术操作与研究思路疑问。

本次工作坊的成功举办,搭建了北京大学数字人文研究中心与内蒙古师范大学在数字人文领域的学术交流桥梁,有效推广了智能数据处理技术在科技史研究中的应用经验。参会师生普遍反馈,通过本次活动系统掌握了「吾与点」平台的核心操作方法,拓宽了数字人文研究的技术视野,为后续开展相关研究提供了重要的技术支撑与学术思路。

吾与点智能数据平台:

为数字人文研究提供全流程服务


本次工作坊以「吾与点」作为基础培训平台,主要基于以下原因:

多模型适配:提供多款先进模型选择,根据任务复杂度(文本/视觉/推理)灵活搭配,平衡效率与成本

功能全面性:覆盖数据处理、分析、可视化、成果展示全链路,支持数据集、知识库、智能体、小程序一站式构建

适配性优化:面向专业研究场景,操作逻辑贴合学术研究流程,需掌握基础操作规范,可依托操作指南等配套资源,高效跨越学习门槛,实现零代码完成专业级数据处理任务

让研究流程更“轻一点”

让问题本身更“重一点”

吾与点智能数据平台:

https://www.wuyudian.net/

吾与点帮助手册:

https://help.wuyudian.net/docs/user-guide.html

更多关于吾与点的使用教程与使用技巧,敬请关注北京大学数字人文中心B站、小红书账号。

阅读原文

跳转微信打开

  •  

「原境·入梦牡丹亭」亮相北京大学“游园听梦”牡丹亭新媒体沉浸式数字艺术展

2025-12-11 17:30 北京

pkudh“原境智生”系列之“原境·入梦牡丹亭”,亮相江西抚州文昌里——北京大学“牡丹亭”新媒体沉浸式数字艺术展!

2025年12月9日,北京大学“游园听梦”牡丹亭新媒体沉浸式数字艺术展在江西抚州文昌里历史文化街区美术馆开幕!本次展览由北京大学文化传承与创新研究院主办,北京大学数字人文研究中心参与协办与数字交互内容呈现。

在这场以《牡丹亭》为核心的数字艺术实践中,北大数字人文研究中心带来了自研的AI生成式互动体验——「原境·入梦牡丹亭」,尝试让观众在汤显祖故里完成一次从“看画”到“入画”的旅程。我们尝试用更贴近古典审美的生成方法,把《牡丹亭》的历史图像与当代公众的参与体验连接起来,让经典在当下变得可理解、可进入、可传播。

版画为径:

在长廊里与《牡丹亭》相遇

走进抚州文昌里历史文化街区的沉浸式展览,观众会先进入一条颇具叙事氛围的长走廊。这里不是普通的图片展示区域,而是以晚明刊本徽派刻书家黄鸣岐《牡丹亭还魂记》版画为视觉线索的版画长廊。图像在空间中铺陈出人物、场景与情感张力,也为观众打开一种更直观的入戏路径:先在视觉上抵达《牡丹亭》的梦境结构,再在展览动线中逐步靠近叙事核心。

「原境·入梦牡丹亭」就设置在这条长廊之中。观众一边穿行于古代版画构成的叙事空间里,一边被邀请走向长廊中的一台竖屏一体机。在这里,观众不再只是“看画的人”,而是可以选择成为“画中之人”,把自身作为进入经典的一条当代通道。

杜丽娘入梦(左)、杜丽娘寻梦(右)

十秒入梦:

一次简单的生成式体验

「原境·入梦牡丹亭」的操作方式非常直观。参与者站在竖屏一体机前,面对外接摄像头,轻触屏幕上的“入梦”按钮,系统捕捉人物图像并进行生成。随后屏幕上出现一幅新的画面,观众被“转绘”进了与《牡丹亭》相关的版画场景中。

首页(左)、交互动画与讲解(右)

为强化人物与情境的对应关系,团队依据参与者的性别在多幅底图中进行匹配与呈现,其中包括“杜丽娘入梦”“杜丽娘寻梦”“柳梦梅借住”3个典型情境。短时交互由此获得明确的角色联想与情境指向,使观众能够在有限时间内建立“我在《牡丹亭》里”的体验认知。

入梦:杜丽娘入梦(左)杜丽娘寻梦(中)柳梦梅借住(右)

不止古风感:

我们为何选择“转绘”路径

古风AI在大众经验中常被理解为对现代照片加上笔触与色彩的复古滤镜。然而,中国古画在空间组织、人物动作与面部表达上具有自身的审美技法。若将现代摄影的焦点透视、写实面部与动作幅度直接叠加在古画笔触之上,往往会产生视觉违和。

基于这一判断,「原境·入梦牡丹亭」选择以“转绘”作为主要实现路径。项目通过人物特征的锚点建立识别关联,同时给予模型更大的创作自由,使生成结果更贴近中国古画散点透视、含蓄动作与重神韵的表达传统。为维护版画长廊的整体古韵与审美一致性,生成形象保留参与者现代服饰,但在面部与整体气质上更强调古画写意风格。这一选择兼顾了当代身份的可识别度与历史图像语境的整体协调。

现代装扮(左)转绘为古画风格(右)

面向特定文化对象的活化


作为“原境”系列的一次新实践,「原境·入梦牡丹亭」并不只是一个好玩的互动装置。我们更希望它回应几个更具体、也更贴近真实展陈的问题:

1

AIGC如何不止停留在通用审美,而能深入具体的文化与艺术传统?

2

生成式互动怎样与既有史料与展陈叙事协同?

3

当项目面向图书馆、博物馆、景区等公共文化场景时,能否形成可复制、可运营的技术与叙事实践路径?

在抚州文昌里,「原境·入梦牡丹亭」给出的一个答案是:让AIGC从通用生成转向特定文化对象的定制化活化。在充分尊重文本与图像传统的前提下,我们尝试把技术力量更温和、也更细致地嵌入地方文化与公共记忆之中,让观众的参与成为理解经典、感知美学的一种当代方式。

对北京大学数字人文研究中心而言,本次展览既是一场落在具体地点的展陈实践,也是一次面向未来的路径验证。我们期待把特定文化的定制化生成继续推进到更多公共文化空间之中,为不同的地方文化资源、不同的经典文本设计更贴合其审美语法与传播需求的生成式体验。

在汤显祖的故乡,《牡丹亭》的梦境与至情通过新媒体再次被点亮。观众与古画、与故事、与自我,也在十几秒钟的“入梦”中重新关联。这一次,观众不再只是看一场梦,而是被邀请走进梦里,成为梦境叙事的一部分。


撰稿、排版 | 田梦怡


阅读原文

跳转微信打开

  •  

【成果亮相】北大数字人文研究中心创新成果亮相中国数字人文年会(CDH2025)

2025-12-04 19:00 北京

pkudh自研创新成果——「原境智生」入画体验项目、吾与点智能数据平台,亮相2025年中国数字人文年会数字集市!

11月28日至12月1日,“人文智变:数字人文的智慧奇点”学术研讨会暨2025年中国数字人文年会在中山大学隆重召开。作为中国数字人文领域年度规模最大、影响力最广的学术盛会,本届年会吸引了来自全国高校、科研机构、文化机构的400余位专家学者参加。

北京大学数字人文研究中心受邀参会,中心团队在“数字集市”展区展示了两项创新成果,以技术实践回应“人文智变”主题,引发广泛关注与热烈反响。

CDH2025

数字集市:

两大创新成果集中展示

在善思堂“数字集市”展区,北大数字人文研究中心展示的「吾与点」智能数据平台和「原境·入画」两项自研成果吸引了众多参会者驻足体验与交流。

吾与点智能数据平台:

让数据“活过来”!

展台前人流不息,参会者对「吾与点」平台的智能体和小程序功能表现出浓厚兴趣。中心团队现场演示了「吾与点」这一专为数字人文研究打造的通用型智能数据和知识服务平台。

平台的核心能力在于深度整合大语言模型(LLM)与多模态AI技术,实现对文本、图像等多元材料的结构化信息抽取(如文本关键信息提取、古籍插图元素识别等)。在此基础上,平台支持将用户数据快速构建为可检索的知识库,并提供用户专属的个性化交互智能体,实现基于自然语言的精准信息获取和智能问答服务。同时,「吾与点」支持用户使用自然语言快速生成小程序,把复杂的数据转化为直观的可视化表达,让研究成果“看得见”!

原境智生:

古今共生的沉浸式文化体验

「原境·入画」交互装置同样引发热烈反响。这个基于《韩熙载夜宴图》等传统绘画资源开发的多模态互动系统,让参会者能够跨越千年,与古画中的人物同框共生。

体验者只需站在交互屏幕前拍摄照片,系统即可将现代影像实时转换为夜宴图风格人物形象,并融入听乐、观舞、歇息、清吹、送别五幕场景。这种古今共生的体验设计,让观众不仅看见历史,更能参与历史,成为古画叙事的一部分。

step1:转绘为夜宴图风格人物形象

step2:形象融入《韩熙载夜宴图》的场景

两天展示期间,超过一百位观众亲身体验了这项技术, 对装置的高度沉浸感和交互设计的新颖性表示赞赏。这项成果将前沿的AIGC技术与中华传统文化进行创造性结合,为古籍活化和文化遗产展示提供了面向未来、重视用户体验的创新思路。


技术赋能,共绘数字人文未来


北京大学数字人文研究中心的两项展示,从知识服务深化与文化互动创新两个维度,呼应了本届年会“人文智变”的主题。从「吾与点」平台的智能化工具链,到原境智生的多模态交互体验,中心始终坚持“以技术赋能人文,让文化走向大众”的理念。

未来,中心将继续深化平台建设,拓展应用场景,与全国数字人文同仁一道,在智能时代为文化传承与创新贡献力量,推动中国数字人文事业迈向新高度。

撰稿 | 张诗曼

排版 | 田梦怡

阅读原文

跳转微信打开

  •