文本·数据·阐释——数字时代《红楼梦》研究的路径开拓 | 中国艺术研究院红学论坛(2026)会议纪要
2026-09-19 17:38 北京
![]()
2026年9月11日下午,中国艺术研究院红学论坛(2026)第三期举办“文本·数据·阐释——数字时代《红楼梦》研究的路径开拓”专题论坛。论坛由中国艺术研究院红楼梦研究所副所长石中琪主持,清华大学李飞跃教授及其团队围绕《红楼梦》的知识溯源、文献知识库建设和数字人文实践探索作系列报告,李虹、毛巧晖、位灵芝、胡晴等学者参与对谈,秦兰珺、何卫国、马思聪、孙大海等专家参与讨论。与会学者围绕数据库的学术定位、数据可信度、版本标注、知识溯源方法、多模态数据库建设等问题展开了深入研讨。
一、知识溯源与“回到红学”
石中琪首先对李飞跃教授一行的到来表示欢迎,继而邀请李飞跃教授以“回到‘红学’:《红楼梦》的知识溯源与文本挖掘”为题作主旨发言。
![]()
李飞跃首先介绍了清华大学中华传统文化智能实验室的建设情况,回顾了“曹学”兴起的历史脉络和计量方法应用于红学研究的历史,指出数字人文方法使文本内部原本难以察觉和把握的异同变得伸缩可见,为文本理解提供了规模化证据。他认为,材料和考证驱动为红学研究奠定了坚实基础,文本相似度分析与文本挖掘技术为从外部材料转向作品如何生成、知识如何转化、意义如何涌现提供了条件。经典之所以成为经典,不仅在于独创,更在于它能够继承、改写并重新组织既有文学、制度、物质文化和日常知识。
李飞跃以《红楼梦》诗词文本相似度计算、人物相似度计算与物质文化相似度计算等为例,展示介绍了系列探索。数字人文方法能更为全面客观地给出《红楼梦》诗歌化用前人诗句的情况,直观反映《红楼梦》诗歌和前人诗歌基于文本要素的关联。运用技术手段发现的相关诗词,不仅能与前人研究所得相互验证,也有超出一般阅读经验的新发现。通过诗词文本溯源,尤其是文本的改动,不仅可以看出《红楼梦》的构思与立意,也可考见曹雪芹的知识结构及来源,有助于我们从更丰富的维度理解《红楼梦》及其历史文化渊源。找出知识来源,不仅没有削弱作者的原创性,反而有助于呈现诗歌文本之间的互文关系,窥见作者的匠心意趣和作品的丰富义涵。
李飞跃认为,若《红楼梦》的互文、语言、文体、物质文化等内在知识来源被找到和显影,或许可以尝试走出“曹学”,把研究重心引向历史文化与文本如何生成,关注作者的知识来源和艺术创造问题。他强调,知识溯源不是以互文或相似文本机械替代文学解释,而是借助文本关联和证据回溯,寻找可能的知识来源,再回到语境、文体和叙事中评判其关联。文本探勘方法和可视化分析的应用,尚需持续完善和接受学界检验,但也正是通过这种别开生面的尝试,让相关问题和影响因素逐渐彰显,使得《红楼梦》这一经典文本能够不断地展现其盛大幽深的迷人景致。
二、《红楼梦》文献知识库的建设
清华大学人文学院助理研究员杨华梦、博士研究生宋佳霏以“《红楼梦》文献知识库建设情况及展望”为题,介绍数据库的建设目标、阶段性成果及后续规划。文献知识库针对《红楼梦》体量大、版本多、内涵丰富及传统检索不足等难题,旨在汇聚资料、挖掘知识,并探索数字人文结构化标注范式。平台分资料库与研究库,资料库已建图像库、文本库、学术库:图像库收录影像文献321部,标注版本、时代、批点者、完整度等;文本库支持多版本阅读与异文对比;学术库按主题、年份分类期刊论文与专著章节。
![]()
清华大学人文学院助理研究员杨华梦
![]()
清华大学人文学院博士研究生宋佳霏
研究库以《红楼梦》文本的结构化标注为基础,将已有资料进一步转化为可以检索、统计、比较和复核的研究数据。目前已逐步建立实体、关系、指称与叙事等多层标注体系,涵盖人物、地点、器物、服饰等实体,以及人物关系、空间移动、事件成分和情感变化等内容,并据此建设人物库、时间线、地图和知识溯源子页面,研究者可据此开展人物关系、空间叙事、服饰溯源、知识分布、版本异文等专题研究。这些功能相互支撑,为版本比对、文献检索和专题研究提供基础,也为进一步开展古典小说的结构化研究积累数据和方法。
清华大学电子系助理研究员赵阳进一步补充介绍了面向知识溯源的检索实验。传统检索高度依赖研究者已经掌握的关键词和知识边界,大语言模型则可在研究问题、检索词拆解、候选文献发现和相关性初筛之间形成多轮交互。系统可以把检索结果定位到具体文本片段,帮助研究者扩展线索,但最终判断仍需由研究者依据版本、语境和文献关系完成。团队希望以人机协作而非端到端自动写作为原则,使平台真正嵌入人文学术的发现、考辨、论证和写作过程。
![]()
清华大学电子系助理研究员赵阳
未来,团队计划将数据范围拓展至明清小说、子书笔记、知识型类书及图像文物,系统比较《红楼梦》与前代文献在知识来源、叙事情节和人物关系等方面的联系,推动专题库由资料汇聚平台发展为开放共享的红学研究基础设施。
三、青年学者专题汇报
清华大学日新书院本科生郑小荷以“诗性文本中的版本踪迹:《红楼梦》诗词曲赋异文计算分析”为题,分享了将数字人文方法引入《红楼梦》异文和版本研究的一项初步探索。她从9个版本中整理7万字、738处诗词曲赋异文,并选取同等规模的正文异文作为参照,通过分类打分、统计检验、可视化和细读复核,考察版本关系。研究显示,抄本与刻本稳定分化,杨藏本与甲辰本具有过渡性质,庚辰本与戚序本可能关系较近;诗词曲赋异文呈现“结构保守、字词活跃”的特点,进一步比较发现,程乙本的部分修订呈现局部回溯参考甲辰本的迹象,且对程甲本的改动较集中于诗性文本;杨藏本同程本的亲疏也因文体而异。她表示,本次分享更多是向各位老师学习请教,也在交流中收获了诸多激励和启发。
清华大学人文学院硕士研究生梅傲雪以“戏衣入梦:《红楼梦》服饰的戏曲借鉴与叙事转化”为题,探讨《红楼梦》服饰的戏曲来源与叙事功能。研究建设了《红楼梦》服饰数据库、明清现实服饰数据库与戏曲服饰数据库,通过模型预标注、人工精校,实现服饰实体标注流程的标准化。结果表明:颜色层上,《红楼梦》多用红色、秋香色等戏曲中常见而现实礼制少见的服色;形制层上,宝玉的“紫金冠—箭袖—排穗褂”、北静王的“王帽—蟒袍—玉带”等组合与戏曲中雉尾生、王侯扮相高度近似。研究认为,《红楼梦》服饰并非单纯写实,而是在颜色、形制和叙事层面转化了戏曲程式,标注系统则为文本细读提供了可复核、易比较、能复用的结构化证据链。
清华大学硕士研究生乐宸旸以“从数字结构到意象系统:《红楼梦》‘十二’的量化研究与知识溯源”为题,讨论“十二”与女性群像、楼阁空间及命运书写。她表示,“金陵十二钗”称谓汇聚“金钗十二行”、女性借代、群像编组与金陵地域记忆,曹雪芹将其重组为女性群像与悲剧命运相联的系统。研究结合十二月、十二辰等数字文化,量化考察《红楼梦》内部“十二”对人物、时序和器物的组织,并对唐宋诗词六万余条源记录作关键词匹配。研究指出,从仙居“十二楼”到红楼、青楼女性空间,相关意象在不同语境中不断累积和重组;“十二”不只是计数,也参与女性群像和命运系统的组织。该研究为数字文化与文学意象的交叉阐释提供了新的路径,后续将结合历时比较与文本细读,进一步检验相关意象的关联机制。
清华大学日新书院本科生王子欣以“基于人物行迹的《红楼梦》叙事空间量化研究”为题,她以《红楼梦》专题库的实体、关系标注与人物行迹数据为基础编制编码表,运用多种数字方法考察叙事空间与礼制秩序的关系。研究认为,叙事空间总体服从礼制,但服从度只有中等,礼制秩序以结构隔离的方式存在,并首先约束女性与仆役;大观园则是礼制特许空间,其准入呈现极强的身份过滤特点,体现出礼制与人情共生的特点。前八十回与后四十回之间,叙事的空间重心发生由园向府、由人情空间向礼制空间的转移,这一变化体现在园内院居萎缩、事件类型变化以及人物移动行迹等方面。
![]()
清华大学日新书院本科生郑小荷
![]()
清华大学人文学院硕士研究生梅傲雪
![]()
清华大学人文学院硕士研究生乐宸旸
![]()
清华大学日新书院本科生王子欣
四、对谈与讨论
与谈环节中,红楼梦研究所副研究员李虹首先回顾国内外《红楼梦》数据库及数字研究的既有积累,包括中国社会科学院、台湾地区高校、湖北大学等机构的相关平台,以及围绕空间叙事、人物关系、情感、叙事模式和视觉经验展开的研究。她指出,当前专题库建设应充分了解并吸收前期成果,明确自身在版本、数据类型、研究接口和学术问题上的独特贡献;数字项目只有进入具体研究过程,才能避免重复建设。
![]()
中国艺术研究院红楼梦研究所副研究员李虹
中国社会科学院民族文学研究所研究员毛巧晖从民间文学研究经验出发,强调方法更新会深刻影响传统学科。顾颉刚对孟姜女故事的时空梳理、普罗普故事形态学对功能项的提炼,都说明规模化异文研究需要先确定核心元数据和可比较单位。她提出,《红楼梦》并非个体封闭生产的文本,而是扎根于长期文化脉络;书面文学和口头文学也很难截然分开。红学数据库若要进入知识生产领域,不宜只聚焦《红楼梦》文本本身,还应逐步纳入民间故事、话本、民俗、日用类书和多模态材料。数据来源与标注质量决定后续研究的可靠程度,研究视野则决定数据库能够提出和解决怎样的问题。
![]()
中国社会科学院民族文学研究所研究员毛巧晖
北京曹雪芹学会副会长位灵芝从红学资源建设和公共传播角度指出,《红楼梦》相关网站长期以来多由个人自发建设,反映出社会需求之大;北京曹雪芹学会也在持续推动实体文献、图像和生活文化资料的汇集。她认同从“回到红学”“回到传统”出发开拓知识溯源研究,同时强调面向应用的数据库必须公开说明可信数据集的构成:语料是否全面,标注什么,由谁标注,如何经过专家验证。她以连续十二年策划《红楼梦日历》的经验说明,服饰、美食、香事、植物等物质文化资料具有丰富的研究与传播价值,但需要可靠图像和专家审核。她还围绕《红楼梦》英译语料汇集展开设想,希望未来能够整合既有翻译成果,探索人工智能辅助翻译与新的传播形式。
![]()
北京曹雪芹学会执行副会长位灵芝
红楼梦研究所研究员胡晴在总结中指出,《红楼梦》数字人文并非突然出现的新现象,二十世纪八九十年代的“电脑红学”和英文数据库已经构成重要基础。今天的数字平台首先改善了红学研究的基础生态:扩大资料可及性,降低检索门槛,并可能推动版本、文献等基础研究继续向前。胡晴指出,李飞跃教授的研究延续了胡适以来重视实证的传统,同时将问题进一步延伸至知识的继承、重组与生成;这一方向也可与《楝亭书目》等文献材料衔接研究。她建议区分数据库的学术增长与产品转化两条路径,并进一步细化版本标注,对不同版本分别进行异文、实体和关系处理。对于诗词曲赋异文研究,计算结论应与老一辈版本学家的判断互证;如果只是印证既有结论,仍需说明数字方法带来了何种新的证据规模、关系结构或可复核性。她同时指出,面对人工智能与人文学术的张力,不必把二者理解为争胜关系,关键仍在以人为本,由研究者决定问题、标准与阐释。
![]()
中国艺术研究院红楼梦研究所研究员胡晴
自由讨论环节进一步把问题集中到数据、阐释与应用的边界。中国艺术研究院马克思主义文艺理论研究所研究员秦兰珺指出,人工智能工具看似提高效率,但高质量使用往往仍需研究者进行大量细密操作;人文研究中还存在难以完全形式化的默会知识。与会者据此提出,可以共同探索《红楼梦》多模态大模型,但模型建设必须建立在专家参与、数据透明和持续校核的基础上。中国艺术研究院红楼梦研究所副研究员何卫国围绕红楼地图与人工智能应用展开讨论。他提到前人《红楼梦》地图多以文本方位为基础,北京大观园的建设也与早期空间想象有关;孙温等绘画中的空间则更偏向写意。不同地图材料的目标和证据性质并不相同,应在数据库中予以区分。
中国艺术研究院马克思主义文艺理论研究所研究员秦兰珺
![]()
中国艺术研究院红楼梦研究所副研究员何卫国
与会者还谈到人工智能续写后四十回、人工智能翻译等实践,提示个人技术力量已经能够参与红学内容生产,也更需要权威数据与专业评价。中国艺术研究院红楼梦研究所副研究员马思聪提出,与早期“电脑红学”相比,当下数据库更应展示文本如何生成,并回答人工智能究竟为人文学术带来何种增益。《红楼梦》常被称为“百科全书”,正因为其内部汇聚了高度复杂的知识类型,它既是具有代表性的实验对象,也可以检验数字方法能否从资料聚合真正走向新的学术发现。
![]()
中国艺术研究院红楼梦研究所副研究员马思聪
中国艺术研究院红楼梦研究所助理研究员孙大海从文本相似性、情节溯源和版本差异提出多项问题:人物关系在不同版本中如何处理,时间线及其矛盾如何标注,前八十回与后四十回的用词差异如何解释;“十二”研究应注意脂批所提供的线索及其偏向,并充分考虑后四十回和偶然用例。知识溯源尤其需要警惕把表面相似直接解释为来源关系,避免重新滑向缺乏边界的索隐。中国社会科学院大学博士生毕京生提到,《红楼梦》与日用类书及游戏游艺的相关研究仍有广阔溯源空间。
![]()
中国艺术研究院红楼梦研究所助理研究员孙大海
![]()
中国社会科学院大学博士研究生毕京生
五、总结与展望
李飞跃总结道,数字人文方法的科学性体现为过程可检验、结果可修正,而不是一次性得出不可更改的答案。这与胡适先生提出的“也许有将来发见新证据后即须改正的”的科学精神一脉相承。他提出三项合作设想,一是建设开放共享的数字红学基础设施,二是建设《红楼梦》多模态大语言模型,三是开展《红楼梦》可视化分析与文本探勘工作坊,征集可复用案例,把红学研究带入更广阔的文化场域和数字空间。
石中琪在总结中指出,数字人文需要与传统学术真正结合。人工智能越广泛进入知识生产,人文精神、学术规范和主体判断越需要被重新强调。本次论坛既展示了《红楼梦》专题库和多项青年研究的阶段性成果,也进一步将讨论推进到数据规范、版本差异、知识溯源证据和人工智能应用等数字红学的基础问题,也为今后跨机构合作与资源共建留下了进一步展开的空间。
![]()
![]()