❌

普通视图

Received before yesterday1 - 清华大学公众号

文本·数据·阐释——数字时代《红楼梦》研究的路径开拓 | 中国艺术研究院红学论坛(2026)会议纪要

2026年9月19日 17:38

2026-09-19 17:38 北京

2026年9月11日下午,中国艺术研究院红学论坛(2026)第三期举办“文本·数据·阐释——数字时代《红楼梦》研究的路径开拓”专题论坛。论坛由中国艺术研究院红楼梦研究所副所长石中琪主持,清华大学李飞跃教授及其团队围绕《红楼梦》的知识溯源、文献知识库建设和数字人文实践探索作系列报告,李虹、毛巧晖、位灵芝、胡晴等学者参与对谈,秦兰珺、何卫国、马思聪、孙大海等专家参与讨论。与会学者围绕数据库的学术定位、数据可信度、版本标注、知识溯源方法、多模态数据库建设等问题展开了深入研讨。

一、知识溯源与“回到红学”

石中琪首先对李飞跃教授一行的到来表示欢迎,继而邀请李飞跃教授以“回到‘红学’:《红楼梦》的知识溯源与文本挖掘”为题作主旨发言。

李飞跃首先介绍了清华大学中华传统文化智能实验室的建设情况,回顾了“曹学”兴起的历史脉络和计量方法应用于红学研究的历史,指出数字人文方法使文本内部原本难以察觉和把握的异同变得伸缩可见,为文本理解提供了规模化证据。他认为,材料和考证驱动为红学研究奠定了坚实基础,文本相似度分析与文本挖掘技术为从外部材料转向作品如何生成、知识如何转化、意义如何涌现提供了条件。经典之所以成为经典,不仅在于独创,更在于它能够继承、改写并重新组织既有文学、制度、物质文化和日常知识。

李飞跃以《红楼梦》诗词文本相似度计算、人物相似度计算与物质文化相似度计算等为例,展示介绍了系列探索。数字人文方法能更为全面客观地给出《红楼梦》诗歌化用前人诗句的情况,直观反映《红楼梦》诗歌和前人诗歌基于文本要素的关联。运用技术手段发现的相关诗词,不仅能与前人研究所得相互验证,也有超出一般阅读经验的新发现。通过诗词文本溯源,尤其是文本的改动,不仅可以看出《红楼梦》的构思与立意,也可考见曹雪芹的知识结构及来源,有助于我们从更丰富的维度理解《红楼梦》及其历史文化渊源。找出知识来源,不仅没有削弱作者的原创性,反而有助于呈现诗歌文本之间的互文关系,窥见作者的匠心意趣和作品的丰富义涵。

李飞跃认为,若《红楼梦》的互文、语言、文体、物质文化等内在知识来源被找到和显影,或许可以尝试走出“曹学”,把研究重心引向历史文化与文本如何生成,关注作者的知识来源和艺术创造问题。他强调,知识溯源不是以互文或相似文本机械替代文学解释,而是借助文本关联和证据回溯,寻找可能的知识来源,再回到语境、文体和叙事中评判其关联。文本探勘方法和可视化分析的应用,尚需持续完善和接受学界检验,但也正是通过这种别开生面的尝试,让相关问题和影响因素逐渐彰显,使得《红楼梦》这一经典文本能够不断地展现其盛大幽深的迷人景致。

二、《红楼梦》文献知识库的建设

清华大学人文学院助理研究员杨华梦、博士研究生宋佳霏以“《红楼梦》文献知识库建设情况及展望”为题,介绍数据库的建设目标、阶段性成果及后续规划。文献知识库针对《红楼梦》体量大、版本多、内涵丰富及传统检索不足等难题,旨在汇聚资料、挖掘知识,并探索数字人文结构化标注范式。平台分资料库与研究库,资料库已建图像库、文本库、学术库:图像库收录影像文献321部,标注版本、时代、批点者、完整度等;文本库支持多版本阅读与异文对比;学术库按主题、年份分类期刊论文与专著章节。

image.gif

清华大学人文学院助理研究员杨华梦

image.gif

清华大学人文学院博士研究生宋佳霏

研究库以《红楼梦》文本的结构化标注为基础,将已有资料进一步转化为可以检索、统计、比较和复核的研究数据。目前已逐步建立实体、关系、指称与叙事等多层标注体系,涵盖人物、地点、器物、服饰等实体,以及人物关系、空间移动、事件成分和情感变化等内容,并据此建设人物库、时间线、地图和知识溯源子页面,研究者可据此开展人物关系、空间叙事、服饰溯源、知识分布、版本异文等专题研究。这些功能相互支撑,为版本比对、文献检索和专题研究提供基础,也为进一步开展古典小说的结构化研究积累数据和方法。

清华大学电子系助理研究员赵阳进一步补充介绍了面向知识溯源的检索实验。传统检索高度依赖研究者已经掌握的关键词和知识边界,大语言模型则可在研究问题、检索词拆解、候选文献发现和相关性初筛之间形成多轮交互。系统可以把检索结果定位到具体文本片段,帮助研究者扩展线索,但最终判断仍需由研究者依据版本、语境和文献关系完成。团队希望以人机协作而非端到端自动写作为原则,使平台真正嵌入人文学术的发现、考辨、论证和写作过程。

清华大学电子系助理研究员赵阳

未来,团队计划将数据范围拓展至明清小说、子书笔记、知识型类书及图像文物,系统比较《红楼梦》与前代文献在知识来源、叙事情节和人物关系等方面的联系,推动专题库由资料汇聚平台发展为开放共享的红学研究基础设施。

三、青年学者专题汇报

清华大学日新书院本科生郑小荷以“诗性文本中的版本踪迹:《红楼梦》诗词曲赋异文计算分析”为题,分享了将数字人文方法引入《红楼梦》异文和版本研究的一项初步探索。她从9个版本中整理7万字、738处诗词曲赋异文,并选取同等规模的正文异文作为参照,通过分类打分、统计检验、可视化和细读复核,考察版本关系。研究显示,抄本与刻本稳定分化,杨藏本与甲辰本具有过渡性质,庚辰本与戚序本可能关系较近;诗词曲赋异文呈现“结构保守、字词活跃”的特点,进一步比较发现,程乙本的部分修订呈现局部回溯参考甲辰本的迹象,且对程甲本的改动较集中于诗性文本;杨藏本同程本的亲疏也因文体而异。她表示,本次分享更多是向各位老师学习请教,也在交流中收获了诸多激励和启发。

清华大学人文学院硕士研究生梅傲雪以“戏衣入梦:《红楼梦》服饰的戏曲借鉴与叙事转化”为题,探讨《红楼梦》服饰的戏曲来源与叙事功能。研究建设了《红楼梦》服饰数据库、明清现实服饰数据库与戏曲服饰数据库,通过模型预标注、人工精校,实现服饰实体标注流程的标准化。结果表明:颜色层上,《红楼梦》多用红色、秋香色等戏曲中常见而现实礼制少见的服色;形制层上,宝玉的“紫金冠—箭袖—排穗褂”、北静王的“王帽—蟒袍—玉带”等组合与戏曲中雉尾生、王侯扮相高度近似。研究认为,《红楼梦》服饰并非单纯写实,而是在颜色、形制和叙事层面转化了戏曲程式,标注系统则为文本细读提供了可复核、易比较、能复用的结构化证据链。

清华大学硕士研究生乐宸旸以“从数字结构到意象系统:《红楼梦》‘十二’的量化研究与知识溯源”为题,讨论“十二”与女性群像、楼阁空间及命运书写。她表示,“金陵十二钗”称谓汇聚“金钗十二行”、女性借代、群像编组与金陵地域记忆,曹雪芹将其重组为女性群像与悲剧命运相联的系统。研究结合十二月、十二辰等数字文化,量化考察《红楼梦》内部“十二”对人物、时序和器物的组织,并对唐宋诗词六万余条源记录作关键词匹配。研究指出,从仙居“十二楼”到红楼、青楼女性空间,相关意象在不同语境中不断累积和重组;“十二”不只是计数,也参与女性群像和命运系统的组织。该研究为数字文化与文学意象的交叉阐释提供了新的路径,后续将结合历时比较与文本细读,进一步检验相关意象的关联机制。

清华大学日新书院本科生王子欣以“基于人物行迹的《红楼梦》叙事空间量化研究”为题,她以《红楼梦》专题库的实体、关系标注与人物行迹数据为基础编制编码表,运用多种数字方法考察叙事空间与礼制秩序的关系。研究认为,叙事空间总体服从礼制,但服从度只有中等,礼制秩序以结构隔离的方式存在,并首先约束女性与仆役;大观园则是礼制特许空间,其准入呈现极强的身份过滤特点,体现出礼制与人情共生的特点。前八十回与后四十回之间,叙事的空间重心发生由园向府、由人情空间向礼制空间的转移,这一变化体现在园内院居萎缩、事件类型变化以及人物移动行迹等方面。

image.gif

清华大学日新书院本科生郑小荷

image.gif

清华大学人文学院硕士研究生梅傲雪

image.gif

清华大学人文学院硕士研究生乐宸旸

image.gif

清华大学日新书院本科生王子欣

四、对谈与讨论

与谈环节中,红楼梦研究所副研究员李虹首先回顾国内外《红楼梦》数据库及数字研究的既有积累,包括中国社会科学院、台湾地区高校、湖北大学等机构的相关平台,以及围绕空间叙事、人物关系、情感、叙事模式和视觉经验展开的研究。她指出,当前专题库建设应充分了解并吸收前期成果,明确自身在版本、数据类型、研究接口和学术问题上的独特贡献;数字项目只有进入具体研究过程,才能避免重复建设。

中国艺术研究院红楼梦研究所副研究员李虹

中国社会科学院民族文学研究所研究员毛巧晖从民间文学研究经验出发,强调方法更新会深刻影响传统学科。顾颉刚对孟姜女故事的时空梳理、普罗普故事形态学对功能项的提炼,都说明规模化异文研究需要先确定核心元数据和可比较单位。她提出,《红楼梦》并非个体封闭生产的文本,而是扎根于长期文化脉络;书面文学和口头文学也很难截然分开。红学数据库若要进入知识生产领域,不宜只聚焦《红楼梦》文本本身,还应逐步纳入民间故事、话本、民俗、日用类书和多模态材料。数据来源与标注质量决定后续研究的可靠程度,研究视野则决定数据库能够提出和解决怎样的问题。

中国社会科学院民族文学研究所研究员毛巧晖

北京曹雪芹学会副会长位灵芝从红学资源建设和公共传播角度指出,《红楼梦》相关网站长期以来多由个人自发建设,反映出社会需求之大;北京曹雪芹学会也在持续推动实体文献、图像和生活文化资料的汇集。她认同从“回到红学”“回到传统”出发开拓知识溯源研究,同时强调面向应用的数据库必须公开说明可信数据集的构成:语料是否全面,标注什么,由谁标注,如何经过专家验证。她以连续十二年策划《红楼梦日历》的经验说明,服饰、美食、香事、植物等物质文化资料具有丰富的研究与传播价值,但需要可靠图像和专家审核。她还围绕《红楼梦》英译语料汇集展开设想,希望未来能够整合既有翻译成果,探索人工智能辅助翻译与新的传播形式。

北京曹雪芹学会执行副会长位灵芝

红楼梦研究所研究员胡晴在总结中指出,《红楼梦》数字人文并非突然出现的新现象,二十世纪八九十年代的“电脑红学”和英文数据库已经构成重要基础。今天的数字平台首先改善了红学研究的基础生态:扩大资料可及性,降低检索门槛,并可能推动版本、文献等基础研究继续向前。胡晴指出,李飞跃教授的研究延续了胡适以来重视实证的传统,同时将问题进一步延伸至知识的继承、重组与生成;这一方向也可与《楝亭书目》等文献材料衔接研究。她建议区分数据库的学术增长与产品转化两条路径,并进一步细化版本标注,对不同版本分别进行异文、实体和关系处理。对于诗词曲赋异文研究,计算结论应与老一辈版本学家的判断互证;如果只是印证既有结论,仍需说明数字方法带来了何种新的证据规模、关系结构或可复核性。她同时指出,面对人工智能与人文学术的张力,不必把二者理解为争胜关系,关键仍在以人为本,由研究者决定问题、标准与阐释。

中国艺术研究院红楼梦研究所研究员胡晴

自由讨论环节进一步把问题集中到数据、阐释与应用的边界。中国艺术研究院马克思主义文艺理论研究所研究员秦兰珺指出,人工智能工具看似提高效率,但高质量使用往往仍需研究者进行大量细密操作;人文研究中还存在难以完全形式化的默会知识。与会者据此提出,可以共同探索《红楼梦》多模态大模型,但模型建设必须建立在专家参与、数据透明和持续校核的基础上。中国艺术研究院红楼梦研究所副研究员何卫国围绕红楼地图与人工智能应用展开讨论。他提到前人《红楼梦》地图多以文本方位为基础,北京大观园的建设也与早期空间想象有关;孙温等绘画中的空间则更偏向写意。不同地图材料的目标和证据性质并不相同,应在数据库中予以区分。

中国艺术研究院马克思主义文艺理论研究所研究员秦兰珺

中国艺术研究院红楼梦研究所副研究员何卫国

与会者还谈到人工智能续写后四十回、人工智能翻译等实践,提示个人技术力量已经能够参与红学内容生产,也更需要权威数据与专业评价。中国艺术研究院红楼梦研究所副研究员马思聪提出,与早期“电脑红学”相比,当下数据库更应展示文本如何生成,并回答人工智能究竟为人文学术带来何种增益。《红楼梦》常被称为“百科全书”,正因为其内部汇聚了高度复杂的知识类型,它既是具有代表性的实验对象,也可以检验数字方法能否从资料聚合真正走向新的学术发现。

中国艺术研究院红楼梦研究所副研究员马思聪

中国艺术研究院红楼梦研究所助理研究员孙大海从文本相似性、情节溯源和版本差异提出多项问题:人物关系在不同版本中如何处理,时间线及其矛盾如何标注,前八十回与后四十回的用词差异如何解释;“十二”研究应注意脂批所提供的线索及其偏向,并充分考虑后四十回和偶然用例。知识溯源尤其需要警惕把表面相似直接解释为来源关系,避免重新滑向缺乏边界的索隐。中国社会科学院大学博士生毕京生提到,《红楼梦》与日用类书及游戏游艺的相关研究仍有广阔溯源空间。

中国艺术研究院红楼梦研究所助理研究员孙大海

中国社会科学院大学博士研究生毕京生

五、总结与展望

李飞跃总结道,数字人文方法的科学性体现为过程可检验、结果可修正,而不是一次性得出不可更改的答案。这与胡适先生提出的“也许有将来发见新证据后即须改正的”的科学精神一脉相承。他提出三项合作设想,一是建设开放共享的数字红学基础设施,二是建设《红楼梦》多模态大语言模型,三是开展《红楼梦》可视化分析与文本探勘工作坊,征集可复用案例,把红学研究带入更广阔的文化场域和数字空间。

石中琪在总结中指出,数字人文需要与传统学术真正结合。人工智能越广泛进入知识生产,人文精神、学术规范和主体判断越需要被重新强调。本次论坛既展示了《红楼梦》专题库和多项青年研究的阶段性成果,也进一步将讨论推进到数据规范、版本差异、知识溯源证据和人工智能应用等数字红学的基础问题,也为今后跨机构合作与资源共建留下了进一步展开的空间。

图片

图片

数字使人文更新

投稿:https://szrw.cbpt.cnki.net

数字人文门户网站:www.dhcn.cn

阅读原文

跳转微信打开

清华数字人文中心近期成果三篇

2026年8月24日 13:42

2026-08-24 13:42 北京

近期,清华大学数字人文中心、清华大学中华传统文化智能实验室在人工智能与人文交叉研究领域取得新进展,多项研究成果先后获国际顶级会议和权威期刊的录用或发表。

由清华大学数字人文中心、中华传统文化智能实验室助理研究员肖爽担任通讯作者、日新书院23级本科生廖哲维担任第一作者的论文《大语言模型生成辛弃疾词的能力边界:一项人文评价研究》(Large Language Models’ Capability Boundaries in Generating Xin Qiji’s Ci Poetry: A Humanistic Evaluation Study)获国际数字人文顶级会议DH2026录用并发表。2026年7月,作者团队赴韩国大田参会并作现场报告。DH2026由国际数字人文组织联盟(ADHO)主办,是数字人文领域最具影响力的顶级学术会议。

33333.jpg

33333333.jpg

此外,助理研究员肖爽独立完成的论文《数字艺术史中的算法观看与人机共释》(Algorithmic Seeing and Human-Machine Co-Interpretation in Digital Art History)获 npj Heritage Science 正式录用,目前已进入出版制作阶段。该刊由Nature Portfolio出版,是文化遗产科学领域具有重要国际影响力的权威同行评议期刊,在Scopus考古学、文化遗产保护等相关学科位居Q1。

清华大学数字人文中心、中华传统文化智能实验室助理研究员韩玉凤、日新书院24级本科生邓力凡、助理教授孔存良等的系统展示论文(Demo Paper)《九歌·推敲:面向中国古典诗歌推敲的可解释人机协同系统》(Jiuge-Tuiqiao: An Interpretable Human-AI System for Classical Chinese Poetry Refinement)被国际顶级会议EMNLP 2026录用。EMNLP与ACL、NAACL并称为国际自然语言处理领域三大顶级学术会议。

图片1.png

2222.jpg

值得一提的是,本次三项成果中有两项有日新书院本科生参与。近年来,数字人文中心和中华传统文化智能实验室持续推动本科生参与人工智能、数字人文与传统文化交叉研究,已有数十位本科生在重要学术期刊和会议上发表研究成果。这些探索既展现了以人文学术回应智能时代新问题的多种可能,也体现了中心和实验室在跨学科人才培养方面的积极实践。

图片

数字使人文更新

投稿:https://szrw.cbpt.cnki.net

数字人文门户网站:www.dhcn.cn

阅读原文

跳转微信打开

第七届清华数字人文未来学者论坛优秀论文获奖揭晓

2026年7月17日 09:59

2026-07-17 09:59 北京

第七届清华数字人文未来学者论坛优秀论文获奖揭晓

优秀论文获奖揭晓

一等奖

徐梓宸、刘士瑄 

《基于LDA与BERT双视角解析〈新青年〉“世界”概念的变迁》

王子欣

《治乱之间:〈资治通鉴〉历史事件的长时段分析(202-905)》

二等奖

韩赟祯

《天文、地理与决策:唐蕃大非川之战空间分析研究》

黄家骏

《关键词如何成为文学史证据:早期〈蕉风〉(1955—1960)的参照语料库问题》

三等奖

柳宇婷

《〈马氏文通〉例句引文溯源分析——以五种高频来源为中心》

卢宁静

《基于天象模拟技术的〈李朝实录〉壬辰倭乱星占书写发微》

张杰、 王书婷

《古代类书在诗文典故识别模型中的应用研究——以〈初学记〉“事对”为例》

宋佳霏、梅傲雪

《戏衣入梦:〈红楼梦〉服饰的戏曲借鉴与叙事转化》

END

数字使人文更新

投稿:https://szrw.cbpt.cnki.net

数字人文门户网站:www.dhcn.cn

阅读原文

跳转微信打开

交叉学科新专业如何建设? 六十家单位共谋数字人文发展

2026年7月17日 09:59

2026-07-17 09:59 北京

光明日报客户端光明日报全媒体记者陈雪

7月11日至12日,数字人文专业发展联盟第二届年会暨第七届清华大学数字人文论坛、中国文艺理论学会数字人文分会第四届年会顺利举行。会议以“融合与边界:人工智能时代的数字人文发展新进阶”为主题,来自全国60家联盟单位的百余位专家学者齐聚一堂,围绕数字人文学科体系构建、人才培养路径、数智技术赋能研究、高水平人文社会科学实验室建设以及产学研协同发展等议题展开深入研讨。

本次会议由数字人文专业发展联盟发起,多家单位联合举办,充分体现了数字人文学术共同体的协作意识与共建精神。本次会议直面数字人文专业建设中的现实难题,汇聚多方智慧,努力提出具有针对性和可操作性的解决方案。

会议特别设置院长论坛,围绕数字人文专业治理与建设展开专题研讨,将科研组织、师资队伍、人才培养、课程体系和教材编写等关键环节纳入统一框架。与会嘉宾从高校管理和学科建设的角度交流经验,为数字人文专业的规范化、体系化发展提供了新的思路。

高水平实验室建设是本次会议的重要议题之一。与会代表分享了相关实验室在高水平科研、高质量数据集建设和服务国家重大战略等方面的实践经验。会议同期在清华大学分会场设立“未来学者论坛”,为青年学者提供成果展示、学术交流和合作对接的平台。

与会专家认为,当前数字人文专业发展仍面临一系列亟待破解的深层问题。首先,人才培养层次之间的衔接仍不够顺畅。长期以来,数字人文本科专业主要设置在中国语言文学一级学科之下,而研究生阶段的相关培养方向又多分布于信息资源管理等学科,导致部分学生在升学过程中面临专业归属错位、培养方向衔接不足等问题。其次,教材的适配性仍有待提高。数字人文具有鲜明的交叉学科属性,涉及文学、历史学、哲学、艺术学、信息科学、计算机科学等多个领域。由于学科跨度较大,教材编写和选用难以完全满足多样化教学需要。再次,数字人文研究成果的评价与认定机制尚不完善。数据库、数字平台、知识图谱、可视化系统等成果具有跨学科、团队化和持续迭代等特点,难以完全纳入传统人文学术成果评价体系,亟须探索更加符合数字人文研究规律的成果认定标准。

会议期间,一批专业建设成果集中发布,包括三部数字人文教材、一份《中国数字人文专业发展报告2026》以及一套《数字人文教学质量标准(建议稿)》。

据主办方介绍,以此次年会为新的起点,数字人文专业发展联盟将继续汇聚高校、科研机构和行业力量,推动资源共享、标准共建、人才共育与科研协同,为中国特色数字人文学科体系、学术体系和人才培养体系建设注入新的动力。

(光明日报全媒体记者陈雪)

阅读原文

跳转微信打开

《中国数字人文专业发展报告(2026)》发布:师资短缺成最大瓶颈

2026年7月17日 09:59

2026-07-17 09:59 北京

目前教育,部批准设立数字人文本科专业的院校共25所。数字人文人才需求呈现多领域增长态势。

文化遗产保护、古籍数字化、数字出版、文化科技融合……作为当代人文学科与信息技术深度融合的新兴领域,数字人文(Digital Humanities)专业展现了人文学科与技术融合的深化过程。

在日前举行的数字人文专业发展联盟第二届年会暨第七届清华大学数字人文国际论坛上,由中国数字人文专业发展联盟、中国文艺理论学会数字人文分会编制的《中国数字人文专业发展报告(2026)》发布,指出目前该专业发展面临六大挑战。

受台风“巴威”影响,论坛改为线上举行

统计显示,2024年,教育部首批数字人文本科专业招生。截至2026年6月,教育部批准设立数字人文本科专业的院校共25所。其中,北京大学古文献学数字人文课程群构建了从传统文献功底向数字人文前沿延伸的课程体系;华中师范大学“荆楚文化资源数据库”历经十余年建设,涵盖127项国家级、404项省级非遗项目及400多位传承人资料,数据总量超10万条、容量逾30TB;安庆师范大学依托“识典古籍”人工智能古籍平台,将古籍检索、版本比对、文字校勘引入古典文献学课程实践。

报告指出,当前数字人文人才需求呈现多领域增长态势,教育行业、政府机关和事业单位、新闻出版与文化传媒是三大主要就业领域,与数字人文的交叉学科属性相吻合。行业对数字人文人才的能力要求包括五个维度:一是扎实的人文基础能力,这是区别于纯技术人才的核心竞争力;二是数字技术应用能力,涵盖Python编程、数据库、文本挖掘、数据可视化等工具性技能;三是跨学科协作能力,能够在不同学科话语体系间有效沟通;四是项目实践与落地能力,具备解决实际问题的经验;五是伦理与规范意识,对数据伦理、算法偏见和学术规范有清晰认知。

然而,目前,数字人文专业发展仍面临师资短缺、课程体系不完善、人才输出渠道受限、跨学科协作机制不健全、国际合作有待加强等六大挑战。其中,师资短缺成为最突出的瓶颈问题。课程设置同质化情况较为普遍,“数字人文概论+Python+数据可视化”几乎成为标配,一些学校仅开设“视频制作基础”等少数几门课程,实践环节薄弱,“重理论、轻实践”问题普遍。课题组建议,打破这一困局需要系统性制度回应:短期以师资和课程为突破口,中期推动学科目录和评价机制改革,长期构建“平台—人才—科研—合作”良性互动机制。

据悉,本届年会以“融合与边界:人工智能时代的数字人文发展新进阶”为主题,吸引来自全国近 20 个省市、近百所高校及出版科研机构的专家学者,围绕数字人文学科体系构建、人才培育路径、数智技术赋能、文艺批评创新、古籍文献活化、产学研协同共建等多元议题展开深度研讨。年会由中华书局古联公司、数字人文专业发展联盟、中国文艺理论学会主办,上海大学文学院、上海大学文化遗产与信息管理学院、中国文艺理论学会数字人文分会承办,清华大学中华传统文化智能实验室、清华大学-同方知网数字人文联合研究中心、上海大学出版社、高等教育出版社上海出版事业部联合协办。

阅读原文

跳转微信打开

数字人文专业发展联盟第二届年会暨第七届清华大学数字人文论坛、中国文艺理论学会数字人文分会第四届年会顺利召开

2026年7月14日 12:33

联盟大事记 2026-07-14 12:33 北京

以下文章来源于:数字人文专业发展联盟

数字人文专业发展联盟

数字人文专业发展联盟官方账号

数字人文专业发展联盟第二届年会暨

第七届清华大学数字人文论坛、

中国文艺理论学会数字人文分会第四届年会

顺利召开

参会专家学者

160+

主旨报告(场)

8

高水平实验室成果交流(场)

语言文字 / 文物文献 / 艺术创作

8

专业建设案例分享(场)

大模型 / 平台 / GIS / 微专业等

8

参与院长论坛发言

院长或学科负责人(人)

22

专题论文报告(篇)

50+

发布教材(部)

3

平台/空间建设成果(项)

1

专业标准(套)

1

行业发展报告(份)

1

赛事信息(项)

第二届AI诗词可视化大赛

1

汇聚学术共同体力量  

推动专业规范化建设

7月11日至12日,数字人文专业发展联盟第二届年会暨第七届清华大学数字人文论坛、中国文艺理论学会数字人文分会第四届年会,吸引了来自全国近20个省市的160多位专家学者参加。

年会以“融合与边界:人工智能时代的数字人文发展新进阶”为主题,围绕数字人文学科体系构建、人才培育路径、数智技术赋能研究、高水平人文社科实验室建设、产学研协同共建等多元议题展开深度研讨。

1

会议结构特色

五大环节紧密衔接,构建完整学术交流生态

战略引领:构建学科共同体,聚焦专业建设与跨校协同;

学术研讨:前沿研究、学术交流。四场专题研讨会并行推进,分别围绕“计算阐释与文学批评”“人工智能与主体重构”“学科建制与文化传承”“媒介美学与技术批判”四大议题展开深度对话;

成果发布:集中呈现教材、报告、赛事、平台、标准等多元成果;

实践展示:实验室成果、专业建设案例分享,高水平人文社科实验室交流会,汇聚清华大学、北京大学、南京大学、四川大学、北京师范大学、吉林大学、上海戏剧学院、福建师范大学等教育部及省级哲学社会科学实验室同仁同台交流;

人才培育:“未来学者”专场于清华大学图书馆报告厅举办,为青年研究者搭建学术发声舞台。

会议既围绕学科共同体展开战略层面研讨,也组织前沿研究交流,兼顾教材、报告、平台、实验室、案例和赛事等多方面成果集中发布。

2

亮点

充分体现学术共同体意识

本次大会在发起单位和办会模式上充分彰显了学术共同体的凝聚力。大会由中华书局古联公司、数字人文专业发展联盟、中国文艺理论学会,上海大学文学院和清华大学人文学院联合举办,体现了数字人文领域内各组织之间的紧密合作,也凸显了整个学术共同体的广泛参与和资源共享态势。

举办

单位

参会

代表

联合举办单位:

  • 数字人文专业发展联盟

  • 中国文艺理论学会

  • 中华书局古联公司

  • 上海大学文学院

  • 清华大学人文学院

参会代表:

  • 高校:70+所院校学者齐聚一堂

  • 科研机构:权威研究力量集体亮相

  • 产业单位:产学研用多方联动

3

亮点

对标专业建设真实命题

会议紧密围绕数字人文专业建设中的现实难题设置议题,主题鲜明且富有针对性。研讨内容关注师资力量短缺、适用教材欠缺、学生出口不畅和高水平实验室建设经验不足等实际问题。针对这些真实命题,会议安排了专题报告和讨论,使议题设置,与专业发展需求高度契合,力求提出切实可行的解决路径。

  1. 师资力量短缺

  2. 适用教材欠缺

  3. 学生出口不畅

  4. 高水平实验室建设经验不足

4

亮点

成果集中发布,支撑体系完善

本届会议集中发布了一系列新成果,从理论支撑、技术认知到课程实施,为数字人文专业建设构建起一体化的支撑体系。《数字人文专业发展报告》与行业标准文件系统梳理了学科发展的现状与方向;《数字人文引论》《新一代人工智能通识(人文社科)》《数字人文教程》三部教材同步推出,分别对应专业导论、技术认知与课程教学三个关键环节,填补了从通识教育到专业训练之间的教材空白。沉浸式体验空间项目同期发布,则标志着数字人文正从传统的知识生产模式,向场景化、体验化、平台化的应用方向纵深拓展。

  • 行业发展报告:为学科现状评估提供依据

  • 专业标准文件:规范专业建设方向

  • 三部教材:基础理论/AI概论/课程教学,构建一体化教材体系

  • 沉浸式体验空间:场景化、体验化、平台化

5

亮点

院长论坛突显治理  

院长论坛聚焦数字人文专业的治理和建设,将科研、师资、人才培养与教材编制等专业建设关键环节纳入同一讨论框架,这不仅展现了会议对学术交流的进一步拓展,也标志着联盟从单纯学术交流向制定规则和协作共建的更高层次迈出了坚实步伐。

6

亮点

实验室交流引领前沿

八场实验室展示,场场硬核,干货密度极高。北京大学语言学实验室、北京师范大学汉字汉语研究与社会应用实验室、吉林大学古文字古文物人工智能实验室、四川大学数字人文与国际传播实验室、上海戏剧学院数智文艺创新实验室、清华大学中华传统文化智能实验室、福建师范大学中华文化传承与两岸融合发展数智实验室、南京大学中华文明数智创新实验室——八家教育部及省级哲学社会科学重点实验室同台交流,每一家的成果都建立在高水平科研与高质量数据基础之上,指向服务国家重大战略的共同使命。这不仅是实验室之间的深度对话,更是一次跨机构、跨学科协作共识的凝聚,有力地促进了实验室之间的经验共享与合作对接。

7

亮点

案例展示重借鉴  

案例分享环节,八位学者依次分享,议题从课程教学改革到人才培养实践,从平台架构搭建到数据资源开发,从实验中心建设到跨学科协作机制——实践类型丰富多元,覆盖数字人文落地高校的各个关键节点。这些案例来自一线、经过检验,具有较强的示范性与可复制性,有助于将会议成果从理念层面转化为高校可实施的建设方案。

8

亮点

注重年轻人的

学术训练与实践能力培养

会议同期设立“未来学者论坛”,于清华大学分会场举办,以专属板块回应青年研究者对学术话语权的期待,为青年学者搭建交流成长的平台,充分体现了会议对青年人才培养的重视。学术共同体的活力,来自每一代人的接力。重视青年,就是重视学科、重视专业的未来。

9

总结

本次会议在汇聚数字人文学术共同体力量、集中发布一系列研究成果、研判前沿发展趋势、交流研究方法和推广实践经验等方面发挥了积极而重要的作用。会议成果对于推动数字人文专业规范化建设、促进人工智能背景下人文学科的转型升级、增强高水平实验室协同发展能力等方面具有深远意义。

一方面,我们需要持续思考如何更好地培养进入专业的学生;另一方面,也需考虑这些经过培养的学生未来将投向何处。这些问题仍然值得我们共同关注。

为此,只有相关各方主体团结协作,一方面向主管部门反馈需求和意见,另一方面向同行学习和请教,为学生提供更多可能的支持,才能逐步破解这些难题。

汇聚力量

汇聚数字人文学术共同体力量,集中发布一系列研究成果。

研判趋势

研判前沿发展趋势,交流研究方法和推广实践经验。

规范建设

推动数字人文专业规范化建设。

转型升级

促进人工智能背景下人文学科的转型升级。

协同发展

增强高水平实验室协同发展能力。

10

展望

展望1

提升成果影响力和转化价值

数字人文教学创新成果互认机制:使教学案例奖、课程设计奖等成果在不同高校职称评审和教师评价中获得更广泛认可。

展望2

打造AI素养通用课程

文学、历史、哲学、外语等学科共享核心伦理、基础方法和通识内容,叠加专业特色案例,避免重复建设,推动共建共享。

11

下届年会预告

2027,相聚贵阳,共商“学是”!

“联盟有什么需求,我们就设计相应的交流环节

联盟单位有什么特长,我们就搭建相应的展示平台”

——数字人文专业发展联盟秘书长

拟征集先进教学案例、优秀课程设计、优秀论文/数据集/AIGC作品/短剧/创意写作/产业转化案例。

拟增设“高校人文研究支持体系”专场,让行政力量与学术探索同频共振。

END

《数字人文引论》

点击封面购买阅读

《中国数字人文发展报告》

点击封面购买阅读

阅读原文

跳转微信打开

数字人文”岗位日渐吃香,AI时代中国数字人文专业何去何从?

2026年7月14日 12:33

2026-07-14 12:33 北京

7月11日,数字人文专业发展联盟第二届年会暨第七届清华大学数字人文论坛、中国文艺理论学会数字人文分会第四届年会,吸引了来自全国近20个省市、近百所高校及出版科研机构的专家学者参加。

年会以“融合与边界:人工智能时代的数字人文发展新进阶”为主题,围绕数字人文学科体系构建、人才培育路径、数智技术赋能研究、高水平人文社科实验室建设、产学研协同共建等多元议题展开深度研讨。

【“数字人文”岗日渐吃香】

什么是数字人文(Digital Humanities)?简单地说,是以数字技术为方法工具,推动人文研究的问题发现、资料处理、知识表达与成果传播发生根本性变革。作为当代人文学科与信息技术深度融合的新兴领域,数字人文从“人文+简单计算”到“数字人文”,再到“AI人文”,展现了人文学科与技术融合的深化过程。

2010年前后,国内首批高校开始零星探索“数字人文”专业;2019年,新文科建设启动后,“数字人文”专业获得政策认同;2022年,在教育部发布的《普通高等学校本科专业目录》中,将“数字人文”专业列入“文学”门类中的“汉语言文学类”。作为二级学科,“数字人文”则被纳入信息资源管理一级学科之下。这种学科设置的变化和发展趋势,反映了数字人文在新文科建设中的重要性和潜力。

截至今年6月,全国已有20多所高校获教育部批准设立数字人文本科专业,更有不少高校以方向、微专业或研究中心形式开展建设。未来,数字人文将从“研究”到“专业”从“学科”向“生态”转变,因此,非常有必要将数字人文确定为一个由多个学科共享共建的“交叉学科”来加以顶层设计和系统推进。

当前数字人文人才需求呈现多领域增长态势,文化遗产保护、古籍数字化、数字出版、文化科技融合是主要方向。在国外,数字人文相关岗位也日渐“吃香”——在美国,博物馆数字专员年薪7万-10万美元,谷歌文化遗产专员的年薪超过10万美元。

行业对数字人文人才的能力要求包括五个维度:扎实的人文基础能力,这是区别于纯技术人才的核心竞争力;数字技术应用能力,涵盖Python编程、数据库、文本挖掘、数据可视化等工具性技能;跨学科协作能力,能够在不同学科话语体系间有效沟通;项目实践与落地能力,具备解决实际问题的经验;伦理与规范意识,对数据伦理、算法偏见和学术规范有清晰认知。

【建议:嵌入实践环节】

当天发布的《中国数字人文专业发展报告(2026)》显示,在我国,人才培养与行业需求之间仍存在错位:技术能力培养深度不足,人文与技术融合度不够,行业前沿融入教学存在滞后,学生职业认知和就业指导有待加强。

比如说,课程体系同质化,目前“数字人文概论+Python+数据可视化”几乎成为标配。同时,跨学科背景教师平均占比约29%,未达到支撑交叉学科教学的理想水平。此外,理论与实践脱节,部分院校存在“重理论、轻实践”问题。这些问题既是挑战,也是未来人才培养改革的重要方向。因为数字人文专业不能止于纸上谈兵,必须让学生在动手操作中锤炼真本领、提升硬实力。

有专家建议,把实践环节强制嵌入高校的人才培养方案中。比如,硕士标配数个月博物馆、科技企业、数字档案馆实习,并配套长期暑期工坊、跨国交换项目等;毕业成果不只有论文,可提交线上数字展、古籍知识图谱、交互式数据叙事作品。

此外,打破这一困局需要有系统性的制度变革。比如,短期以师资和课程为突破口,中期推动学科目录和评价机制改革,长期构建“平台—人才—科研—合作”良性互动机制。

【做足“中国特色”】

目前,中国数字人文平台体系已逐步形成“学术研究平台—公共文化平台—智能知识平台”三位一体格局。中国数字人文官网(DHCN)于今年7月正式启动,集资讯门户、机构枢纽、学术发表和评价、研究工具、课程平台于一体。技术工具方面,古籍OCR(古籍文字识别技术‌)的识别准确率可达98%—99%;借助AI工具,古籍OCR校对可压缩至72小时内。同时,知识图谱构建、多模态大模型、时空数据分析、生成式AI等工具持续发展。

未来,在吸收国际经验基础上,如何立足中国实践,形成具有中国特色、中国风格和中国气派的数字人文理论体系、方法体系和话语体系,将成为未来发展的核心课题。

中国文艺理论学会数字人文分会会长、上海大学文学院教授曾军指出,中国数字人文专业的发展,正是高等教育立足专业阵地,积极回应时代重大命题的生动实践。从人才培养的维度来看,文科学生熟悉并掌握前沿数字技术、熟练运用人工智能工具,已成为其适应未来急剧变革时代的核心能力。从科学研究的角度来看,中国数字人文学科自觉意识持续增强,正在形成打破西方主导的传统研究范式、构建具有中国特色、中国风格、中国气派的学科体系、学术体系和话语体系的学术自觉。

此次年会由中华书局古联公司、数字人文专业发展联盟、中国文艺理论学会主办,上海大学文学院、上海大学文化遗产与信息管理学院、中国文艺理论学会数字人文分会承办,高等教育出版社上海出版事业部等单位协办。当天,《数字人文引论》《新一代人工智能通识(人文社科)》《数字人文教程》系列数字人文教材正式发布。

阅读原文

跳转微信打开

融合与边界:人工智能时代的数字人文发展新进阶

2026年7月11日 08:30

2026-07-11 08:30 北京

会议时间:

2026年7月10日-12日

7月10日日程

19:00—21:00

数字人文专业发展联盟第三届理事会

7月11日日程

一、开幕式(时间8:30-9:40)

主持人:曾军(上海大学党委常委、宣传部部长)

1、领导致辞

上海大学党委副书记  段勇

教育部中文教指委副主任  沈立岩

清华大学人文学院院长  刘石

中国文艺理论学会副会长、秘书长  王峰

昆明学院人文学院副院长、数字人文专业发展联盟轮值主席(代)  朱供罗

高等教育出版社上海出版事业部经管文科分社社长  张晶晶

中华书局总经理助理、古联公司总经理  洪涛

2、新加盟单位代表发言

3、教材发布仪式

4、数字人文专业发展报告发布

二、主旨演讲(时间9:40-11:00)

主持人:刘旭光(上海大学文学院院长)

沉浸式体验空间发布(视频发布3分钟)

1、洪涛(中华书局总经理助理、古联公司总经理):《智能时代的人文教育服务与实验室建设》

2、Orla Murphy(爱尔兰科克大学英语与数字人文学院院长):《An Urgent Criticality: What Digital Humanities Brings to the Age of AI》

3、李飞跃(清华大学人文学院副院长):《数字人文研究的实验传统与方法 》

4、周计武(南京大学艺术学院教授、党委书记):《感性游戏:跨媒介美学的三重使命》    

5、袁晓如(北京大学智能学院研究员、长聘副教授):《数据驱动的历史与考古资料可视分析》

三、平行论坛(时间14:00-18:00)

平行论坛(一):

数字人文专业发展联盟院长论坛 

平行论坛(二):

数字人文专业发展联盟专题研讨会A 

平行论坛(三):

数字人文专业发展联盟专题研讨会B 

7月12日日程

一、平行论坛(时间8:30-12:00)

平行论坛(一):

高水平人文社科实验室交流会

第一场 语言人文与智能应用:08:30-10:10

主持人:上海大学党委常委、宣传部部长  曾军

1、教育部哲学社会科学实验室:北京大学语言学实验室  孔江平

2、教育部哲学社会科学实验室:北京师范大学汉字汉语研究与社会应用实验室  胡韧奋

3、教育部哲学社会科学实验室:吉林大学古文字古文物人工智能实验室  李春桃

4、四川省哲学社会科学重点实验室:四川大学数字人文与国际传播实验室  宋耀

第二场 中华文化与数智创意:10:30-12:00

主持人:中国社会科学院数字史学中心(实验室)主任 向静

1、教育部哲学社会科学实验室:上海戏剧学院数智文艺创新实验室  黄昌勇

2、教育部哲学社会科学实验室:清华大学中华传统文化智能实验室  唐宸

3、教育部哲学社会科学实验室:福建师范大学中华文化传承与两岸融合发展数智实验室  宋美杰

4、江苏省哲学社会科学实验室:南京大学中华文明数智创新实验室  鲁安东

平行论坛(二):

数字人文专业发展联盟专题研讨会 C

平行论坛(三):

数字人文专业发展联盟专题研讨会D

二、主旨发言(时间14:00-14:45)

主持人:王丽华(上海大学文化遗产与信息管理学院副院长)

1、赵薇(中国社会科学院文学研究所数字人文研究室负责人、副研究员):《文学实验室建设与计算批评的融合之道》

2、江玉琴(深圳大学饶宗颐文化研究院副院长、人文学院教授):《未来学视域中的 AI 人文研究范式》

3、胡 航(西南大学文明互鉴战略发展重庆市哲学社会科学重点实验室主任、教授):《AI 时代的教材应给人什么:干细胞+蛋白质》

三、案例展示(时间14:45-16:30)

主持人:周红兵(安庆师范大学人文学院副院长)

1、彭志峰(广东省岭南数字人文实验教学示范中心副主任、暨南大学-科大讯飞方言语音科技联合实验室副主任):《人文大模型数据集的设计与实践——以暨南大学-阿里巴巴粤语大模型评测集为例》

2、张宁(北京师范大学文理学院中文系副教授、珠海校区图书馆数字人文中心主任):《新文科时代的数字人文平台建设与学生培育实践》

3、唐曦(华东师范大学地理科学学院教授):《文史“再现”的地图整合信息设计》

4、吴夏平(上海师范大学人文学院教授、上海师范大学数字人文实验室主任):《AI 时代数字人文教育中的专业与技术对齐问题》

主持人:欧阳静(陕西中医药大学人文管理与外语学院院长)

1、冯毅(上海开放大学人文与公共管理学院副院长):《基于具身认知的沉浸式艺术教学设计》

2、黄悦欣(北京科技大学机械工程学院工业设计系教师):《人工智能时代数字人文微专业建设案例与育人实践》

3、倪兰(上海大学文学院教授、数字人文实验中心副主任;上海大学云+大文科校级实验教学示范中心副主任):《上海大学文学院数字人文实验中心建设的实践与思考》

4、胡飞(长江学者特聘教授、同济大学数智人文研究中心主任):《同济大学数智人文研究中心建设思考》

四、闭幕式(时间16:30-17:00)

主持人:王丽华(上海大学文化遗产与信息管理学院副院长)

1、第二届 Al 诗词可视化大赛举办代表发言

2、数字人文专业发展联盟第三届年会举办单位发言

3、会议总结发言

4、承办方主持宣布闭幕

阅读原文

跳转微信打开

会议预告 | “智能、心灵与世界”哲学与人工智能学术研讨会

2026年7月11日 08:30

2026-07-11 08:30 北京

1 会议信息“智能、心灵与世界”哲学与人工智能 学术研讨会时间:2026年7月10日—7月11日地

1

 会议信息

“智能、心灵与世界”

哲学与人工智能 学术研讨会

时间:2026年7月10日—7月11日

地点:清华大学蒙民伟人文楼315

主办单位:

     清华大学国学研究院

    《哲学动态》编辑部

     中国社会科学院社会发展研究中心

     清华大学—同方知网数字人文联合研究中心

2

 会议介绍

人工智能技术的迅猛发展,正在深刻改变人类对心灵、知识与世界的理解。机器能否思考?大模型所展现的“理解”与人的理解有何分别?智能体在世界中如何行动、如何获得意义?这些问题既是人工智能研究的前沿议题,也是哲学的根本性追问。技术的突破亟待哲学的省思,哲学亦需面向时代最前沿的问题展开对话。

清华大学国学研究院、《哲学动态》编辑部、中国社会科学院社会发展研究中心与清华大学—同方知网数字人文联合研究中心,长期致力于推动哲学研究与数字人文的深化与创新发展。值此人工智能蓬勃发展之际,四家单位联合举办“智能、心灵与世界:哲学与人工智能”学术研讨会,共同探讨人工智能时代的根本性哲学问题,促进跨学科的深度对话。

3

 会议议程

7月11日(周六)上午

7月11日(周六)下午

4

 与会学者

Ian Roberts  剑桥大学理论与应用语言学系

刘伟  北京邮电大学人工智能学院

刘伟兵  清华大学马克思主义学院

吴畏  华中科技大学哲学学院  国家治理研究院

孙婧一  《哲学动态》编辑部

孙晓霞  中国艺术研究院艺术学研究所

崔中良  南京信息工程大学马克思主义学院

廖备水  浙江大学哲学学院

张拳石  上海交通大学

成素梅  上海社会科学院哲学研究所

李恒威  浙江大学哲学学院

王华平  中山大学哲学系

王浩  清华大学人文高等研究院

白钰卓  清华大学计算机系

耿弘明  清华大学写作与沟通教学中心

蒋俏蕾  清华大学新闻与传播学院

邓盛涛  清华大学哲学系

闫宏秀  上海交通大学马克思主义学院/科学史与科学文化研究院

陈天昊  清华大学公共管理学院/法学院

鲁向成  清华大学哲学系

蒋中和  西安中和文化研究中心

魏钰明  清华大学智库中心/清华大学智能社会治理研究院

夏莹  清华大学哲学系

赵金刚  清华大学哲学系、清华大学国学研究院

李飞跃  清华大学中文系

任方宁  清华大学外文系

海报 | 郝悠扬

编辑 | 温   晋

审核 | 赵金刚

阅读原文

跳转微信打开

《数字人文》2026年第3期

2026年6月25日 11:33

2026-06-25 11:33 北京

目 录 数字史学士可以群:明末复社群体空间关系可视化研究段

目    录

 数字史学

士可以群:明末复社群体空间关系可视化研究

段 伟 王钊江 吴夏平 戴 维

魏

数字人文视角下的中国上古神话体系构建

——以《山海经》和《淮南子》的知识图谱为中心

耿雪熠 张益婷 王 硕 陈润涛 邱伟云

魏

基础设施

机器学习驱动的计量文体学研究进展及热点

——基于Bibliometrix 的可视化分析(1996—2024)

刘世界 王子睿 孔德璐

魏

中国历代人物传记资料库(CBDB)“社会区分”功能的数据结构与优化策略

祁 毅 杜朝晖

魏

文本分析

由句长方差论唐文流变

张 钊 谌洪阳

魏

基于定量分析的选体内涵考辨

张培阳

魏

儒家五常的可视计算构建

——《论语》“仁、义、礼、智、信”数字认知探究

杜 萌 张熙昌

魏

未来学者论坛

永明声律与近体诗律孰难?

——兼论声律合格概率的计算与难度的量化

于恒超

魏

谁在阅读《冲锋报》?

——历史广告视角下德国20 世纪20 至40 年代大众社会与消费生活

韩 茜

魏

DH 资讯

文本相似性计算在数字人文研究中的应用

——北京数字人文工作坊第五期活动综述

胡韧奋 王钰君 丘子靓

魏

征稿启事

CONTENTS

Digital History

Scholars as a Community: A Visual Study of Group Spatial Interactions in the Late Ming Fu She

Duan Wei, Wang Zhaojiang, Wu Xiaping, Dai Wei 

魏

Integration of Classics and Reconstruction of Knowledge: Centered on the Knowledge Graph of Classic of Mountains and Seas and Huainanzi

Geng Xueyi, Zhang Yiting, Wang Shuo, Chen Runtao,Qiu Weiyun

魏

Infrastructure

Advances and Trends in Machine Learning-Driven Stylometrics: A Visualization Analysis Using Bibliometrix(1996—2024)

Liu Shijie, Wang Zirui, Kong Delu 

魏

The Data Structures and Optimization Strategies of the “Status” Function in the China Biographical Database Project (CBDB)

Qi Yi, Du Zhaohui

魏

Text Analysis

Examining the Evolution of Tang Dynasty Prose through the Variance in Sentence Lengths

Zhang Zhao, Shen Hongyang 

魏

A Textual Research on the Connotation of “Xuanti” ( 选体) Based on Quantitative Analysis

Zhang Peiyang

魏

Constructing a Visual Computing Model of the Five Confucian Constants 

Du Meng, Zhang Xichang

魏

Future Scholars Forum

Which is More Difficult: Yongming Prosody or Jintishi Prosody? Including a Discussion of the Calculation of Prosodic Conformance Probability and the Quantification of Difficulty

Yu Hengchao 

魏

Who Read Der Stürmer? Historical Advertisements, Mass Society, and Consumer Culture in Germany, 1920—1940

Han Xi

魏

DH Briefing

Applications of Text Similarity Computation in Digital Humanities Research: A Review of the 5th Beijing Digital Humanities Workshop

Hu Renfen, Wang Yujun, Qiu Ziliang 

魏

Call for Papers

图片

数字使人文更新

投稿:https://szrw.cbpt.cnki.net

数字人文门户网站:www.dhcn.cn

阅读原文

跳转微信打开

《求是》 | 孙茂松:生成式人工智能与知识生产创新

2026年6月25日 11:33

2026-06-25 11:33 北京

6月1日,《求是》杂志刊发清华大学人工智能研究院常务副院长、计算机科学与技术系长聘教授孙茂松撰文《生成式人工智能与知识生产创新》,“清华文科”特此转载,以飨读者。

生成式人工智能与知识生产创新

孙茂松

知识生产与两个关键环节密不可分:知识的产生和知识的传播。两者相辅相成:好的知识是好的传播的动力源,而好的传播又能通过知识的“教化”作用,在人们利用所学解决各类问题的生产和生活实践中催生更多好的知识。古往今来,上述过程“环复转运,终始无端”,不断丰富着人类的知识宝库。

在漫长的历史演进中,知识的生产与拓展,长期带有少数“智者”留下的鲜明印记。随着时代的发展,“智者群”的数量会渐次扩大,但在整个人群里相对来说仍是少数。进入现代社会特别是互联网时代,这种状况发生了急剧变化,普罗大众可以依托互联网信息技术对知识的生产作出贡献。知识传播模式的演进更是令人叹为观止,从文字产生前以语音为知识载体的口口相传,数千年前以泥板、莎草纸、羊皮卷、甲骨、竹简、绢帛等为载体的文本手抄,到1000多年前尤其是数百年来以纸张为载体的图书印刷,百余年来以广播、电影、电视为载体的模拟及数字内容生产,再到近30年来以互联网和社交网络为载体的跨模态数字内容生产,知识生产以其范式持续更替所引发的巨大能量推动着人类文明进步。纵观历史,无论是造纸术、印刷术,还是模拟和数字通信、互联网等,无一不是当时的重大科技发明。科技的一次次重大进步,促成了知识生产的一次次范式创新。

近年来勃兴的以语言大模型为基础的生成式人工智能,无疑会促成知识生产的又一次范式变革。与此前所有知识生产范式中人类始终是唯一主体不同,这次破天荒地增加了一个全新的“主体”——机器。传播模式中所关涉的主体,现在既可以是人,也可以是机器,并且两者相互杂糅,构成了异常复杂的多重关系。众所周知,语言大模型具有强大的语言生成能力,同时具有较好的开放式语言理解能力。机器能做到这一点,是千百年来未曾有过的局面。向量表征、自注意力机制、强化学习、思维链等一系列令人眼花缭乱的技术创新,加之大参数、大数据、大算力的强力加持,以及复杂系统涌现机理的“玄妙”作用,诸多要素的风云际会造就了这一奇迹。语言大模型在基本学会人类语言的同时,还将海量语料中蕴含的万千世界知识及逻辑推理能力,以参数化的形式整合到模型中。《人类简史》的作者尤瓦尔·赫拉利曾表示:“人类文化基于语言。而因为人工智能已经破解了语言,它现在可以开始创造文化。”事态的发展似乎正在印证这个判断。今年年初,被称为“龙虾”的OpenClaw开源智能体框架火爆全球,其核心驱动正是语言大模型优良的理解和生成能力。语言大模型可以说是OpenClaw的“大脑”,一定意义上形成了人工智能的“操作系统”,可用来构建并运行各类“技能”,以完成包括知识生产在内的各种任务。这为人工智能在经济文化社会等领域的推广应用,提供了难得的发展机遇。

但同时也要看到,语言大模型远非完美。本质上它是概率模型,在语言理解上,不能保证如人类一般精准可靠;在语言生成上,会出现“与生俱来”的“幻觉”现象,即生成虚假信息。换言之,OpenClaw的“大脑”时不时会犯糊涂,更麻烦的是,何时犯糊涂、犯怎样的糊涂,很难预料。其结果是当我们将“动作”的权力赋予OpenClaw时,它不能保证不出错,就好像在“瓷器店里捉老鼠”,即使非常小心,打碎一两件瓷器也在所难免,也就是说,OpenClaw天然存在安全隐患。此外,训练语言大模型使用的互联网语料中,往往掺杂人类的各种偏见与谬见,致使模型也存在偏见与谬见。一项随机抽样调研显示,截至2026年3月,互联网上由人工智能生成的文章数量与人类撰写的文章数量基本相当。尽管这个调研比较初步,存在采样规模过小等不足,但还是能从侧面反映出一种现象:现如今互联网上的文章不少是机器写的,我们却可能浑然不觉,无意识地受其影响。这个进程尚处于刚刚开始的阶段,如果不予以必要治理,今后会愈演愈烈,甚至会涉及意识形态安全、责任伦理、学术不端和知识产权等问题。生成式人工智能在进行知识生产时,从真实性、可靠性、安全性等诸多角度对我们提出了新的挑战。

这里面还会生发一些更为深刻的问题。例如,语言大模型是通过海量文本训练出来的,可谓汇总、融通了所有人的知识,性能顶尖的大模型可望得到最广泛人群的青睐和使用,于是乎它仿佛成了唯一的“智者”,在“人人为模型,模型为人人”的闭环迭代中,互联网时代“多对多”的传播模式反而有可能退回到过去印刷时代与电视时代“1对多”的传播模式,只不过此时的“1”已变成了机器,而不再是人了。此外,语言大模型会倾向于生成概率意义上“共识”较大的内容,而易忽视具个性禀赋的内容,导致知识生产出现某种平庸化、同质化倾向。有研究表明,生成式人工智能可以提升个体创造力,却降低了“新颖”内容的集体多样性。这个似乎有些矛盾的结论,其实是不难理解的。

知识生产创新中面临的此类带有普遍性的问题,促使我们必须深入思考:第一,在知识生产与传播进程中,如何处理好人和机器的关系?毋庸置疑,在这个进程中人始终应占据主导地位。生成式人工智能应成为人类的好助手、好伙伴,但绝不能“反客为主”,人是当然的主体和核心。第二,在人机共存的基本条件下,如何更积极地发挥人在知识生产中的主观能动性?第三,生成式人工智能可加速知识发现与整合,以及无时不在、无远弗届的知识传播,如何在此基础上有效重构知识生产新范式,使其与时、与世俱进?第四,生成式人工智能降低了知识生产门槛,如何以此为契机更好调动和挖掘大众知识生产能力,与专家知识生产形成互补?

总的来看,语言大模型乃至生成式多模态大模型的快速发展,给知识生产创新带来前所未有的机遇和挑战。面对技术迭代引发的深刻变革,应始终高扬人的主体性,在人与机器协同中探索知识生产的创新之路,让生成式人工智能真正成为人类文明进步的加速器。

图片


来源:《求是》2026/11

“

点击下方名片 关注清华文科

阅读原文

跳转微信打开

喜 报 | 《山东社会科学》“数字人文:观其大较”栏目入选中宣部“哲学社会科学期刊重点专栏”建设名单

2026年6月25日 11:33

山东社会科学 2026-06-25 11:33 北京

以下文章来源于:山东社会科学

山东社会科学

《山东社会科学》杂志

近日,中宣部公布了第二批“哲学社会科学期刊重点专栏”建设名单,《山东社会科学》“数字人文:观其大较”专栏成功入选。

“哲学社会科学期刊重点专栏”由中宣部评选设立,旨在推动哲学社会科学期刊坚持以习近平新时代中国特色社会主义思想为指导,深入学习贯彻习近平文化思想,切实担当起新的文化使命,坚持正确政治方向、出版导向、价值取向,强化学术引领,弘扬优良学风,办出专业特色,以期刊高质量发展服务文化强国建设。

《山东社会科学》作为综合性人文社会科学类学术期刊,始终围绕党和国家的重大理论与实践问题、人民群众关心的历史与现实问题、经济社会发展的重点与热点问题策划组稿,多年来一直重视跨学科研究,推出了一批特色专栏,受到学界广泛关注。期刊入选国家社科基金资助期刊、中文社会科学引文索引(CSSCI)来源期刊、中国人文社会科学期刊AMI综合评价核心期刊、全国中文核心期刊、RCCSE中国权威学术期刊(A+)、华东地区优秀期刊、山东省优秀期刊,荣获首届“齐鲁名刊”称号,连续获得山东省新闻出版奖。

“数字人文:观其大较”专栏自2016年创设以来,一直致力于推动数字技术与人文学科的深度交叉融合,经过十年的持续建设与发展,已成为国内数字人文研究领域具有重要学术影响力和品牌辨识度的特色栏目。专栏坚持“以议题引领研究”的系统策划理念,在“数字人文”的总框架下,每期围绕一个具体议题展开集中探讨,形成了既有层次纵深又具逻辑关联的议题矩阵。迄今为止,专栏已策划刊发24个专题、64篇文章(并附录多篇学术访谈和书评),涵盖数字人文研究的基础理论、方法工具、领域应用、批判反思与前沿探索等多个维度,构建了从技术应用到理论建构再到价值批判的完整逻辑链条。专栏文章被四大文摘和人大复印报刊资料等转载数十次;2017、2018年两次获国家社科基金资助期刊特色栏目专项资助,2025年获山东省宣传文化专项资金资助;早期论文收录于《数字人文与语言文学研究》(译林出版社2022年版),2026年拟出版学术外译文集《中国数字人文研究》(中英对照版)。

此次入选“哲学社会科学期刊重点专栏”,既彰显了“数字人文:观其大较”专栏在国内数字人文研究领域的引领力与影响力,也是对《山东社会科学》多年深耕跨学科研究的肯定与激励。以此为契机,我们将持续深化特色专栏建设,为加快构建中国哲学社会科学自主知识体系贡献期刊力量。

“数字人文:观其大较”专栏

往期部分文章合集

阅读原文

跳转微信打开

《数字人文》2026年第2期目录

2026年6月22日 10:16

2026-06-22 10:16 北京

目    录

 基础设施

基于“知识图谱网”大数据的集唐诗研究

陈 伟 陈逸云

魏

构建古籍音注的智能音韵分析系统:以宋人音释为例

郑伟莉

魏

数字文献

数字文献有损压缩误差探析:以JBIG2 标准下字符替换错误为例

杨 睿 黄一农

魏

深度注释类古籍书稿电子辅助编校的流程设计

马 婧

魏

艺术与传媒

基于坐标注意力引导局部—全局网络的俄藏黑水城艺术品图像修复

冯艺飞 束锡红

魏

民国时期大学校刊的知识挖掘模型构建研究

程结晶 臧志栋 孟方圆 刘 星

魏

教育与教学

我国语言测试研究的发展演进

——基于学术会议主题的bibliometrix 分析

薛文枫 潘鸣威

魏

数字人文视域下俄罗斯最新版统一历史教科书社会主义叙事研究

肖佳妮 孙 涛

魏

评论与批判

数智化语境中的典故及其与世界、人文之关联

——“数智人文”如何可能?

曾建华

魏

数字人文视域下的语料库语言学研究:挑战与机遇

刘 洋 朱玉彬

魏

概念与实践

计算文学批评与人工智能

 凯瑟琳·博德 夏洛特·布拉德利

魏

数据·遗产·网络:国际拜占庭数字人文研究的现状、趋势与启示

李 强 刘健昌

魏

未来学者论坛

数字佛教学的方法与内涵

——《数字人文与佛教》述评

周邦威

魏

征稿启事

CONTENTS

Infrastructure

Research on Tang Poetry Collage Based on Big Data from the “Knowledge Graph Network”

Chen Wei, Chen Yiyun 

魏

Constructing an Intelligent Phonological Analysis System for Annotations in Ancient Books: A Case Study of Song Dynasty Phonetic Annotations

Zheng Weili

魏

Digital Documents

Analysis of Lossy Compression Errors in Digital Documents: A Case Study of Character Substitution Errors under the JBIG2 Standard

Yang Rui, Huang Yinong 

魏

The Process Design of Using Electronic Assisted Editing Methods to Editing and Proofreading Deep Annotated Ancient Chinese Books

Ma Jing

魏

Art and Media

Image Inpainting of Blackwater City Artworks from Russian Collection Based on Coordinate Attention-Guided Local-Global Networks

Feng Yifei, Shu Xihong 

魏

Research on the Construction of Knowledge Mining Model for the University Newspapers of the Republic of China

Cheng Jiejing, Zang Zhidong, Meng Fangyuan, Liu Xing

魏

Literacy and Pedagogy

On the Evolvement of Language Testing Study in China: A Bibliometrix Theme Analysis of Academic Conferences

Xue Wenfeng, Pan Mingwei 

魏

Socialist Narratives in Russia's Newest Unified History Textbook: A Digital Humanities Perspective

Xiao Jiani, Sun Tao

魏

Commentary and Critique

Digitalization and Intelligence Context: Allusions, World, and Humanities Scholarship:How is “Digital Intelligence Humanities” Possible?

Zeng Jianhua 

魏

Corpus Linguistic Studies in Digital Humanities: Challenges and Opportunities

Liu Yang, Zhu Yubin

魏

Terminology and Practice

Computational Literary Studies and AI

Katherine Bode, Charlotte Bradley

魏

Data, Heritage and Network: The Current Situation, Trends and Implications of Digital Humanities in Byzantine Studies

Li Qiang, Liu Jianchang

魏

Future Scholars Forum

The Methods and Implications of Digital Buddhology: A Review of Digital Humanities and Buddhism

Zhou Bangwei

魏

Call for Papers

图片

数字使人文更新

投稿:https://szrw.cbpt.cnki.net

数字人文门户网站:www.dhcn.cn

阅读原文

跳转微信打开

2026方塘论坛议程

2026年6月22日 10:16

清华方塘研究院 2026-06-22 10:16 北京

以下文章来源于:清华方塘研究院

清华方塘研究院

方塘研究院依托学校已有的学术积累和基础,立足清华多学科优势和人文社科学科特色,坚持开放性、多样性和国际化发展导向,着力推动跨学科的思想交流激荡,促进创新精神和创新思维的培育。

2026方塘论坛中英文议程

“方塘”二字取自朱熹《观书有感》“半亩方塘一鉴开,天光云影共徘徊。问渠那得清如许?为有源头活水来。”方塘研究院以“坚持探索和传播培育世界一流创新人才,诞生重大原始创新成果的思想前提、文化机理和教育规律”为使命和前进方向,希望通过持续的努力,为学术研究引入更多“源头活水”。

阅读原文

跳转微信打开

温馨提醒 | 第七届清华数字人文国际论坛“未来学者”专场报名最后三天

2026年5月20日 11:28

2026-05-20 11:28 北京

在人工智能技术迅猛发展的今天,数字人文领域正经历前所未有的变革。数据驱动的研究方法、跨学科的技术融合以及人工智能在文化遗产、文本分析和数据可视化等领域的应用,为学术研究带来了全新的可能性。

“未来学者”专场

人文学术的未来,寄托于未来的人文学者;也即是当下正致力于研究和探索的青年学子。为鼓励和支持本、研阶段学生投入数字人文研究,结合数字时代新方法、探索人文学术新方向,《数字人文》学术集刊持续举办第七届“未来学者”论坛,诚邀国内外的本科生、硕士生、博士生在读学生(不含博士后)投稿并参会。

期待来稿面向人文问题、结合数字方法,给出来自文学、历史、哲学、社科、艺术、教育、传播乃至政治学、图情档案等各个领域的回答和发现。

本届入围者将受邀参与第七届清华大学数字人文国际论坛“未来学者”专场,获得专家指导评议及进一步研究支持,并于本刊择优刊发。

投稿须知

摘要提交截止日期:2026年5月22日

摘要提交链接https://www.wjx.top/vm/e6ux8a3.aspx# 

或扫描下方二维码报名

qrcode.jpg

全文提交截止日期:2026年6月12日

投稿地址:

https://szrw.cbpt.cnki.net

在系统中投稿时请选择“未来学者专栏”

、

参会人员收取会务费,会务费标准为800元/人,学生半价优惠400元/人,入选“未来学者”论坛发言的作品每篇免1人参会、住宿费。缴费时间及缴纳方式将另行通知。

会议时间地点

2026年7月10日-13日    共4天

报到7月10日

会议 7月11日—12日

赋归7月13日

上海大学宝山校区(上海市上大路99号)

会议合作酒店

上海衡山北郊宾馆

地址:上海市宝山区沪太路4788号

总机: 021-56040088

(注:若实际报名人数超过酒店接待上限,会务组可能新增其他酒店安排接待)

我们期待您的参与,共同探讨数字人文的前沿议题,推动学术研究的创新与发展!

论文格式模板及要求-中文.pdf

论文格式模板及要求-中文.pdf

会议时间地点

2026年7月10日-13日    共4天

报到  7月10日

会议  7月11日—12日

赋归  7月13日

上海大学宝山校区(上海市上大路99号)

会议合作酒店

上海衡山北郊宾馆

地址:上海市宝山区沪太路4788号

总机: 021-56040088

(注:若实际报名人数超过酒店接待上限,会务组可能新增其他酒店安排接待)

论文格式模板及要求-中文.pdf

END

公号二维码-1.jpg

数字使人文更新

投稿:https://szrw.cbpt.cnki.net

数字人文门户网站:www.dhcn.cn

阅读原文

跳转微信打开

虚构性

2026年5月14日 09:59

原创 安德鲁·派博 2026-05-14 09:59 北京

虚构与非虚构、真实文本与非真实文本之间的区别是有史以来最经典的问题之一。自从我们开始思考叙事行为以来,我们就一直在探讨真实和想象的相关含义。

概念与实践

2.png

安德鲁·派博 / 加拿大麦吉尔大学语言、文学与文化系

陈大龙(译)/ 浙江大学国际联合学院

“无法通过任何文本属性将文本认定为虚构作品,无论是从句法上还是语义上。”

——约翰·塞尔(John Searle)

虚构与非虚构、真实文本与非真实文本之间的区别是有史以来最经典的问题之一。[1]自从我们开始思考叙事行为以来,我们就一直在探讨真实和想象的相关含义。这就是亚里士多德所说的语言的交际性使用(legein,讲述)和创造性使用(poiein,制作)之间的区别。[2]千百年来,我们一直在争论虚构是否有其内在特征,或者它是否只是一个意向问题,或许虚构话语的语言其实并无独特之处。我们如何知道一个文本自身就表明了它是“真实”的,或者不是真实的?[3]对于这种最基本的区别,量化信息又能告诉我们什么呢?

请看下面两段文字:

A

在从巴克利湾(Buckley Bay)到丹曼岛(Denman Island)的短程摆渡路途上,朱丽叶(Juliet)从她的汽车里钻出来,站(stood)在了摆渡船前端的夏日微风之中。站在那里的一个妇女认出了她(her),(她们,they)两人便聊了起来(began)。这也(是,is)算不得什么稀罕事儿了,人们多看朱丽叶一眼,(他们,they)便会琢磨以前在哪儿见过这个女人,有时候也真的会记起来。

B

杰夫(Jeff)今年是(is)24岁,身材高挑健美,留着蓬松的棕色头发,带着轻松的笑容。三年前,他(he)从布朗大学获得历史学和人类学荣誉学位,毕业后搬(moved)回波士顿(Boston)郊区的家,开始(started)找工作。几个月后,他找到了一份工作,是一家小型互联网供应商的销售代表。他通过短信和电子邮件与大学同学保持联系,周末还会去市中心的波士顿“布朗酒吧”闲逛。他说:“感觉有点儿像我从未离开过大学。”他的语气中夹杂着不舍和愉悦。“同一批朋友,同样的漫无目的。”

乍看之下,这两段话有很多共同之处:都使用了单一的专有名称(杰夫/朱丽叶)和地点标记(波士顿/丹曼岛),都使用了一些代词(她/她们/他们/他),都偶尔使用修饰词(短程摆渡路途/夏日微风/蓬松的棕色头发/轻松的笑容),也都使用了过去时和现在时(“站”[stood]、“起来”[began]、“是”[is]、“开始”[started]、“搬”[moved])。虽然第二段话使用了对话形式,但假设第一段在某些时候也会使用对话也不无道理。无论是杰夫作为“销售代表”的倦怠感,还是第一段中认出朱丽叶的女人,这两个段落似乎都为描写提供了某种心理支撑。两者都会让我们思考人和性格。

然而,鲜有读者猜不出段落B来自非虚构作品迈克尔·金梅尔(Michael Kimmel)的《男性世界:男孩变成男人的危险世界》(Guyland: The PerilousWorld Where Boys Become Men),而段落A来自虚构作品艾丽丝·门罗(Alice Munro)的《沉寂》(“Silence”)。[4]那么,是什么让这一点如此明显呢?就如我们这个领域的许多人那样,我们可以说,虚构性是不可言说的,它只是我们阅读时的一种感觉。谁能说得清是什么在读者的脑海中唤起想象的世界?然而,另一方面,我们可以尝试比我上面的初步描述更加精确,尽可能多地量化这两个段落的特征,以了解它们在词法和句法层面的显著差异(见表1)。

图1.png

表1

这些结果是使用詹姆斯·彭内贝克(James Pennebaker)的语言探索与字词计数(Linguistic Inquiry and Word Count,LIWC)软件得出的,该软件可从80个不同的心理语言学维度探索文本特征。表中仅列出了所有特征的一个子集。数值以百分比表示。

以这种方式观察这些段落,我们不仅可以看到它们之间更广泛的差异,还可以看到这些差异的强度,大概也可以分辨这些差异的显著性。与金梅尔的文本相比,门罗的文本看起来动词使用得更多,而且,相对于总字数而言,现在时动词更多。此外,她的句子也更长,代词更多。她比金梅尔使用了更多的冠词和介词,还使用了表达洞察力(认出、记起来、琢磨)、不确定性(有时候、琢磨)、以人为中心(女人、人)和移动特征(汽车、摆渡船)的词汇。而金梅尔则使用了更多的6个字母以上的单词、稍多的逗号和句号、更多的数字以及更多的情感和工作词汇。我们可能以为文学文本会更多地表达情感,但门罗的写作艺术之特征就是把情感隐于字面之下,含而不露(“便会琢磨以前在哪儿见过这个女人,有时候也真的会记起来”)。

本文旨在了解虚构文本与非虚构文本之间的差异,也就是向读者提示故事真实与否的标志。

我并非如上例所示只看一个例子,或者几个例子,而是将利用大约包括28,000份虚构和非虚构文档的集合,以更好地了解虚构写作与非虚构写作的区别。我的研究重点将主要放在长篇小说上,因为长篇小说是19世纪至今虚构写作的最主要形式之一。我们知道,自1800年左右开始,长篇小说开始在数量上不可阻挡地崛起,那么,是什么让长篇小说成为一种独特的虚构话语形式?[5]

关于虚构话语本质问题的讨论在20世纪70年代到80年代初达到了一个高潮,许多语言哲学著作都在反思文本表明自己真实性的语言线索标记。[6]这一努力的关键在于如何界定和控制语言的可靠性,即区分言语中真实与非真实内容的能力。约翰·塞尔的著作成为这场运动中的里程碑,而他所提供的框架则深受奥斯汀(J. L. Austin)言语行为理论(theory of speech acts)的影响。

对于塞尔和聚集在他周围的哲学家群体来说,虚构话语与非虚构话语之间的差异并不取决于话语的实际内容。相反,它取决于说话者和受话者的意向性的结合,即所谓的以言行事(illocutionary)行为和以言取效(perlocutionary)行为。(我们可能会把这些作为言语生产与接受的框架。)正如塞尔所言:“虚构中的说话行为与严肃话语中的说话行为是无法区别的,进而,也就不存在某种足以将一串话语识别为一部虚构作品的文本自身属性。”[7]对于语言哲学家来说,虚构性并不是一种独特的语言使用,而是取决于作者和读者的意向,以及这些意向在文本界限之外的交流方式。

对于大约同一时期的文学理论家来说,文学作为虚构话语的一个子集,同样被定义为与“写作”这一更大范畴不可区分的文本实体。塞尔和奥斯汀的言语行为理论被用来对文学本质主义进行更普遍的批判。文学本质主义认为,文学作品存在着独特的且可能不受时间影响的特质。雅克·德里达(Jacques Derrida)明确援引塞尔的哲学写道:“在被直接铭刻在社会身体(social body)上的一个正确的,也即具体的意向性赋予或认可的功能之前和之外,任何论述、任何话语形式都不具有内在或本质上的文学性。”德里达接着说:“这就是我想验证并提交给你们讨论的假设。文学没有本质或实质:文学不是(literature is not)。它不存在。”[8]对于德里达和后来的许多后结构主义批评者来说,文学不是一系列可确定的特征的产物,而是一系列社会意向的产物,是支撑塞尔言语行为生产和接受的框架。[9]如将塞尔关于话语陈述的立场更广泛地转化为文学阐释,则文学之所以被视为解放性的(liberatory),正是因为它不可规约为任何模式、习惯或个人语言习惯。[10]

本文提出了一种截然不同的主张,这种主张是基于对过去两个世纪中个体从事虚构或非虚构写作的大量实例的观察。从这个角度来看,虚构性在语言内容层面(亚里士多德的术语为“语汇”[lexis])是一个高度可辨的范畴。正是这种可辨性使我们能够建立预测模型,以95%以上的准确率识别虚构作品,而且应该补充的是,它使人类读者也能做到这一点(正如我上述的初步实验所展示的)。与语言哲学家或从后结构主义者到后古典叙事学家(postclassical narratologists)的不同文学评论家流派的观点相反,语言中对真实性(或与之相反的虚构性)的表明是文本的一个高度可识别的语言特点。写作在句子或“说话”(utterance),即塞尔含糊其词地称之为“一串话语”的层面上表现出的特点,从不同的尺度上再去观察时,就不再成立了。[11]将重点全部放在读者的活动上,无论是作为认知倾向,还是作为阐释自由,都忽略了文本有大量强大的方式来根据其虚构性质来标记自身以示读者。

本文的研究不仅表明虚构性是一个极易辨识的范畴,而且至少在两百年来,它似乎一直出奇地稳定。虽然我们讲述故事的方式确实发生了重大变化,然而,当我们使用以19世纪文本为基础来训练的学习算法时,它识别当代小说的表现即使确有所下滑(毕竟历史仍然重要),但准确度仍然令人印象深刻(约91%)。事实上,举例来说,那些似乎体现了19世纪小说独特性的特征,随着时间的推移,要么在增加,要么基本保持稳定,甚至在进入20、21世纪的各种文体中也是如此。虽然不同文体在多大程度上表现出类似的虚构性特征仍是一个悬而未决的问题,但我的初步研究表明,在种类繁多的虚构写作中,存在着令人惊讶的共性。这种连续性对于我们如何思考流派和文学时期划分具有重要的影响,而这种影响在很大程度上仍未得到讨论。[12]

理解虚构性的可辨识性——它在多大程度上将自身标记为一种文化实践——对于理解我们自己的学科具有重要意义。最近对创意性写作的历史嵌入性(historical embeddedness)的强调,无论多么有价值,在很多方面都忽略了这种连贯性的意义,即虚构的驱动力之一就是将自身与其他类型的写作区分开来。这并不是说小说在某种基本意义上不是关于现实世界的,而是说小说的重心——也就是克莱斯特(Kleist)在《论木偶戏》(“On the Marionette Theater”)一文中所说的艺术作品的“重心(Schwerpunkt)”——位于别处。那么,我最终希望在此得到更好理解的就是这个“重心”,即小说作为一种写作将自己区分开来的方式。我们将会看到“虚构的稳定性”,尤其是长篇小说虚构的稳定性,似乎是建立在我们可以称之为“现象学投入”(phenomenological investment)的基础之上的。[13]小说对19世纪(及以后)虚构话语的贡献,其特殊本质就在于,它关注的不仅仅是我们周围的世界,还有我们与这个世界的知觉相遇,其中包括大量的怀疑、推诿和否定。而要在长篇小说中体验世界,首先需要的就是怀疑。

从这些角度来思考小说的虚构性和长篇小说,不可避免地会对近期的一些老生常谈造成压力。在这一视角中,经久不衰的小说“现实主义”的问题,即小说再现特定环境的程度和手段,便让位于小说对“遭遇戏剧化”(dramatization of encounter)的关注——无论是与他人还是与世界的遭遇,实际上都是与更广义的他者的遭遇。与其说长篇小说这种文体是基于其与关于事物的知识的关系的——在这里,物论(thing-theory)是对现实主义兴起的一种新的诠释——不如说根据长篇小说具有量化意义的组成部分,它在本质上似乎更具有自我指涉性,为我们提供了获取“认知之知识”的途径。它明确了一种有关假定性的经验,一种与世界的测试性关系。[14]尽管这可能是我们传统上对一小部分现代主义实验的看法,但重要的是,这一观点甚至适用于19世纪最经典的“现实主义”小说。

因此,本文认为,小说学术史中的某些经典立场需要重新思考,或者至少需要根据新兴的对小说的计算研究成果进行修正。无论是凯瑟琳·加拉格尔(Catherine Gallagher)关于小说与其自身虚构性之间暧昧关系的论述;是后结构主义对文学否定性的投入,如批评家将小说称为“无体裁(genre)的体裁”;是物论对伊莱恩·弗里德古德(Elaine Freedgood)所称的小说语言的“指称性、字面性和技术性”的强调;还是伊恩·瓦特(Ian Watt)对小说的指涉性所持的依然具有影响力的立场,比如瓦特写道,“这样看来,小说中语言的功能在很大程度上比其他文学形式更具有指涉性”;计算都对作为一种虚构话语类型的长篇小说的重要性作出了截然不同的描述。[15]问题的关键并不在于这些立场是否毫无根据——可以肯定的是,对于某些长篇小说而言,这些存在方式可能确实是主要的,正如对于许多长篇小说而言,这些存在方式可能在某些时候是有效的,这也是可以肯定的。

但是,如果我们试图理解是什么特质让小说从众多看似真实的写作类型中脱颖而出,甚至在各类虚构文本中独树一帜——如果我们试图将小说作为一种独立文体来概括——那么至少从18、19世纪之交开始,我们便能察觉到一些显著的变化。根据下文的研究,小说的重要性并不主要在于它对世界的正面表现,即它的模仿效用、它模拟某种事物的能力(如17世纪关于“真实性”[vraisemblance]的辩论)。它也不是基于一种后结构主义的否定性——小说不是一个可识别的独特而稳定的类别,这反映了文学更普遍的否定能力;恰恰相反,小说的最佳描述方式是,它是对其自身世界关照性(worldliness)的确定性的否定。它立足于对遭遇而非现实的诉求。在此过程中,正是语言的指涉性在小说中被悬置起来,这并非含糊不清,而是系统性的、有计划的,甚至在那些被广泛认为是写实性最强的小说中也是如此。

预测和描述

本文将所谓“预测”(predictive)与“描述”(descriptive)的方法结合使用。预测模型(如机器学习过程中使用的模型)之所以重要,是因其使我们得以参与分类的过程,将一组文本定义为一个连贯的实体,并根据某些预设条件了解其连贯程度。[16]通过预测模型,我们可以知道将文本判归为某个特定的文本组的确定性有多高,以及根据什么标准来确定。确定性越高,我们就认为这个类别越有内聚力。

另一方面,描述性模型之所以有用,是因其使我们在不进行分类的情况下,也能够通过将一个文本组与另一个组进行比较,确定该组的显著特征。这可以告诉我们,一组与另一组相比,哪些特征是突出的,但这样做并非为了宣称该组整体上都具有这样的独特性。这些特质不是对文本或文本组进行定义——小说是××或小说是如此可预测的,而是帮助我们根据更加个体化的标准来描述一组文本的行文(behavior)。这也是很有价值的,因为它能让我们了解使一组文本不同于另一组的成分,而这些成分未必会导致两组文本归为不同类别。对预测进行解释,也就是解释计算机如何估计出一个文本属于哪一类,是相当具有挑战性的,而解释个体差异则简单许多。我认为,正是两者的结合,让我们既能从分类的角度思考——思考在特定条件下书写的相对连贯性——也能从质的角度思考写作的具体方面,而无需给对象划分明确的界限。在许多方面,描述都比预测更接近文学批评的传统任务。

本文中使用的数据是为了了解不同类型书写中虚构性的本质而选择的,目的是考察本文得出的结果是否能够经得起不同时间、不同语言和不同样本量的检验。总体而言,这些数据包括约28,000份文档,时间跨度为从18世纪末到21世纪初,内容以英语或德语书写。这些文本集合涵盖不同类型的虚构和非虚构写作,包括长篇小说、历史著作、哲学著作、实用指南、中短篇小说、童话故事和翻译成散文的古典史诗等(但不包括百科全书或烹饪书)。这些文本可归纳为四大类。

第一类代表了我实验室整理的约600份文档,这些文档是19世纪德语和英语的经典著作,包括该时期最著名的长篇小说以及著名的非虚构作品,包括哲学著作、散文和历史著作。这些文本已经过充分清理,以确保转录错误最小化;同时,它们也已按叙事视角进行拆分,这样我们在与历史叙事进行比较时,就能够控制例如第三人称小说等变量。

第二类是一个大得多的19世纪英语作品样本,由21,158份文档组成,包括虚构和非虚构,这些文档来自泰德·安德伍德利用Hathi Trust数字图书馆进行的研究。[17]我们对这组文档的内容了解就少得多,而这也使我们得以在同一时期的经典文本子集和更广泛的作品集合之间检验我们的结果。

第三类包括约6,500篇长篇小说,分别是来自斯坦福文学实验室的19世纪长篇小说集和芝加哥文本实验室的20世纪长篇小说集。通过这些小说集,我们可以研究长篇小说词汇的历时变化。

最后,第四类包括由我的实验室整理的过去十年内出版的800部当代长篇小说和非虚构作品集。[18]这让我们能够更好地探究过去所观察到的影响在多大程度上持续至今。

表2概述了所使用的不同文档类别的构成以及各自的文档数量。

图2.png

表2 数据概览

本文探索的文本特征主要用LIWC软件提取。该软件由詹姆斯·彭内贝克(James Pennebaker)设计,是一个为社会科学领域开发的工具,用于研究大型文本集合。它包含了80种不同的特征,从识别句法和语法特征(如标点符号、介词、动词时态和代词的使用)到更高层次的认知现象(如社会、感知或情感过程)。[19]这些词典已在人类受试者身上得到测试和验证,其结果可供查阅。[20]与所有基于词典的方法一样,特定类别的语义连贯性也是一个未决问题。“insight(洞察)”词典中的所有单词是否都真正代表了小说中认知洞察的时刻?或者,所有的“I(第一人称单数代词)”都是同样的意思?[21]因此,对这些结果的解释需要慎之又慎。尤其需要注意的是,如何将这些类别理解为类别,重点是评估这些类别在小说中的语义连贯性。当我们深入研究单个特征时,我们会发现什么呢?正如我们将要看到的,我的重点将放在语义不那么模糊的类别上,从标点符号、人称代词到表达感官体验或认知犹疑的动词。

同时,强调这种词典构建方法对文学计算研究的益处也很重要。与主题建模或词嵌入所面临的问题不同,那些方法是在事后发现词语集合并加以命名,而这里我们是从预设的语言类别出发,检验它们在特定文本集合中的出现情况。词语外在于所需研究的集合,这使我们可以独立于这些集合本身来测试我们所相信的。虽然这两种方法都不完美,但它们都在单词与其被认为所承载的思想之间进行转换。最终所涉及的核心问题,是模型对自身能够逼近某种潜在文本现象的信心程度。[22]关键在于尽可能明确地说明我们是如何在不同的分析层级之间进行转换,也就是说,如何将概念层面、词汇层面与理论层面连接起来。

因此,LIWC为我们提供了一系列具有直观意义的解释性类别,以及这些类别可能部分基于的词库。它的一个核心优势是,即便数据本身具有专门性,特征集合仍然可以被共享——我在这里正是这样操作的。尽管如此,这些类别不应仅看其表面值,也应与所有语义领域一样,被加以深入考察。由于LIWC的字典是透明的,用户可以根据自己的需求进行完善或更改,就像我在此所做的那样。此外,它们还可以与其他更个性化的功能相结合,例如,使用WordNet这样的工具查看词类。虽然未来的工作需要继续扩展和完善这类特征集,但LIWC语料库仍可作为任何监督方法理解文本定量维度的有用起点。

虚构的连贯性

我想首先提出的问题是:作为一种写作类型,虚构的连贯性如何?是否真的如塞尔所言,没有句法或语义属性可以让我们预测某个对象是否具有虚构意向?虚构性是否仅仅是交际语境、作者意图和读者信仰体系的函数?还是说,一些特征在虚构文本中体现出高度规律性,而在非虚构文本中并不存在,以至于计算机也能准确猜测出文本的性质?

为了回答这些问题,我将使用所谓机器学习的方法,看看计算机能在多大程度上准确预测文本的给定类别(我将使用一种被称为支持向量机[support vector machine,SVM]的学习算法,这种算法在许多文本分类场景中都有应用)。[23]对于不熟悉这个过程的人来说,学习算法会在一组已知类别的文档中提取特征进行“训练”,然后被要求预测一组它从未见过的新文本属于哪个类别。在此,我使用在给定文档集合中发现的LIWC特征来训练算法,并使用十折交叉验证过程(process of 10-fold cross-validation)来预测文档是虚构作品还是非虚构作品。具体操作如下:随机地将语料库按9∶1的比例分折10次,每次都是90%的文档用于训练算法,余下的10%用于测试算法的可靠性。(Kernlab程序包中的folds函数确保每个折叠在两个类别之间实现均衡分配。)这样重复10次可以让我们全面了解收集的所有文档,因为每份文档都有机会进入测试集。表3列出了这一实验的结果,显示了所比较的两个数据集,以及对未见数据进行预测时的平均准确率得分。

从表3中我们可以看到,虚构和非虚构之间的差异不仅具有跨时间和跨语言的鲁棒性,而且我们可以使用在一个时间段建立的模型来有力地预测另一个时间段的数据。虽然当我们使用19世纪的模型预测21世纪的小说时,准确率会明显下降,但我们仍然可以得到相对较高的准确率(约为91%)。在过去的两个世纪中,小说话语似乎具有明显的跨时稳定性。事实上,正如我们将在下文中看到的,当我们研究更能说明小说写作的特征,特别是作为小说话语子集的特征时,通常会看到这些特征随着时间的推移而增强。除了小说的跨时稳定性之外,某些类型的小说专用词汇的增加也可追溯至19世纪。

图3.png表3 小说的可预测性

本表展示了使用SVM分类器和LIWC特征集进行分类测试的结果。在最后一个例子中,我在Hathi Trust数据集的虚构和非虚构文本中训练了分类器,然后将其运用于《纽约时报》评论的当代长篇小说集和流行的当代非虚构文本。

小说现象学

如果虚构的可预测性如此之强,那么是什么特征或特征组合造就了这种显著的可预测性呢?虽然有很多方法可以解决这个问题,但在此我将根据这些特征在虚构与非虚构文本中中值频率的增加情况对其进行排序,并使用非参数Wilcoxon秩和检验来说明统计意义。比较中值的价值在于,它保留了某一特征在特定样本中的总体分布信息。中值可以确定特定类别的中间点,而不是将所有虚构作品都简单地归入一个单一的分区,后一情况下,有些作品的某一特征的量可能明显高于其他作品,从而使结果偏向于它们。其次,有些显著性检验的设计是为了避免低频特征的影响,而本检验则并不作此假设,它只关注两组之间的比率,以了解特定特征相对于其总体出现频率的高低。因此,增加幅度大的低频特征比增加幅度小的高频特征更重要。[24]

首先,让我回顾一下这里使用的表格的整体结构,以便更好地理解它们能告诉我们什么,不能告诉我们什么(见表4)。最左边的一栏(“特征”)列出了LIWC所定义的特征。有些特征非常直截了当,如“感叹号”(exclam)是指感叹号的百分比;有些特征则比较微妙,如“家庭”(family)指的是词典中所有与家庭成员有关的词,而“社会”(social)指的是与社会经历有关的词,例如其中可以包括代词(这一选择实际上重复了代词类别,因为代词比其他词常见得多)。可以说,前者比后者更直截了当,因此,当我们遇到语义更模糊的词典时,我们需要谨慎(即便是像“你/你们”这样一个词,在小说中也可能具有不同的功能)。第二列(“类别”)列出了特征所属的类别,这是理解单个特征的一个略微宽泛的框架。接下来的两列(虚构、非虚构)列出了该特征在每个语料库中的中值频率,即占所有词语的百分比。这使我们能够了解哪些特征相对于其他特征更为普遍。

对于读者的阅读体验而言,百分比有些不够直观,因此在接下来的讨论中,这些数字通常会折算成该词在一个页面上和整部作品中出现的频次。这样,我们就想象得出读者的阅读体验,并推测出哪些特征占据了读者更多的注意力。例如,感叹号在19世纪的一部虚构作品中平均占0.45%。如果我们假设一部普通篇幅的小说约有100,000个词(或每页500个词,共200页),这意味着约每200词就有一个感叹号,或每页2—3个,或每部小说共约500个。而人称代词在小说中出现的频率约为10%,即每10个词出现一次,或每页出现50次(每部小说出现10,000次)。

第五栏“比率”可以让我们了解该特征在不同集合中的出现率差异有多大。感叹号在虚构作品中出现的频率几乎是非虚构作品的十倍。这是一个巨大的差异,但与其他特征相比,这个特征仍然是出现频率相对较低的。另一方面,虽然人称代词在小说中出现的频率只比在非小说中出现的频率高出两倍多一点(差异仍然很大),但是,这种差异依赖于文本中更广泛的语言层面。代词数量的两倍意味着每部作品中大约多出5,000个代词,或每页多出25个代词。虽然我在解释结果时优先采用了比率,但是,从特征的总体普遍性到不同集合之间的相对差异,这两个方面还是都要关注的。

从使用我们的经典样本和规模更大的Hathi Trust数字图书馆中19世纪作品来对虚构和非虚构写作进行基线比较开始(见表4),我们可以看到最能体现虚构性的特征是如何由对话驱动的——感叹号、问号、引号、“我”“你”等第一人称和第二人称代词、“是的”“好的”“哦”等表示赞同的词,以及最后还有“说”(said)这个词(LIWC将其标记为听觉动词)。

图4.png表4 虚构与非虚构对比:19世纪经典(英文)

与非虚构类作品相比,虚构类作品增幅最大的前20个特征。数值代表特定特征的百分比中位数。以下符号用于表示p值:<0.0001=***,<0.001=**,<0.01=*。

重要的是,我们还发现19世纪的样本与Hathi Trust文献更大规模的样本之间具有很强的一致性,但“社会过程”(social)类别以及潜在的“家庭”(family)、“家”(home)和“摄食”(ingest)除外。如果我们直接比较这些类别,就会发现,只有“家庭”和“摄食”在经典样本中频率有些高(大约高了10%—15%)。换言之,虽然存在值得探讨的有趣差异,但总体而言,通过较小的样本也是能够很好地捕捉到与较大样本相同的信息的。综合来看,这些特征表明,与非虚构类作品相比,虚构类作品具有相对明确的独特对话结构。虽然这可能不是什么“新闻”,但它确实有助于我们建立起来关于此类写作社会意义差异的分类体系。想象人与人之间的对话似乎是小说的主要文化功能之一。

事实上,把人想象成人可能是小说最重要的作用。如果我们把对话,连同伴随对话的代词表达(她说、他喊等)从上述集合中剔除,[25]就会发现,第三人称代词与提及家庭成员和身体的词语一道,成为虚构性最强的标志之一(见表5)。在对话之外,虚构作品中她/他(she/he)代词的平均数量比非虚构作品多了三倍多,仅这两个词就占了全文总词数的5%以上(换句话说,在一部中篇小说中约出现5,000例)。

图5.png表5 删去对话后的虚构与非虚构对比:19世纪经典(英文)

再考虑到历史作品使用的专有名词平均要比虚构作品多得多(估计是后者的2倍多),上述差异就尤为值得注意了。[26]虚构作品中人物数量较少,但得益于人物持续存在的时间更长,从而使得代词成为关键的语言标记。在虚构作品中,人们的身份似乎更具延伸性,但这不应与更“广阔”的身份,即语义更丰富的身份混淆。指代人物的代词出现频率与围绕这些人物的语言多样性并不等同。尽管如此,这还是让我们初步了解到虚构作品如何将身份认同过程展现为一种重复而广泛地指称同一个人(或主体)的行为。

家庭和朋友类词汇在虚构作品中如此常用,也表明了哪类人在这一文体中更为突出,正如“家”(home)这一场景设置让我们了解到他们最活跃的地方。大体而言,当我们阅读19世纪的虚构作品时,小说的独特之处,即何以不同于其他类型的自称关于真实事物的文本,就在于对家庭和熟悉事物的关注。旅行、探险、工作——这些都能够在别处以某种方式体验到,而对家庭生活和每个人长时间活动的记录则不可能。

当我们聚焦于德文和英文文本集以及跨越历史和当代的数据集之中一种特殊类型的虚构作品(第三人称小说)和一种特殊类型的非虚构作品(历史著作)时,上述关注的重要意义将变得更加清晰(见表6—表8)。首先需要关注的是一系列关于感知的表达(视觉、听觉、触觉),它们构建了体验者的现象学现实。而身体词汇的广泛运用,揭示了人们注意力的主要焦点所在。从定量角度来看,小说中最稳定的认知视角并非仅仅是关于他人的知识,而是关于另一个具身个体的知识。这一结果对“心智理论”(theory of mind)提出了有趣的挑战,因为该理论认为小说的核心目标是展现另一种人类意识。[27]尽管在接下来的测试中,我们将会看到这一假设确实有其合理之处,但就理解小说与众不同的虚构特质而言,鉴于小说着重强调感官输入和具身实体,心智理论模型所依赖的身心二元区分在此显得难以立足。较之于相应的非虚构作品,在小说创作中,一个具备感知能力的存在所经历的感官体验似乎是被反复强调的独特内容。

图6.png表6 删去对话后的第三人称小说与历史著作:19世纪经典(英文)

图7.png表7 未删去对话的第三人称小说与历史著作:19世纪德文

图8.png表8 删去对话的第三人称小说与历史著作:英文当代文学

为了更清晰地阐释我所指的小说现象学取向的意义,并使之更加明确,我将对19世纪的长篇小说与同时期出版的虚构作品中的特定非小说子集(HATHI_TALES)进行比较。这里的非小说类虚构作品指的是那些在19世纪读者中具有强烈存在感的各种虚构作品,包括翻译成散文的古典史诗(《伊利亚特》《奥德赛》《埃达》《尼伯龙根之歌》)、经典散文虚构作品(《源氏物语》《十日谈》《亚瑟王传奇》和拉伯雷的作品)、世界各地的童话集(源自爱尔兰、德国、丹麦、日本和印度)、同时代中短篇小说集(霍夫曼、托尔斯泰、狄更斯、莫泊桑、霍桑和华盛顿·欧文的作品),以及各种传说故事集(《昔日故事》[Tales of Former Times]、《家庭生活故事》[Tales of Domestic Life]、《道德故事》[Moral Tales])。这组数据旨在反映19世纪英语读者广泛阅读和了解的一系列散文虚构作品(prose fiction),但这些作品并不被归类为“小说”(novel)。虽然这些材料源自不同时代,但其出版(和翻译)整体上都是同时代的。

图9.png表9 小说与其他虚构作品

本表首先有三个突出的有趣特点。首先,这些比率与非虚构类相比,要低得多。虽然与非虚构类相比,这些组别差不多都具有很好的区分度,但如果相互比较,整体区分度就会大大降低。如果我们对其运行与前述相同的分类器,预测小说的准确率约为68%,接近统计学显著性阈值(p=0.018)。如果我们使用Hathi Trust文本集中稍大些的长篇小说集合(428部,以反映“其他虚构作品”),准确率将略微提高到74%(p=7.23e-05)。这仍然大大低于从不同文体中预测区别出长篇小说的能力。正如泰德·安德伍德所指出的,在150年的时间跨度内,预测侦探小说和科幻小说的准确率在88%—90%之间。[28]因此,“其他虚构作品”这一宽泛的类别与作为虚构作品子集的长篇小说之间区别并不大。

其次,我们不仅看到了诸如代词和对话等我们较为熟悉的有关虚构性的语言标记,与此同时,还在动词类别中看到了一个新特点:总体而言,动词数量更多,时态也更加多样(过去时、将来时、现在时,此外还有助动词)。换句话说,与一般虚构作品相比,长篇小说的时间复杂性似乎更大。这一现象值得深入探讨,因为它揭示了一个初步的见解,即长篇小说在19世纪如何通过时间处理上的独特方式区别于其他类型虚构写作。[29]

图10.png表10 长篇小说与其他虚构作品:独特的词汇

最后,我们还看到这里出现了一个前所未见的新类别,属于“认知过程”的类别。这些词典被LIWC加上了“差异”“否定”“不确定性”和“洞察”(discrepancy、negation、tentativeness、insight)的标签。如果我们分析一下这些词典中最能体现小说特色的词语(在此我按对数似然比[log-likelihoodratio]进行排序),我们便能清晰地观察到,这些词语在多大程度上倾向于标示出自我反思、怀疑和犹豫的时刻,呈现出一种对世界的试探性关系。

在此,情态动词(如could、would、must、might和should)及其否定缩略形式(如don't、can't、didn't、not、never、nobody)的使用极为普遍,否定的表达也十分常见。正如“如果”一词所体现的,这些词组提供了表达条件性甚至不可能性的不同方式。与此同时,不确定词汇(something、anything、somebody、anybody)以及更具体的表达犹豫的词汇(也许、机会、希望、可能、猜测、或许、怀疑、不确定)也更为常见。在长篇小说的语境中,表达条件和不可能性的语言中,还蕴含着相当多的潜在性和可能性,同时也夹杂着怀疑性。[30]

最后,我们不难发现,长篇小说的特点在于其对心理状态的广泛运用,这主要体现在“知道”“感觉”“思考”“记忆”和“相信”(know、feel、think、remember、believe)等动词的频繁使用上。此外,还有一些使用频率稍低但同样独特的复杂认知动词,如“承认”“思考”“想象”和“原谅”(admit、ponder、imagine、forgive,后者在文章中未具体展示),这些词汇构成了小说反思性的基石,它将怀疑与条件性思维融合在一起,形成一种连贯的精神状态。事实上,“似乎”和“感觉”(seem、feel)在长篇小说中的出现频率比其他形式要高出30%,这两个词共同展现了小说所特有的现象学倾向。与其他形式的经典虚构作品相比,长篇小说的独特之处在于,它聚焦的不是世界本身,而是人与世界的相遇和对世界的思考——即对世界的感知。正是这种感性认识与认知怀疑主义的结合,凸显了长篇小说对虚构话语的贡献。长篇小说的魅力在于,它为读者提供了一种长期阅读体验,让人们得以深入评价世界给予性(world's givenness)。[31]

长篇小说的现实主义问题

如果我们认同长篇小说作为一种文学体裁,其独特之处在于对现象学词汇的更多关注,那么问题就来了,这种关注是否也意味着对世界更深入的关注,即对现实或者——按照卢卡奇的抽象表述——“给予性”的更密切的关注。现象学与现实是相互排斥,还是相互构成?换句话说,我们能否检验长篇小说具有高度现实主义这一由来已久的假设?

虽然这些问题都需要进行专门的研究,但我在此先进行两个测试,旨在评估长篇小说现实主义倾向的有效性。在第一个测试中,我探讨了小说对抽象概念和物理实体的关注程度差异。为此,我选取了查德威克·希利集合(Chadwyck Healey Collection)中的19世纪长篇小说子集(约700部小说),并将其与Hathi Trust的“其他虚构作品”进行比较。随后,使用WordNet将这些文本转换成各自的上位词树。[32]上位词提供了名词的高阶分类(例如,“家具”是“椅子”的上位词),可以让我们了解在特定语料库中特定类别的词语是否比其他类别更常见,这与LIWC在情感和心理过程中的作用非常相似。举例来说,如果小说中出现了“沼泽”一词,它将被转换成“湿地”“土地”“地面”“土壤”“物体”“物理物体”“物理实体”或“实体”。在这种情况下,所有名词都被视为“实体”,其首要区别是区分物理名词(如“沼泽”)和抽象名词(如“死亡”)。

通过这一模型,我们可以提出这样一个问题:与其他类型的经典虚构作品(可以算上历史著作)相比,小说中的物理名词数量是否明显较多?由此,我们可以探讨,小说的独特性是否与其物理客观性(作为理解其现实主义程度的一种潜在方法)有关,或者更多地取决于抽象的精神或情感状态。

第二项测试则试图将现实主义理解得更加具体。一个文本越具体,它就越关注周围的世界。为了检验这一点,我比较一个文本中的词语是另一个文本中词语的上位词的百分比。在一组词语中,如果其中包含更多另一组词语的上位词,就说明第一组词语更抽象,第二组词语更具体。例如,如果我使用“沼泽”一词,而你使用“土地”一词,那么我的语言可以说比你的语言更具体(你的语言比我的语言更抽象)。在第一项测试中,文本中包含更多的物体(objects)是对现实主义的一种体现方式,而与之形成对比的是,第二项测试强调以具体性作为现实性的标志,认为越具体的事物就越贴近现实。

图11.png图1 抽象名词对物理名词的比率

该图测量了按WordNet分类法确定为“抽象”与“物理”的名词比例。

图12.png

图2 虚构作品中的上位词比较

该图测量了一个语料库中属于另一个语料库中词的上位词的百分比。上位词比下位词更抽象。由于误差条太窄,无法直观显示,因此已将其删除。

研究结果表明,以这种方式进行衡量,长篇小说与具体性之间的关系在19世纪确实发生了变化。观察19世纪上半叶的情况就会发现,与经典虚构作品和故事(tales)相比,那时长篇小说对物理对象的表达抽象程度更高,但到了下半叶,这种差异就消失了。正如瑞安·豪泽(Ryan Heuser)和龙黎克(Long Le-Khac)所言,英国小说在这一世纪中经历了价值性下降而具体性上升的过程。[33]然而,关于这一结论,有一点需要特别注意,虽然小说中的抽象性似乎在下降,但它从未低于该时期其他类型的虚构话语。相比于维多利亚时期的小说成为独一无二的具体作品,更准确的说法是,19世纪早期的长篇小说与这一时期其他类型的虚构性话语相比,其抽象程度之高是独一无二的。这表明,我们可能一直以来都误解了这个故事:对于19世纪小说而言,重要的并不是后来具体性提升、使其看起来更接近其他类型的虚构写作,而是早期的抽象性相较于其他类型的虚构写作更为突出(更不用说抽象性对于这些文本的重要性整体上仍然远远高于其物理性)。

研究的另一部分,即关于长篇小说具体程度的部分,则从另一个角度讲述了同样的故事。在19世纪上半叶,长篇小说与其他类型虚构作品的具体程度差异不大(约0.003%),而到了下半叶,小说中具体的词语比其他类型虚构作品多出约0.5%(每页约多出2个词)。[34]换句话说,小说在抽象程度上接近其他类型的虚构作品,而在具体程度上则偏离了其他类型的虚构写作。从19世纪开始,小说变得愈加抽象,而到了结尾部分则呈现出极为具体的特征。

当然,我们还可以从许多其他方面来思考小说的现实性问题。但这些初步结果表明,瓦特关于小说现实主义的论点——在此可理解为对物理性和具体性的更高追求——在第一种情况下,并非仅仅讲述一个特殊情境的故事,而是更倾向于回归到更为普遍的小说话语规范。其次,小说在展现其具体性方面确实变得出众,但其兴起的时间实际上要比传统观点所认为的晚得多。实际上,小说在18世纪末至19世纪初在数量上的崛起,似乎是以其更高的概念复杂性和概括性为标志的。与对周围世界的描写相比,小说更倾向于对抽象概念的探索和表达。[35]正如马修·埃林(Matthew Erlin)所言,小说的哲学维度是其历史的重要组成部分,而我们迄今为止都忽略了这一点。[36]学术界对现实主义小说具体化的强调,忽略了小说作为一种写作形式在历史上具有重要意义的主要方式之一,即小说的抽象性。

结论

在试图区分虚构与非虚构作品、找出虚构和长篇小说作为写作类型的独特之处时,我一直在深入探究它们更广泛的社会功能,以回答“文学为何重要”这个由来已久的问题。根据本文的研究结果,如果我们特别关注长篇小说在数量上的特质,即它们与非虚构或“真实”写作的区别,可以认为,自19世纪以来,长篇小说的重要性似乎与社会现实性无关,而更多地关乎现象学体验,是一种对世界的社会性嵌入(social embedding)。这并非长篇小说对读者产生意义的唯一方式。这涉及我在一开始就讨论的预测方法与描述方法的问题——可预测性方法可能会排除其他可能重要的可能性和特点,而描述性模型只需确定哪些特征存在差异,以及差异的程度,而无需预设特征空间的限制。量化观点的价值在于,它能使我们更好地理解特定类型的写作如何向读者传递特定的导向信号,我们可以称之为其社会定位(social positionality,这里借用布尔迪厄[Bourdieu]的概念)。这并不排除读者可以通过无数种方式找到自己理解长篇小说意义的可能。但它确实让我们能够更好地理解作为社会范畴的长篇小说。

从这个角度来看,长篇小说的虚构性之所以特别,是因为它有“相遇”(encounter)的概念和随之而来的质疑,它以一种特殊的方式将我们读者置身于世界之中。事情看起来、感觉起来就是这样,就如存在着大量的怀疑、偶然性、可能和或许一样。这些发现在两种不同的语言、两个截然不同的时间框架下,并且不管在更多还是更少,以及更经典的写作样本中都表现得很稳定。正如我们看到的,我们使用建立在19世纪经典长篇小说写作基础上的模型,仍然可以非常准确地预测现当代长篇小说的发展趋势。如果我们更仔细地观察这些特征随时间的变化,就会发现它们是如何变得愈加明显,而后最终趋于稳定的(见图3)。19世纪围绕虚构话语所确立的价值观在很大程度上随着时间的推移而保持不变,但有些特征,如对感官知觉的强调,其重要性则大大提高了。[37]

图13.png

图3 长篇小说的虚构性质(1800—2000)

1800年至2000年出版的英国小说中“怀疑”(doubt)和“感知”(perception)的比例。前者在19世纪下半叶略有上升,后者则持续上升,二战后趋于平稳。

当然,并不是所有长篇小说都是这样,也不是所有的长篇小说都以同样的方式呈现。在不同类型的小说创作中,这些虚构性的标志在多大程度上是一致的,仍然是一个悬而未决的问题。我们还可以设想另一项研究,探讨长篇小说变得高度非虚构的契机,以了解想象中的真相。我们该如何描述虚构中的非虚构,这些段落的作用又是什么?在本文开头使用的算法所误判的少数小说中,梅尔维尔(Melville)的《泰比》(Typee)和《奥穆》(Omoo)就属于这一类(但《白鲸》[Moby Dick]不在其中,这表明《白鲸》成为经典至少在一定程度上是以其虚构性为基础的),而这不会让人感到意外。但科尼利厄斯·马修斯(Cornelius Matthews)所著的《巨兽:土丘建造者的传说》(Behemoth: A Legend of theMound-Builders)也是如此,这部小说讲述的是杀死一头远古乳齿象的故事,被认为对梅尔维尔产生了重要影响。[38]我们能否不仅在这些小说中,而且在更普遍意义上的小说中,在虚构写作中,更具体地说明,语言的信息性使用——亚里士多德所说的“legein”(讲述)——究竟具有何种功能?这样的研究将为本文的观点提供一个镜像、一幅双联画,让我们能够从中清晰地看到,小说中的某些特质得以凸显。

不过,对我来说最重要的是,本文所使用的方法无法单独应用于某个段落或修辞优美的句子上。我们的小说标记、代词、感官知觉、从句语气和否定实例,遍布于成千上万行的小说文本中。每一句都略有不同。单独来看,它们并无特别之处。然而,把它们组合在一起,却向读者传达了一个强有力的信息。小说的虚构性是我们作为读者的一种感知体验,因为我们能够看到所有这些词语在页面上闪现,这些词语包括“感觉”“知道”“看到”“记得”,以及表达不确定性的词汇,如“几乎”“可能”“隐约”,还有各种形式的否定,即含有“不”的词语。这就是小说的异域空间。罗兰·巴特(Roland Barthes)曾提出这样一个问题:“这个他方在何处?”回答便是:“在语言的天堂里。”

编辑 | 姜文涛

原文信息:Andrew Piper, “Fictionality,” Journal of Cultural Analytics, Dec. 20, 2016, DOI: 10.22148/16.011.

向上滑动 查看注释

[1]感谢加拿大社会科学和人文科学研究理事会(SSHRC)对本研究的支持和资助。

[2]全面的讨论参见Käthe Hamburger, The Logic of Literature, 2nd ed., trans. Marilyn J. Rose, Bloomington:Indiana UP, 1973, p. 233;Gérard Genette, Fiction and Diction, trans. Catherine Porter, Ithaca: Cornell UP, 1993, pp. 1-29.

[3]这里需要明确区分虚构与真实之间的重要区别。本文探讨的是文本向读者表明其虚构性或真实性时所固有的特质识别问题。这与检测文本是否真实(即“测谎”意义上的真实性判断)有着本质不同。

[4]中文译文引自艾丽丝·门罗:《逃离》,李文俊译,北京:北京十月文艺出版社,2016年,第133页。出于与后文分析一致的需要,括号内补充了原中文译本中省略的动词“is”(对应词“是”)和代词“they”(对应词“她们”“他们”)。——译注

[5]尽管虚构作品的可预测性研究已取得初步且卓有成效的成果,但本文将聚焦于虚构写作的标志性特征,探讨这些特征如何揭示虚构性的本质,尤其是长篇小说的历史。参见Ted Underwood, “Understanding Genre in a Collection of a Million Volumes, Interim Report,” https://dx.doi.org/10.6084/m9.figshare.1281251.v1。

[6]Richard M. Gale, “The Fictive Use of Language,” Philosophy, vol. 66, 1971, pp. 324-340; David Lewis, “Truth in Fiction,” American Philosophical Quarterly, vol. 15, 1978, pp. 37-46; John R. Searle, “The Logical Status of Fictional Discourse,” Expression and Meaning: Studies in the Theory of Speech Acts, Cambridge: Cambridge UP, 1979, pp. 58-76; Hilary Putnam, “Is there a Fact of Matter about Fiction?” Poetics Today, vol. 4, no. 1, 1983, pp. 77-82; Benjamin Hrushovski, “Fictionality and Fields of Reference,” Poetics Today, vol. 5. no. 2, 1984, pp. 227-251; Gregory Currie, The Nature of Fiction, Cambridge: Cambridge UP, 1990.

[7]John R. Searle, “The Logical Status of Fictional Discourse,” p. 68. (中文译文引自约翰·塞尔:《虚构话语的逻辑地位》,冯庆译,《南京社会科学》2012年第6期,第145页。——译注)一切皆取决于塞尔对“一串话语”这一概念的区分——而这一区分本身亦构成一串话语。

[8]Maurice Blanchot and Jacques Derrida, The Instant of My Death, Demeure: Fiction and Testimony, Stanford: Stanford UP, 2000, p. 28.

[9]Stanley Fish, Is There a Text in This Class? The Authority of Interpretive Communities, Cambridge: Harvard UP, 1982.

[10]此观点绝非过时之论,它如今正以“后经典”叙事学的形态在学界重演——该学派主张,虚构叙事与非虚构叙事之间不存在本质性区隔特征。受心智理论新近研究成果的驱动,其关注焦点已从文本的独特性转向处理文本的认知机制,并假定这种机制普遍存在于各类叙事之中。而本文将说明,虚构与非虚构叙事不仅存在显著差异,而且这种差异主要是源于对感官感知(即具身体验)的高度关注,这使得将认知框架作为叙事研究的基础范式问题重重。关于后经典叙事学的立场,参见J. Alber and M. Fludernik, eds., PostclassicalNarratology, Columbus: Ohio State UP, 2010。这类新的研究主要是为了回应多里特·科恩(Dorrit Cohn)以及更早的凯绥·汉伯格(Käthe Hamburger)的“经典”叙事研究。Dorrit Cohn, The Distinction of Fiction, Baltimore: JHU Press, 1999; Käthe Hamburger, The Logic of Literature, Bloomington: Indiana UP, 1973.

[11]或有必要对此观点稍加阐发。语言哲学家们执着于这样一种理念:对于任何特定话语而言,并不存在能绝对判定其真实性的决定性特征。以前文段落中的句子为例——“站在那里的一个妇女认出了她,两人便聊了起来”——我们无法从字面本身明确判断其真伪,无从确证其所指涉的是现实世界真实发生的事件,抑或纯属虚构场景。然而,当我们将语言置于整体语境中观照时,其意向指涉性便开始显现。这恰如斯坦利·卡维尔(Stanley Cavell)常指出的,这类情形暴露出哲学家们建构的例证往往因过度简化而丧失了解释现实世界的效力。

[12]“虚构性”的多样化程度仍是一个悬而未决的问题,泰德·安德伍德(Ted Underwood)的研究准确地处理了文体的稳定性这一观念,而马克·阿尔吉-休伊特(Mark Algee-Hewitt)等的研究处理了19世纪之前虚构叙事的异质性问题。参见Ted Underwood, “The Life Cycles of Genres,” CA: Journal ofCultural Analytics; Mark Algee ‐ Hewitt, Laura Eidem, Ryan Heuser, Anita Law, and Tanya Llewellyn, NovelTaxonomies: Prehistories of Genre in the Eighteenth Century, CA (即将出版)。(从作者信息等方面判断,此文后来发表于斯坦福大学文本实验室的系列项目里面,题目略有差异,参见https://litlab.stanford.edu/projects/taxonomy-titles-18c/。——译注)在非计算的研究中,托马斯·帕维尔(Thomas Pavel)认为19至20世纪长篇小说的统一是一个有意为之的审美概念,意在与现代早期的子文体优先序次问题形成对照。“现代早期的叙事文化强调子文体之间的差异,而长篇小说后来的形态则是融合这些子文体的多种尝试的结果。”参见Thomas Pavel, The Lives of the Novel: A History, Princeton: Princeton UP, 2015, p.10。

[13]这一观点关注到多里特·科恩早期在计算研究之前所相信的“只有当虚构将聚焦潜能实现时,才能被明确识别为虚构”。Dorrit Cohn, The Distinction of Fiction, p. 25.

[14]在此,我发现我的这些结论与“可能世界理论”(possible worlds theory)高度一致,这一理论在1990年代很有影响力。参见Thomas Pavel, Fictional Worlds, Cambridge: Harvard UP, 1989; Marie Laure-Ryan, Possible Worlds, Artificial Intelligence, and Narrative Theory, Bloomington: Indiana UP, 1992; Ruth Ronen, Possible Worlds in Literary Theory, Cambridge: Cambridge UP, 1994。这也支持了约翰·班德(John Bender)更晚近的新历史研究,他的研究强调18世纪长篇小说的兴起与科学实验的关系。参见John Bender, Ends of Enlightenment, Stanford: Stanford UP, 2012。

[15]正如凯瑟琳·加拉格尔写道:“如果一种文体可以被认为是具有态度的,那么小说对其虚构性似乎持有矛盾的态度——既把它发明为本体论基础,又对它施加了严格的限制。”参见Catherine Gallagher, “The Rise of Fictionality,” The Novel, vol. 1, ed. Franco Moretti, Princeton: Princeton UP, 2006, pp. 336-363; Elaine Freedgood, “Denotatively, Technically, Literally,” Representations 125, Winter, 2014, pp. 1-14; Frances Ferguson, “Now It’ s Personal: D.A. Miller and Too-Close-Reading,” Critical Inquiry 41, Spring, 2015, p. 527; Ian Watt, The Rise of the Novel: Studies in Defoe, Richardson, and Fielding, Berkeley: California UP, 2001。需要补充说明的是,弗里德古德对小说技术性词汇重要性的强调绝非规范性的;她只是希望我们关注这一被忽视的维度,因为它拓展了阅读研究的史料范围。正如我将在本文结尾所展示的,对小说内部事实性的关注是计算方法非常适合解决的问题。同样值得注意的是,这些学术观点所关注的时间范围都比我在此探讨的时间框架要早,但它们的时间框架仍然构成了更广泛的长篇小说(用迈克尔·麦基恩(Michael McKeon)的话说,就是“我们的那种小说”[our kind of fiction])的规范性论述的基础。一个悬而未决的问题是,这些虚构性的模糊性或强化的指涉性感知之所以呈现出如此面貌,是否与17世纪小说中发生的事情有关,也就是说,这些论点是否基于17、18世纪之交发生的另一种转变,而这种转变到19世纪已不再起作用。

[16]更充分的讨论和预测模型的运用,参见Ted Underwood, “The Life Cycles of Genre”。

[17]虚构与非虚构的划分来自泰德·安德伍德的文献数据集。所有的重复题名都已剔除,所有在文体或题名域中有“essays”“tales”“scenes”“stories”词干的文档都已剔除,所保留的作品均为有89%或更高的概率其内容80%以上篇幅属虚构。

[18]与此前.txtLAB网站的19世纪文献集类似,本文涉及的文档都代表了近十年间虚构与非虚构作品的典范样本——这意味着它们都通过了某种筛选机制:无论是入选《纽约时报书评》、入围文学奖项提名,还是出现在亚马逊网站或《纽约时报》等多种畅销书榜单。对于该数据集更为详细的说明,以及围绕长篇小说的当代社会价值形态的揭示,参见Andrew Piper and Eva Portelance, “How Cultural Capital Works:Prizewinning Novels, Bestsellers, and the Time of Reading”。

[19]如对研究LIWC使用的词典感兴趣,可参阅其语言手册,http://www.liwc.net/LIWC2007LanguageManual.pdf。

[20]参见Yla R. Tausczik and James W. Pennebaker, “LIWC and Computerized Text Analysis Methods,” Journal of Language and Social Psychology, vol. 29, no. 1, 2010, pp. 24-54。

[21]有关词典驱动研究的周详而实用的综述,参见H. A. Schwartz, J. C. Eichstaedt, L. Dziurzynski, M. L. Kern, E. Blanco, S. Ramones, M. E. P. Seligman, and L. H. Ungar, “Choosing the Right Words: Characterizing and Reducing Error of the Word Count Approach,” in Proceedings of SEM-2013: Second Joint Conference onLexical and Computational Semantics, Atlanta, Georgia, USA, 2013, pp. 296-305。有关文本分析的词典与机器学习方法的对比,参见Andrew Piper and Eva Portelance, “How Cultural Capital Works”。

[22]有关建模和计算阐释学,参见Andrew Piper, “Novel Devotions: Conversional Reading, Computational Modeling and the Modern Novel,” New Literary History, vol. 46, no. 1, 2015, pp. 63-98。

[23]本研究使用R语言中的kernlab程序包,所有分析均采用高斯核函数(“rbfdot”)。关于机器学习,有一篇有用的导论文章:Brett Lantz, Machine Learning with R, Birmingham, UK: Packt, 2013。

[24]完全可以推翻这一假设,优先考虑总体上更普遍的特征,这在评估单个词语时很有价值。单个词汇的使用频率可能很低,因此偏好使用数量较多的词汇可以确保找到更多“重要”或“相关”的词汇,即随机词汇较少。关键的一点是,结果是由模型中使用的初始假设决定的。

[25]除了删除对话,有关交流的200个动词及其前后紧挨着出现的人称代词(I said, said she等)也被从文中删除了。

[26]通过R语言中的NLP程序包分析发现,小说文本中平均提及的人名数量为10.58个,而历史类著作中这一数值则达到23.94个。

[27]Lisa Zunshine, Why We Read Fiction: Theory of Mind and the Novel, Columbus: Ohio State UP, 2006.

[28]Ted Underwood, “The Life Cycles of Genres,” Journal of Cultural Analytics, Vol. 2, no. 2, 2016.

[29]这种随着时间推移而演变的“虚构作品/长篇小说”的区别,将在当代长篇小说的文体区分中再次显现,因为它与社会价值息息相关。当前畅销书与获奖小说之间最显著的差异特征之一,便体现在对怀旧与回溯(retrospection)这一特征的处理上。参见Piper and Portelance, “How Cultural Capital Works”。

[30]这一观察与马修·埃林(Matthew Erlin)有关小说叙事的哲学维度的论述一致。参见 Matthew Erlin,“From the Philosophical to the Epistemic Novel?” CA: Journal of Cultural Analytics (即将出版)。(原文如此,译者并未找到这篇文章。——译注)

[31]如果仅以这四项特征作为分类依据,分类结果的准确率将显著高于随机选取四项特征的平均水平。不过需要说明的是,该准确率仍远低于使用全部80项特征时的表现,且存在其他特征组合能够实现略优的效果。在这些表现更佳的特征组合中,出现频率最高的是现在时动词和感官知觉类别——这也印证了前文关于小说文本独特性的其他讨论。具体数据如下:使用全部四项特征的准确率为76%,表达认知推诿的特征准确率为63.4%,而随机选取四项特征的准确率(基于100次试验)为60.8%±3.8%。

[32]这些小说首先使用R语言中的openNLP工具包进行文本处理,仅保留名词,然后再用Python脚本hypernyms_ReturnTopClass.py处理后的文本进行转录。

[33]Ryan Heuser and Long Le-Khac, “A Quantitative Literary History of 2,958 Nineteenth-Century British Novels: The Semantic Cohort Method,” Stanford Literary Lab Pamphlet 4, http://litlab.stanford.edu/LiteraryLabPamphlet4.pdf.

[34]这里的p值极低,原因之一是观测数据的数量较多。在比较各组中每篇小说和其他所有小说时,我们得到了超过13,000个观测值。在这种情况下,即使是微小的差异也会显得很重要。因而,实际差异从0.003%变为0.5%。

[35]将小说的抽象性视为其早期独特性关键的观点,为我们反思现实主义假说提供了一条有别于韦恩·布斯(Wayne C. Booth)的思路。在布斯看来,长篇小说(或者他所说的“优秀的”长篇小说)的价值在于对戏剧性张力的关注,而非现实主义呈现。他说道:“对现实主义的兴趣并不是一种可证实或证伪的‘理论’,甚至也不是多种理论的组合;它只是一个时代人们最深切关怀的表达。”这种观点将我们引向更接近马修·乔克斯(Matthew Jockers)著作精神的情节弧线理论——情感强度如韵律般起伏波动的叙事结构。参见Wayne C. Booth, The Rhetoric of Fiction, Chicago UP, 1983, p. 63。

[36]Matthew Erlin, “From the Philosophical to the Epistemic Novel?” CA: Journal of Cultural Analytics(即将出版)。(原文如此,译者未找到这篇文章。——译注)

[37]进一步分析表明,这一增长主要是由于对“地点”(site)这类词的依赖。而其他大多数词则保持不变。更多的研究可以揭示这种明显的偏差对虚构的影响。

[38]Curtis Dahl, “Moby Dick's Cousin Behemoth,” American Literature, vol. 31, no. 1, 1959, pp. 21-29.

点击下方链接,下载原文

虚构性.docx

如需购买《数字人文》期刊,请扫描下方二维码

封面.jpg

校对  |   肖爽

美编  |  王秀梅

图片

数字使人文更新

投稿:https://szrw.cbpt.cnki.net

数字人文门户网站:www.dhcn.cn

阅读原文

跳转微信打开

《人民日报》 |  刘石:人工智能时代,立住人的主体性

2026年5月14日 09:59

2026-05-14 09:59 北京

《人民日报》 | 刘石:人工智能时代,立住人的主体性

图片

编者按:2026年5月9日《人民日报》发表清华大学人文学院院长刘石《人工智能时代,立住人的主体性》一文。这是刘石教授2026年4月18日在“传统赓续与时代书写:2026年清华大学人文学院博士生学术论坛暨清华大学第816期博士生学术论坛”开幕式上的致辞,原题为《正确认知自我这个主体与AI这个客体之间的关系》,《人民日报》发表时略有删节。

图片

我查了下这一周手机里的各种信息,有一二十条有关AI(人工智能)的信息,平均一天差不多有三条。

对于AI领域的核心技术,呈万箭齐发态势的各类大模型,在人文领域,我们听见两种不同的声音。一种是大模型有用吗?我怎么觉得它不仅离道的层面很远,就是在器的层面功能也很不完善?还有一种是,大模型确实太了不得,无所不能,因此副作用也随之而来:学生不用学习了,教师难以教学了。这是两种相反的认识,但奏响的都是唱衰大模型和AI的乐章。这两种认识,我觉得都值得商榷。

首先,大模型没那么弱,觉得它没用,很大的原因可能是你没有掌握使用的技巧,没下过正确训练的功夫,没有使用真正厉害的那款大模型。我们一定不要对它轻下无用的判决。其次,大模型确实也没强到绝杀万物、唯我独尊,至少它不会比人聪明,何以见得?人能发明它,它不能发明人。人会主宰它,而不是反过来,除非人愿意将主宰权拱手相让。因此,我们一定不要被它吓倒。

最近密集的AI信息中,最耸人听闻的一篇题目是“课堂已死”。就是说,有了大模型,学生不用学习了,凡事依赖大模型,大模型成了懒人宝典;有了大模型,教师没法教了,因为教不过大模型。

大模型强吗?学生为什么不能利用它,为什么用大模型就叫不爱学习,甚至叫不学习?有没有不爱学习的学生?当然有,大模型时代之前就有,这怨不得大模型。大模型强吗?如果真强到优于教师,那教师就理应被取代,为什么不?所以为那些已经开始为自己的饭碗担忧的同行们提一个建设性思路,大模型如果能倒逼着我们致力于提升自我,塑造出一个更新的自我,重新赢得学生的青睐,不是好事吗?

倒是在自我与AI间,如何认识和处理两者的关系,是关键。

有一种观点,认为AI技术带来了非专业和专业的知识平权。这里我想引用一段理想汽车创始人李想说的话。他说大部分领域,顶级专家使用AI的杠杆价值,远远高于普通人使用AI。指望AI抹平专业差距,纯属做梦。非AI时代,普通人和顶级专家的差距是100倍,AI时代,这个差距可能会扩大到1万倍。AI和Agent(智能体)会成为一面放大镜,把人与人之间专业能力的差距,放大给人看。

确实,很多人以为,有了AI,大家就站在同一起跑线上了,专业不专业无所谓了,反正AI都能帮你完成。这个想法,恰恰是危险的误解。

对于学生来说,AI能帮你写作,也能帮别人写作,所以,你能不能向它提出别人提不出的问题,让它写出跟别人让它写的不一样的东西,能不能在它写错的时候发现它的错,能不能判断它写得好不好,能不能用它生成的东西做出真正有价值的研究就很关键,而这些,全部依赖于你自己的专业基础。对人文社科领域的学生来说,尤其值得自省的是,我们这个领域最核心的训练是什么?是问题意识,是分析能力,是批判性思维,是三观,是对人类经验真实、独到和深刻的理解。这些东西,AI给不了你,只能靠你自己一页一页、一本一本地读书、思考和积累。对于教师来说同样,假设你真的是有专业水准的学者,而且你依然在持续致力于专业水准的不断提升,同时你还是一个有思想、情感、温度、修养,一颦一笑间尽显品位和人格魅力的教师,AI又如何能取代你呢?

也许我们还可以这样说,AI是放大器,放大的是你已经拥有的东西。你的专业越扎实,你使用AI才越像老虎添上了翅膀,AI在你手里的杠杆就越长。没有这个底子,AI不过是帮你更快地生产出一堆看起来像模像样、实则一无可取的东西。关键是,即使是有价值的东西,因为不是基于你专业基础的所思所得,也难以内化于你的内心和头脑,融汇成你自己学识涵养的一部分。

总之,古人说,工欲善其事,必先利其器。我们很幸运,赶上了AI这个科技加速时代带给我们的利器,我们不拥抱它不利用它是不明智的。但请记住,它再是利器,也只是你的工具,不是你的主人。我们得先把自己这个“人”的主体性立住了,才谈得上其他。

图片

来源:《人民日报》2026年5月9日第8版

转载自“清华文科”公众号

阅读原文

跳转微信打开

报名开启 | 第四届语料库与数字人文暑期学院(2号通知)

2026年5月14日 09:59

2026-05-14 09:59 北京

暑校报名5月5日开始,5月15日截止,线上线下免费学习!

第四届语料库与

数字人文暑期学院

— 2号通知 —

CDHSUMMER2026

随大数据与人工智能技术的发展,语言、文学、历史等人文研究都越来越多地引入了计算技术。人文学科与计算技术的交叉研究,关键在于基于语料库的人文大数据构建、计量和大语言模型的应用。

为推动计算语言学与数字人文的学科建设与人才培养,南京师范大学联合北师港浸大、澳门大学、香港科技大学、南京农业大学五校,于2026年7月25日-8月4日(共11天),通过线上线下结合的形式举办语料库与数字人文暑期学院,包括讲习班实训和讲座论坛两大部分。

01

报名链接

扫描上方二维码即可进行报名

02

各班概况

01

A班:数据库编程讲习班

  • 以《全唐诗》为例,教习人文语料库构建技术与交互式检索网站开发方法,实现文史数据的结构化存储与动态展示。

  • 主讲:李斌(南京师范大学)

  • 设备要求:需准备16G内存以上的Windows 10/11笔记本电脑

  • 详细课程大纲:

第一讲:课程简介与软件安装

第二讲:数据表的构建

第三讲:数据库的查询

第四讲:PHP程序设计

第五讲:字符编码

第六讲:字符串处理

第七讲:交互式网站搭建

第八讲:本地小模型优化

02

B班:语言统计方法讲习班

  • 聚焦语料库计量分析,系统讲授基于SPSS的统计基础、参数检验、非参数检验、聚类分析、相关分析、卡方检验、多元线性回归及逻辑回归等核心方法,帮助学员掌握语言研究中的定量分析技能与统计报告生成能力。

  • 主讲:沈威(华中师范大学)

  • 设备要求:需准备安装有SPSS 27.0及以上版本的Windows/Mac笔记本电脑

  • 详细课程大纲:

第一讲:统计基础与SPSS安装实操

第二讲:常见的参数检验

第三讲:常见的非参数检验

第四讲:聚类分析

第五讲:相关分析

第六讲:卡方检验

第七讲:多元线性回归

第八讲:逻辑回归

03

C班:大模型编程讲习班

  • 掌握大语言模型基础原理与人文场景落地技术,能够独立开发面向文史研究的大模型应用。

  • 主讲:王东波、刘浏(南京农业大学)

  • 设备要求:需准备性能较好的Windows/Mac笔记本电脑(推荐16G以上内存)

  • 详细课程大纲:

第一讲 大语言模型基础

第二讲 基础模型和推理模型

第三讲 提示工程

第四讲 继续预训练和监督微调

第五讲 强化学习

第六讲 大模型的部属

第七讲 检索增强生成

第八讲 AI Agents

  • 招生要求:具备基础Python编程能力,对大语言模型有基础认知。

03

专家讲座与配套活动

01

系列讲座

邀请20位领域顶尖学者,开设20场讲座,覆盖理论前沿、技术方法与应用实践,每日上午线上线下同步直播。

 特邀讲座和论坛嘉宾 

新疆大学 冯志伟教授

澳门大学 袁毓林教授

香港理工大学 黄居仁教授

中国社科院民族所 龙从军研究员

中国社科院语言所 张永伟研究员

北京大学 苏祺研究员

北京大学 朱本军研究员

华中科技大学 唐旭日教授

同济大学 王昊奋教授

南京大学 黄书剑教授

南京农业大学 王东波教授

南京师范大学 李斌教授

北京师范大学 胡韧奋副教授

中国人民大学 卢达威副教授

北京语言大学 饶高琦副研究员

华中师范大学 沈威副教授

中国传媒大学 王璐璐副教授

江南大学 王萌副教授

(持续邀约中)

02

主题圆桌论坛

设置2场专题Panel,围绕「LLM时代人文学科的理论重构」「语言学与数字人文的未来」展开深度对话,开放学员提问与交流环节。

03

文化考察与学术研讨

每日下午安排南京及周边特色人文考察与分组学术研讨,线下学员可全程参与。

04

成果展示与颁奖

闭幕式设置优秀成果汇报环节,邀请专家现场点评,为优秀学员颁发证书。

04

招生与报名规则

01

招生规模 

本次暑期学院计划录取线下学员120人,线上学员80-100人,总计不超过240人。其中主办五校(南师大、北师港浸大、澳大、香港科技大学、南农大)学员录取不超过 60 人,其他单位学员录取不超过 180 人。

02

面向对象

全国高校及科研院所数字人文、计算语言学、语料库语言学、中国语言文学、历史学、文献学、考古学、新闻传播学等相关学科的本科生、研究生,以及青年教师、科研人员。

03

分班报名要求

学员仅可选择1个平行讲习班进行报名,不可兼报,各班报名要求如下:

  • 数据库编程讲习班:面向零基础或编程初学者,具备大学英语四级及以上水平即可报名,已具备计算机相关专业背景者请勿申请。

  • 语言统计方法讲习班:具备基础的文本分析认知,对语料库计量分析有学习需求,已具备统计学/计算机专业背景者请勿申请。

  • Python大模型编程讲习班:具备基础的Python编程能力,对大语言模型有基础认知,尚未掌握人文场景大模型开发与应用技术,已具备计算机相关专业背景者请勿申请。

04

报名方式

  • 报名时间:官方报名通道将于2026年5月5日正式开启,2026年5月15日截止报名,报名二维码及链接将在官方公众号同步发布。

  • 报名材料:申请人需填写报名表单,并上传个人简历、研究基础与学习目标说明,主办方将根据报名材料进行择优录取。

  • 录取通知:最终录取结果将于2026年6月1日前通过邮件及官方公众号推送,录取学员需签署上课承诺书,承诺全程参与课程学习、按时提交作业,报名成功后无特殊原因不得中途退课、不得更换报名班级。

05

结课与考核方式

本次暑期学院以独立完成的人文研究成果为核心考核目标,具体要求如下:

  • 数据库编程讲习班:独立构建专属人文数据库与交互式检索网站。

  • 语言统计方法讲习班:完成基于语料库的人文研究计量分析报告。

  • Python大模型编程讲习班:完成面向人文研究场景的大模型应用开发。

学员成果将在闭幕式进行集中汇报,邀请领域专家进行现场点评与指导;完成全部课程学习、通过成果考核的学员,将颁发暑期学院结业证书,优秀成果将授予优秀学员证书。

05

组织架构

(以下各项排名不分先后)

 主办单位 

南京师范大学文学院

联合主办单位

澳门大学人文学院

香港科技大学人文学部

北师香港浸会大学人文社科学院

南京农业大学信息管理学院

特约支持单位

中国社科院民族所民族语言文化行为实验室

 协办组织/单位 

中国民族语言学会语言资源与计算人文专委会

中国人工智能学会语言智能专委会

江苏省人工智能学会自然语言处理专委会

江苏省修辞学会

数字人文专业发展联盟

浙江大学文学院

 出版与媒体支

科学出版社

高等教育出版社

中华书局古联公司

外语教学与研究出版社

南京大学出版社

南京师范大学出版社

汉语堂公众号

语言服务公众号

比特人文公众号

扫码关注公众号,

获取报名通道、课程更新、嘉宾资讯等更多内容

相关链接:

第四届语料库与数字人文暑期学院(1号通知)

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

会议议程 | 人工智能时代的文学计算研究工作坊

2026年5月9日 13:27

2026-05-09 13:27 北京

时间:2026年5月16日(周六)9:00—17:00地点:重庆大学沙坪坝校区A校园博雅书院报告厅

以下文章来源于重庆大学文字斋

人工智能时代的文学计算研究工作坊

人工智能技术的飞速发展正在深刻重塑人文学科的研究范式与问题意识。在文学研究领域,“计算”不再仅仅是数据处理的工具,而逐渐成为一种介入文本解读、批评实践与理论建构的新思维。计算思维如何为经典文本解读、文学史书写及批评理论创新提供新路径?数字人文教育又该如何回应“新文科”建设的时代要求?诸多问题都亟待深入探讨。

为此,重庆大学人文社会科学高等研究院将于2026年5月16日举办“人工智能时代的文学计算研究工作坊”。期待通过这场小规模、高密度的学术对话,推动文学计算批评这个新兴领域的理论创新与方法自觉,为相关领域的探索者提供一个开放、共创的交流平台。会议的具体安排如下。

时间:

2026年5月16日(周六)

9:00—17:00

地点:

重庆大学沙坪坝校区A校园博雅书院报告厅

召集人:

刘洋(重庆大学中文系副教授)

主办:

重庆大学人文社会科学高等研究院&博雅学院

承办:

重庆大学中文系、重庆大学科幻文学与科技人文研究中心

会议议程

一、开幕致辞(9:00 - 9:15)

李广益(重庆大学人文社会科学高等研究院执行院长、教授 )

刘洋(会议召集人,重庆大学中文系副教授)

二、集体合影(9:15 - 9:30)

三、会议报告第一场(9:40 – 11:40)

主持人:江晖(中山大学)   

评议人:赵薇(中国社会科学院)

李飞跃(清华大学):数字人文研究的实验传统与方法

战玉冰(复旦大学):数字人文研究中的“主观性”与“主体性”

陈涛(中国人民大学):数字人文视域下的电影色彩研究:范式转型与实践困境

刘洋,韩笑(重庆大学):“只赛博,不朋克”:对中国赛博朋克小说的情感计算研究

四、午餐(新华园餐厅)

      午休(11:40 – 13:40)

五、会议报告第二场(13:40 – 15:10)

主持人:姜振宇(四川大学)   

评议人:刘洋(重庆大学)

许秋斌(南方科技大学):大语言模型创意写作评测基准的现状与未来展望

耿弘明(清华大学):大语言模型文学计算的可解释性:双向反事实解释的可能

江晖(中山大学):文学计算的“黑箱”问题:深度学习模型应用于风格识别的机制初探

六、会议报告第三场(15:20 – 16:50)

主持人:战玉冰(复旦大学)   

评议人:陈涛(中国人民大学)

赵薇(中国社会科学院):计算建模与量化形式研究

姜振宇(四川大学):从“计算审美”到“培养模式”:一项文科实验室的跨学科项目实践反思

吉云飞(中山大学):以计算批评应对算法推荐——以番茄小说为中心

七、会议闭幕(16:50 – 17:00)

报告文章摘要

数字人文视域下的电影色彩研究:范式转型与实践困境

陈涛

在数字人文视域下,电影色彩研究正经历从主观解读到量化分析的范式转型。相较于传统电影色彩在形式主义、符号学、精神分析和文化研究方面的研究路径,以计量分析和可视化呈现为核心特征的数字人文电影色彩研究发挥了数字工具的“色彩透镜”作用,从而推动电影研究技术史、美学史与接受史的三维整合。从“遥观”的角度来说,目前电影色彩的研究工具主要呈现为基于电影文本形式的内部大数据和可视化电影色彩两种。而相对于RGB模型,HSV色彩模型提供了更适合人文学者研究的空间路径,并通过不同属性的对比特征与空间分布,来呈现色彩的语义关联与象征体系,令我们更好地揭示技术与风格的互动关系,并构建起多层级分析框架,打通色彩的微观、中观与宏观研究。与此同时,我们要避免技术工具从“精确性”到“过度简化”的局限性,警惕数据质量和语境缺失带来的危害,并提倡“色-声-触”的跨模态验证。

数字人文研究的实验传统与方法

李飞跃

实验是在悬置和控制条件下观测现象、验证假设,构建可重复检验的知识生产链。数字人文在理想条件下探究变量之间的因果关系,正让人文研究经历“从开放思辨到闭环实验”的范式迁移。随着文本工具的广泛使用,超经验的知识秩序正在浮现。考察古典文献的实证传统、近代人文的实验主义探索,有助于明确数字人文研究的核心理念与方法,并借以重审一些重要的传统人文命题。

“只赛博,不朋克”:对中国赛博朋克小说的情感计算研究

刘洋,韩笑

“只赛博,不朋克”是对中国赛博朋克小说的经典论断,但其情感基础尚缺乏系统的实证检验。采用基于词典的情感计算方法,构建21维情感向量,可以对105篇中国赛博朋克短篇小说与105篇西方经典赛博朋克短篇小说进行系统性比较。通过主成分分析与独立样本t检验,研究发现两组文本在情感分布上存在显著差异:中国赛博朋克小说在“赞扬”与“快乐”两类积极情绪上强度显著更高,而“憎恶”“贬责”等消极情绪显著更低,整体呈现明确的乐观偏好。研究进一步发现,这一情感模式与1990年代以来电脑游戏文化的深度渗透密切相关,游戏经验为赛博空间赋予了探索、成长与社交的积极意义。

大语言模型创意写作评测基准的现状与未来展望

许秋斌

本分享聚焦大语言模型在创意写作领域的评测基准,从短篇生成、长篇叙事到多维创造力评估,逐一梳理各类benchmark 的演进。讨论重点包括:评测指标如何从语言流畅性转向新颖性、多样性、一致性与人类偏好对齐,以及自动评价方法的局限和评审可靠性问题。最后展望创意写作评测的几个发展方向——从单一结果打分,转向多维、过程化、多模态。

计算建模与量化形式研究

赵薇

量化形式主义仍是一个未竟的议题。莫莱蒂的“远读”虽融合了形式主义传统与马克思主义的社会学视角,推动了文学概念的可操作化测量,但大多停留于中观尺度的描述性统计,缺乏检验与反思环节。本发言以数字人文与计算批评实验室近年来的工作为中心,介绍机器学习建模在现代汉诗节奏观念重构、语词分布模型在20世纪美国小说生态批评话语跨文类演变研究中的功用,兼及民国文类与文献计量等方面的建设实践,旨在探讨如何将计算建模系统性地嵌入“假设—验证”的实验设计,实现文学命题的推理与论证,从纯形式的演化中发掘文化意识形态内涵,揭示形式变迁的历史动因。

文学计算的“黑箱”问题:深度学习模型应用于风格识别的机制初探

江晖

深度学习在文学风格识别领域展现出潜力,但其判断逻辑的不透明已成为数字人文研究方法论层面的核心难题。即关于模型所依据的语言信息仍然缺乏有效的解释路径,这不仅制约了对模型判断的信任,也阻碍了对风格内涵本身的深层理解。本研究基于前期的实验基础,对风格判别的可能依据进行拆解性考察,目前的结果更多指向了问题的复杂性。这一探索过程本身,为数字人文领域应对计算方法的“黑箱”困境提出了有待深化的问题。

数字人文研究中的“主观性”与“主体性”

战玉冰

本报告一方面以本人曾经尝试过的数字人文个案研究——关于网络小说的空间地理统计——为反思对象,重点关注其中存在的1数据源的信度和效度问题、2数字人文研究方法背后所隐含的“主观性”问题。特别是第二点,其直接关系到“数字人文”研究方法究竟能否生产“新知识”,抑或仅是在印证“旧结论”这一根本性争议。另一方面,将以程小青《霍桑探案》系列小说的城市空间书写与现实中的地理单元分布为研究对象,尝试融合传统文本细读与计算批评方法,探索如何将研究过程中不可避免的“主观性”转化为具有生产潜能的“主体性”。

以计算批评应对算法推荐——以番茄小说为中心

吉云飞

抖音集团旗下的番茄小说凭借移植于抖音的推荐算法,已拥有超两亿月活跃用户,是最大的网络文学平台。当算法推荐成为网络文学推荐机制的主要组成部分,计算批评便同样应该成为网络文学批评的必备武器。本报告将讨论建立一种适配于算法推荐的计算批评的必要性与可能性,主要关于它的问题域、操作方法与限度。

从“计算审美”到“培养模式”:一项文科实验室的跨学科项目实践反思

姜振宇

在人工智能与文学研究交叉的背景下,文科实验室如何定位自身价值、如何培养适应跨学科需求的人才,成为亟待探索的议题。本文以四川大学中华文化传承与全球传播数字融合实验室的一项具体研究——“科幻审美计算”项目为例,反思一次“成果有限”的探索如何转化为人才培养的宝贵经验。该项目尝试将科幻文学中的审美问题转化为可计算对象,通过自建关键词强度表、赫斯特指数和双重固定效应模型,分析科技名词在文本中的融入程度。虽然模型未能直接“解决”科幻审美难题,但项目执行过程中,团队逐步摸索出一套“项目驱动型跨学科培养模式”:包括多背景学生的协同分工、从问题提出到模型迭代的完整流程设计、以及学术产出与教学目标的平衡策略。本文认为,文科实验室的核心价值不仅在于产出高质量研究成果,更在于为数字人文领域培养“既能提问、又能动手”的复合型人才。这一经验或可为同类实验室的建设与跨学科教学提供参考。

大语言模型文学计算的可解释性:双向反事实解释的可能

耿弘明

理解文学大模型生成文本的逻辑,需要融合计算分析与人文批评两种视角。传统可解释性AI方法,如LIME和SHAP,为我们提供了基础工具。然而,这种归因停留在统计层面。为此,我们引入文学批评中的细读法与的“推敲”传统等。将这种方法论应用于提示词工程,需要从“主题指令”转向“机制指令”。

更富启发性的路径,是第二种思路,对模型进行“反事实”的文学能力推演。如果改变模型的“文学经历和记忆”,它的“文风”会如何系统性改变? 例如,如果在大模型训练过程中,完全剔除了以“含蓄蕴藉”著称的晚唐李商隐的全部诗歌,那么,与完整训练的版本相比会出现何种“退化”或“转移”。最终,有意义的结合在于为计算特征赋予文学阐释。期待这种跨学科的对话,对我们能够描绘出大模型内部那座由海量文本构建的、复杂而有序的“文学记忆宫殿”的有所贡献。

海报 | 周雅婕

审核 | 刘洋、张可心、唐杰

编辑 | 郑晓

阅读原文

跳转微信打开

❌