程宁
(中国社会科学院文学研究所,北京 100732)
摘要:采用数字人文方法,从字频统计角度考察唐诗的语体特性与语言规律,以深化对唐诗语言风格及时代审美风尚的理解,并为古典诗歌研究提供可验证的数据支撑。以大规模诗文总集《全唐诗》《全唐文》以及唐代以前的《先秦汉魏晋南北朝诗》、唐代以后的《全宋诗》《全元诗》为数据样本,采用字频统计、齐普夫定律、字频序列相关性计算等理论与方法,揭示唐代诗歌的用字风貌,并定量比较唐诗与其他文体特征的差异性。在唐诗内部,以其字频分布模式构建了五级字区,并得出以“花”“水”“月”为代表的唐诗偏好字例。通过字频序列相关性检测,发现唐诗与宋诗、元诗的字频序列均表现出强相关性,反映了唐诗对后世诗歌创作影响深远,而宋诗与元诗的字频序列相关性最强,说明二者在字词使用上较唐诗关系更为紧密。唐诗相较于其他朝代诗歌,其诗化程度最高,确立了完全不同于散文的诗性语言典范。
关键词:唐诗词汇 字频统计 定量比较 文体特征 数字人文
0 引 言
诗歌研究在关注作家文化与思想的同时,也要重视其组构作品的语言材料。传统诗学的核心在于理解诗歌的内涵与美学价值,在这一框架下,每个字词的使用都不是偶然,而是诗人选择的结果,反映了其创作意图和艺术追求。受限于研究手段,以往研究很难从宏观的角度把握诗歌语汇的关联特征和演变规律。通过大数据及其相关技术对古代文学经典文本进行深度分析,可使文学研究进入更宏观的视野,提高结论的精准性、稳定性及可验证性,促生新的研究理念、方法与范式[1]。与散文的线性体式不同,汉语诗歌的语汇高度离散化,它不依照一般语言序列的组织逻辑来构建诗行,而是通过“对等原则”①重写语汇纵向选择和横向组合的规则。在整个汉语词汇系统中,有哪些元素被认定为具有“诗性”而被广泛用于组建诗歌作品,并经过历代更迭,有选择性地进入到唐代诗歌文本的空间内构筑起唐诗基底,这可以借助计算机软件与频次统计等手段进行穷尽式梳理和发掘。
1 古诗文字频相关研究
字频指的是在给定的文本或语料库中某个特定字符出现的频率,通常用来衡量该字在语言中的常见程度以及它在特定文本或语境中的重要性。字频特征对语言文字研究非常重要。计算语言学家冯志伟曾提到,汉字除了传统文字学所认为的音、形、义三个要素之外,从使用的角度还应有第四个要素便是字频[2]。字频统计一方面可以辅助国家制定语言文字标准,另一方面可以为专门语料库中某种特定语言现象提供全量的计算和说明。关于字频的研究,学界积累了诸多成果。以古典文献为例,比较有代表性的论文如郭小武《古代汉语极高频字探索》[3],利用网络资源统计古汉语极高频字,分析其音、形、义及词性的分布特征,并附有六部文献的100个极高频字数据。又如覃勤《先秦古籍字频分布》[4],统计了27部先秦时期文献的字频情况,发现先秦古籍常用字高度集中,而低频字数量巨大,使用率极低,且大部分作品之间字频高度相关。除了代表性论文以外,还有字频研究的相关专著问世,较早的有李波《史记字频研究》[5],通过制定各项指标对《史记》用字进行了核心、高频、中频、低频、罕用分区和分类的全面考察。延续此路径展开研究的还有一系列其他论著和文章,涉及十三经、《汉书》《三国演义》等专门语料[6-8]。
语言词汇系统有基本词汇和一般词汇之分[9],而“高频”是构成基本词汇的重要条件,古典诗歌的语言系统也不例外。关于哪些文字常常被选入诗歌,古人在写作过程中早有体会。欧阳修《六一诗话》所载“许洞试僧”的诗坛轶事便是利用了字频思想来规范作诗[10]:
当时有进士许洞者,善为词章,俊逸之士也。因会诸诗僧分题,出一纸,约曰:“不得犯此一字。”其字乃山、水、风、云、竹、石、花、草、雪、霜、星、月、禽、鸟之类,于是诸僧皆阁笔。
这些字眼诗僧常用,一定程度上反映了其清幽隐逸之生活。其实,这并不仅限于诗僧群体,上述大部分字型用例在整个中国古典诗歌中均占有较大比重。谢思炜曾以《唐诗三百首》为样本人工厘定高频词分布情况,发现排名靠前的有很多与许洞所列之字重合[11]。倘若继续扩大样本,以《全唐诗》语料为基准,以字频统计为方法,那么唐诗整体的用字面貌便可以完全勾勒出来。
在古典诗歌领域,学界已有诸多立足于汉字字频来开展研究的成果。诗歌字频的统计至少有双重意义。一是可以利用字频信息考察诗歌的语言体式,如张景祥等[12]以《全唐诗》为语料,利用字频熵来考察唐诗语言的通俗性问题,给出了李白、白居易、王维、温庭筠等作家之间及各自作品内部的通俗性指数与量化关系。二是可以利用字频信息去分析背后的审美意象范畴,比较有代表性的如朱崇才[13]通过电子计算机检索系统统计得到《全宋词》中的前100个高频字,并以此为基础从两性文化视角来说明宋词的女性化倾向。龚岚[14]通过对比唐诗和宋词中的前20个高频字,发现唐诗和宋词具有大体一致的择字倾向,都重点关注人与自然的话题。围绕《全唐诗》的字频统计,刘明华[15]通过第三方公司开发的检索软件总结出唐代诗人最爱说的字是“不”,并对数字、山水、天象、季节等各类的前五个高频字进行了粗略描绘。综上,目前诗歌文献字频统计多集中于频率描写,而较少文体比较与诗史演变层面的讨论。本文尝试在此基础上,将字频分布、频秩结构与跨文体、跨朝代语料的比较结合起来,揭示唐诗的语汇特征,探讨它在我国古代诗史长河中所处的位置及发挥的作用。
2 唐诗的字频统计
2.1 统计数据与方法
唐诗的字频统计以中华书局繁体版《全唐诗》[16]为底本。《全唐诗》收录唐诗近5万首,总计约258万字。为跨朝代、跨文体比较研究,本文同样搜集整理了《全唐文》以及唐代以前的《先秦汉魏晋南北朝诗》、唐代以后的《全宋诗》《全元诗》数据进行联合考察。
关于简体字统计和繁体字统计哪个更合理,学界尚未形成共识。有学者采用简体统计“四书”情况[17],虽然可以一定程度上减少异体字带来的影响,同时也增加了义项辨识的困难。常见的如“云”与“雲”,若统一置为简体,诗歌中出现的自然物象与言说表达混为一谈,则基于简体的统计并不能反映真实的用语情况。当然,繁体字统计同样有其问题,如繁体缺乏统一标准,一字多码现象普遍。不过,允许异体并存的统计策略,在另一方面可以为语言文字学的历时考察提供真实样本的数据支撑。需要指出的是,由于现行的汉字体系尚未解决复杂的字际关系问题,现行的繁简转换方案与异体字整理表只能覆盖一部分字型,全覆盖的异文关联与转码规范需要国家古籍数字化工程的不断开拓与实践。有学者指出:“创建统一字符集和标准文本库将是继秦朝‘书同文’之后的全新规范,也是汉字系统继从刻画到书写,又到数码形态的再次重置”[18]。因此,本文以繁体版语料进行字频统计,是本着遵循古诗文原貌,揭示其历史特征的原则,也是在统一标准的新形态汉字体系构建出来之前的折中选择。
底本选定之后,首先对其进行语料预处理,采用正则表达式进行结构化清洗。清洗内容具体包括去除文本目录、诗题及诗注、作者及小传,仅保留诗歌正文部分。在正文中进一步去除标点符号,对有些诗歌正文存在标注不同异文的情况,如孟浩然“山暝闻(一作听)猿愁,沧江急夜流”,清除括号中异文,统一按原版本处理。
语料预处理之后,采用Python的Pandas库构建一套完整的字频统计分析流程。首先,从经过预处理的数据集中提取所有正文内容,通过字符串连接操作将其合并为统一的字符序列。随后,采用统计计数方法对序列中的每个独立字符进行出现次数统计,生成包含字型与频次的基础频率表。在初级统计基础上,进一步计算各项衍生指标:通过频次与总字符数的比值计算出相对频率(单位占比),以百分比形式表征每个字符在文本中的分布比重;采用累积求和算法计算累积覆盖率,该指标体现了前N个高频字符所能覆盖的文本比例,对分析文本的核心词汇构成具有重要意义。为增强统计分析的可解释性,本文还引入均频倍值指标,通过将每个字符的频次除以所有字符的平均频次,量化各个字符相对于整体平均水平的偏离程度。该指标能够直观区分高频常用字符与低频罕见字符。
2.2 统计结果与分析
一般情况下,汉语以单音节词为主,双音节词不占优势。这一点在唐诗中亦有体现。唐诗语言高度凝练,且讲究炼字,单字词所占比例较高。例如,蒋绍愚[19]在其著作中收录了唐诗用词89例,其中多字词仅20例,单字词占比接近78%。为了更加直观呈现唐诗高频字分布特征,本文采用Python的StyleCloud库,将《全唐诗》中按照频次由高到低排名的前1000字的字频结构化数据转化为视觉权重,通过配置视觉参数优化输出,生成可视化字云图,见图1。

图1 《全唐诗》字云图
从图1可知,“不”“人”“山”“无”“风”“一”“日”“云”“有”“何”诸字占据了整张图的较大比例,说明这些字在唐诗中较为常见,上文提及“许洞试僧”所列之字如“山”“风”“云”均在此列。限于篇幅,取降序排列前50位的字频进行展示,见表1。
表1 《全唐诗》前50位字频表


不难看出,上述常用字大部分可单独成词,且构词能力较强。“不”字出现最多,占整个语料库的1%。从排名第1的“不”字到排名第50的“青”字,累积覆盖率已接近20%,也就是说此50字已经覆盖了《全唐诗》20%的用字量,充分体现了语言运用的“省力原则”。
表1所示的前50高频字,是构筑唐诗意境的核心“字料”。这些字高度凝练地映射出唐诗中的三大核心主题:自然意象(山、花、风、水、月等)、时空感悟(时、年、夜、秋、春等)与个人情志(人、何、心、归、思等)。各主题相互交织,共同勾勒出唐诗意境。那些脍炙人口的经典诗句,往往并不依赖生僻奇字,而是由一组看似平常却高度凝练的常用字构成。如“春江潮水连海平,海上明月共潮生”“海日生残夜,江春入旧年”“空山新雨后,天气晚来秋”“君不见,黄河之水天上来”“露从今夜白,月是故乡明”“君问归期未有期,巴山夜雨涨秋池”等,其中反复组合出现的“江”“山”“月”“春”“天”“夜”“明”等字,均属于字频排序中的核心区间。这一现象表明,唐诗的经典化过程,在某种意义上亦是一个高频语汇不断被强化与再生产的过程,其结果是形成了一套兼具表达效率与审美指向的诗性语言资源。
另外,前50单字中多见同属一个语义场的系列词对,反映出唐诗常有的二元对立属性,如视觉感知的“日”“月”,行为动作的“归/来”“去”,哲学思辨的“无”“有”,方位存在的“上”“下”等。值得一提的是,表示季节的“春”和“秋”均出现在前50之列,经排检,唐诗大部分是将“春”“秋”作为实际的季节来写。为了加强对比,同时检索了“夏”和“冬”出现的频次和排名,发现“夏”频次为921,排名650位,“冬”频次为515,排名1020位。可以看出,唐代诗人爱写春、秋两季,且写“春”要多于写“秋”,写“夏”多于写“冬”。当然这里只是从字的频次考查,并未纳入写四季的其他借代手法,不过仍可根据这些信息大致看出唐诗季节书写的差异。
为整体把握唐诗用字的分布情况,本文对其字型按照字频高低划分区段。综合累积覆盖率和均频倍值,将唐诗字频区段划分为核心、高频、中频、低频、罕用五个层级。参照美国语言学家M.斯瓦迪士(Morris Swadesh)[20]提出的适用于各语言的核心词数量,从均频倍值由高到低排出唐诗的200个核心字,然后以均频倍值1来界分高频与中频,0.1界分中频与低频,0.01界分低频与罕用。表2展示了唐诗字频各分区的范围。
表2 唐诗字频分区表

可以发现极少数字的频率非常高,而大量字的频率非常低,其中1次用字就有1336例,字频排序呈长尾效应。美国语言学家G.K.齐普夫(George Kingsley Zipf)利用大量统计数据总结出描述词频分布的重要规律,后人称之为“齐普夫定律”(Zipf’s Law)。它描述了一种特殊的统计分布现象,即在自然语言中,一个单词的使用频率与其在频率表中的排名成反比。此定律被广泛应用在语言学、信息论以及社会科学等各种领域。唐诗字频排序同样满足齐普夫定律的分布特点。图2给出了唐诗的字频序列分布,用不同颜色标记了字区范围,且坐标系使用对数尺度呈现。

图2 唐诗字频序列分布图(双对数)
3 唐诗字汇的同质性与异质性分析
3.1 《全唐诗》与《全唐文》的字汇差异
字频能够反映文体特征。表1的字频信息既蕴含了不同文体的通用特征,也涵盖了诗歌的异质性特征。诗之所以为诗,从字频角度看其异质性,仅通过自身语料是很难明确的,而是需要纳入其他文体进行对比分析。鉴于此,本文以《全唐文》为例进行对比。《全唐文》是清代继《全唐诗》之后官修的一部唐代散文总集,共收录文章1.8万余篇,总计766.6万字。《全唐文》搜采浩博,与《全唐诗》时代相同而文体相异,比较适用于对比分析。
以中华书局版《全唐文》为底本,提取正文字型,进行字频统计与排序。最终得到排名前50位的高频字,依次是“之、以、不、于、而、其、有、人、为、者、无、也、天、大、所、一、下、则、子、中、公、可、臣、道、事、是、年、自、日、三、十、上、至、行、在、时、元、文、如、官、国、王、德、言、曰、州、书、明、得、今”。从中可以推知,《全唐文》凸显了政治社会官僚体制与形式礼节的话题。另外,大量的连接虚词如“之”“以”“于”“而”“也”等,体现出散文在文体形式上较为注重逻辑性和论述结构。
不同文体的共现高频字体现语言习惯和文化认知的统一。通过对比《全唐文》与《全唐诗》可以发现,二者前50高频字存在交集,共19例,如图3所示。这些字属古汉语基本字,作为历史文学叙事的触发字,其频繁使用反映了唐代诗人所强调的时空与社会秩序。
而高频字的差异,直观反映了“诗”“文”两种文体在题材焦点与表达方式上的根本分野。《全唐文》的独有高频字折射出唐代政治社会的等级秩序,反映在语言上正式严谨,强调逻辑与论证。而《全唐诗》强调的是自然意象与个人生活体验,选择的语汇更具感知形象,反映了唐代诗人对自然界的细腻观察和内心世界的深刻描绘。数据所揭示的独有高频字集,并非偶然,而是“诗缘情”与“文载道”不同功能导向在语言材料选择上的直接体现。《全唐诗》通过对高感知性意象词汇的偏好,确立了其区别于散文的、以营造意境与抒发情志为核心的语体身份。

图3 《全唐文》与《全唐诗》前50高频字韦恩图
3.2 《全唐诗》与前后朝代诗歌的字频比较
一代有一代之诗,诗歌发展是一个前后接续的动态演变过程。元代方回在其《瀛奎律髓》中有诗评曰[21]:
自齐、梁、陈、隋以来,专于风、花、雪、月,草、木、禽、鱼,组织绘画,无一句雅淡,至唐犹未尽革。而晚唐诗料,于琴、棋、僧、鹤、茶、酒、竹、石等物,无一篇不犯。
方回指出唐代诗人写诗运用较频繁的语言材料承继自前朝,而随着观察世界的改变,唐诗自身也较频繁引入了新的实词元素。“真正的诗歌史是语言的变化史,诗歌正是从这种不断变化的语言中产生的”[22]。唐诗作为历代诗歌中的典范,继承前代诗歌传统的同时,也存在不同于各时代的用语特质。分析不同时代诗歌的字频差异,可以从历时的角度把握唐诗的用字特点及诗史地位。
搜集整理得到唐代以前的《先秦汉魏晋南北朝诗》、唐代以后的《全宋诗》和《全元诗》三种大型诗歌总集作为跨朝代的对比语料,分别对其进行结构化处理和统计。《先秦汉魏晋南北朝诗》共计46.9万字例,含0.62万字型。《全宋诗》共计1315.2万字例,含1万字型。《全元诗》共计159.2万字例,含0.76万字型。语料预处理策略与《全唐诗》一致,基于各文本正文的字例数量统计得到每个字型的出现频次及单位占比,表3展示了不同诗歌总集排序前20位的高频字。
表3 不同诗歌总集前20位字频表


表3中有三点值得关注。第一,不同朝代的诗集在字频分布上具有较高同质性,排名第1位的字都是“不”,该字的单位占比都超过1%,且各诗集高频字在整体上重合度较高。有学者发现唐代诗人最爱说的字是“不”[15]。通过与《全唐文》对比发现,“不”实际上是汉语基本词,在唐文中排名第3位,使用也非常广泛。从历时角度来看,“不”字在诗歌创作中没有显著时代差异,不仅唐代诗人爱写,魏晋南北朝乃至宋元等历代诗人都爱写,并非唐代诗人所偏爱。第二,各诗集中有些具体高频字的相对排名有异,从相对排序与单位占比可窥探出后世诗歌对唐诗的接受程度。如“人”字的单位占比从《先秦汉魏晋南北朝诗》的0.55%上升到了《全唐诗》的0.81%,且这一占比在《全宋诗》与《全元诗》中得到稳定延续。再如“山”字之意象在《先秦汉魏晋南北朝诗》中排名相对靠后,单位占比0.38%,在《全唐诗》中则提升到了第3位,占比0.62%,而后在《全宋诗》和《全元诗》中均得到稳定保持。第三,从独用字和更高频用字,可窥探唐诗用字的偏重意象。例如,“花”“水”“月”在前20位的高频字中为《全唐诗》所独有,而“云”的相对字频比其他诗集都高。从整个排名来看,《全唐诗》中比其他诗集相对字频都要高的字型共计315个,其中覆盖率累积至50%的共有100个,形成唐诗特色用字,见表4。这些用例一定程度上反映了唐诗区别于其他时期诗集的独特性。
表4 唐诗特色用字表

3.3 不同诗文集字频序列的相关性分析
不同朝代诗文总集字频序列的整体差异能够揭示诗歌的动态演变。上文通过列举的方式指出唐诗相对于其他朝代诗文总集的局部特点,并初步发现不同诗歌总集在整体的字频排序上存在同质性。若要更准确地揭示它们具体在多大程度上相同或相异,就需要借助数学统计的手段进行分析。当然,文学现象背后成因复杂,仅通过特定维度的数学模拟和统计检验等手段很难直接给出全面而确凿的因果推论关系,只能通过计算的方式揭示其相关性而不是因果性,在一定程度上验证我们对某些文学问题的感性认识。
以色列学者S.哈夫林(Shlomo Havlin)曾提出一种能够量化两组元素Zipf序列分布差异的距离公式[23],国内有学者利用此方法对不同文学体裁的字频演变规律进行了验证[24]。本文发现,尽管此方法能够计算出字频差异距离,但不同集合大小对计算结果的影响相对较大,且不能提供不同文本集用字相异或相似的标准化度量指标。由于我们关注的不是距离而是不同集合在用字频次排序上的相似性,因此可采用斯皮尔曼等级相关系数(Spearman’s rank correlation coefficient)进行测定,计算方法如公式(1)所示。

(1)式中,n表示数据点的数量,这里指诗歌字频两个序列包含相同字的数量;di是数据点的排名差,rs是字频排序的差值。这里需要保证同一语料库中字频相同的字排序一致,是等级相关系数的值,取值范围在-1到1之间,值越接近于1,两组数据正相关性就越强,反之负相关性就越强。
首先,提取四种诗歌总集均频倍值大于1的共现字型排名数据。其次,将隶属不同文体的总集与《全唐文》进行对照。再次,调用Python的scipy.stats模块中的spearmanr函数,计算斯皮尔曼等级相关系数rs及显著性指标p值。最后,得到各组数据p值均小于显著性水平0.01,说明字频序列之间存在统计上的显著相关性。相关系数计算结果如表5所示。
表5 不同诗文总集字频序列的相关系数

表5呈现了各诗文总集字频序列两两之间的斯皮尔曼相关系数计算矩阵。可以发现,该矩阵呈现出高度显著的层级关联性。朝代距离越近的诗集,其相关系数越高,例如:《全宋诗》与《全元诗》之间相关系数高达0.96,呈现出近乎完全一致的字频分布模式;《全唐诗》与《全宋诗》《全元诗》之间相关系数分别为0.88和0.87,亦表现出极强的相关性。《先秦汉魏晋南北朝诗》与后续各诗集的相关性保持在0.72至0.75之间,体现了诗歌传统在字频选择上的延续与变革。与之相对,《全唐文》与其他诗集的相关系数则明显偏低(0.44至0.54之间),反映出文体(诗与文)差异对于字频分布的系统性影响。上述相关系数分布表明,字频结构既受朝代因素影响,也显著受文体因素的制约。
将诗歌纳入散文文体进行对照,一是为了凸显诗与文的本质差异,二是有意探究不同时段诗与文的交汇融通情况。观察《全唐文》与各诗集的对比结果,发现相对于诗与诗之间的相似性,诗与文整体的相关度普遍较低,这本在意料之内。不过从表5各组具体数值,可以发现一个有趣的现象:相对于其他朝代诗歌,《全唐文》与《全唐诗》的相关性竟是最低的(0.44),这一现象为进一步探讨诗体演变提供了重要切入点。下面分别从诗与文、诗与诗两个方面展开论述。
诗与文的交融是引发诗歌从古体到近体、从近体到白话之变的重要导索。表5反映了中国古典诗歌与散文之间复杂的相互作用和诗歌语言形式的嬗变,在一定程度上可反映“以文为诗”的沿革脉络。这里所说的“以文为诗”不单指宋人对韩愈诗歌特质的总结和评价,而是关涉诗歌特质及其与古文文体的关系。
中国早期的古典诗歌中本就存在诸多散文因素,从先秦至南北朝时期的诗歌在整体上与散文字频序列相关度最高。先秦两汉魏晋的古诗与散文的界限并不完全清晰,在用字、语序、节奏等多种语言形式和叙述方式上有较多共通之处,如“在”“于”“之”“我”等介词、连词、人称代词等在古诗中较为常见,具有浓厚的散文色彩,在频度排序上与散文较为接近。
从先秦至唐代的诗歌在语言发展上更多地表现出一种去散文化的趋势,一直到唐代的近体诗定型,导致诗与文的彻底分离,这可以从唐诗与唐文相关系数的表现看出。尽管《全唐文》与《全唐诗》同系唐代作品,二者在字频序列相关度上却较其他朝代诗歌总集最低,这说明唐诗实际确立了不同于散文的诗性语言的典型特征。尽管唐中期出现了韩愈“以文为诗”的异质风格,但在整体层面上并没有得到显著体现。正如笔者另一项研究发现,相较于其他朝代,唐诗虚字使用密度是最低的[25],这也意味着唐诗散文化书写程度最低,也是最具“诗性”的。
到了宋代,诗人强化了对散文表达方式的借鉴,使得诗歌与散文在相关性上得到提升。诗与文的重新靠拢一定程度上揭示了宋元时期诗人对“以文为诗”复古理念的接受与创变实践。北宋时期古文运动重兴,诗风发生新变,韩愈诗特质被众多诗论家关注、推广和仿效,经过苏轼、黄庭坚的承继与发展,“以文为诗”“以议论为诗”逐渐盛行北宋诗坛而开一代诗风。典型诗例如“不识庐山真面目,只缘身在此山中”“人生到处知何似,应似飞鸿踏雪泥”“想得读书头已白,隔溪猿哭瘴溪藤”“纸上得来终觉浅,绝知此事要躬行”等等,虚字频出,意象稀疏,句法顺畅,语义逻辑连贯,遣词造句各方面与唐诗迥异。宋代严羽在其《沧浪诗话》中对宋诗的这种散文化倾向进行过讥评[26]:
夫诗有别材,非关书也;诗有别趣,非关理也。然非多读书,多穷理,则不能极其至。所谓不涉理路,不落言筌者,上也。诗者,吟咏情性也。盛唐诸人惟在兴趣,……言有尽而意无穷。近代诸公乃作奇特解会,遂以文字为诗,以才学为诗,以议论为诗。夫岂不工,终非古人之诗也。盖于一唱三叹之音,有所歉焉。
严羽认为诗乃吟咏情性的艺术,不能因理而废情。与此观点类似的人还有同时期的诗坛领袖刘克庄,其在《竹溪诗序》有言[27]:
唐文人皆能诗,柳尤高,韩尚非本色。迨本朝,则文人多诗人少。三百年间,虽人各有集,集各有诗,诗各自为体,或尚理致,或负材力,或逞辨博。少者千篇,多至万首,要皆经义策论之有韵者尔,非诗也。
刘克庄认为宋人能文不能诗,诗之存理而弃趣实则与文无异。纵观对“以文为诗”的历史评价可谓功过参半,它一方面模糊了诗文的功能界限,另一方面运用散文式的虚词、句式、章法等语言手法增强了诗歌的艺术表现力。
到了金元时期,诗歌的这种散文化倾向仍在持续。明代胡应麟在品评赵孟頫、虞集等诗人的作品时提到元诗“大概多模往局,少创新规。视宋人藻绘有余,古澹不足”[28]。由此可见,元诗承继前朝较多而创变较少。值得注意的是,尽管元诗式微,但其创作中同样存在“宗唐得古”的复古主张,讲求学唐而不袭宋,尤其是元代中期四大家格外推崇盛唐之音。从唐到宋、从宋到元这种复古流变的螺旋式发展看似较符合文学发展的理想模型,不过元诗论评家的这一主张似乎并没有实际奏效。在比较唐诗与元诗、宋诗与元诗的字频差异时可以看到,元诗与宋诗其实是非常接近的。例如:元好问“纵横正有凌云笔,俯仰随人亦可怜”完全是散文议论句,这种立论式的写法与王安石“不畏浮云遮望眼”的逻辑如出一辙;王冕“不要人夸好颜色,只留清气满乾坤”采用直白的口语叙述来借物讲理,是典型的宋调。当跳出小范围典型样本的经验建构,在元代数十万作品的更大窗口范围内进行观察时,才能相对客观地把握诗歌发展的原始生态。
上文比较了诗与文的字频序列相关性,下面观察表5中不同诗歌总集字频序列相关度。可以发现,尽管不同时期的诗歌在风格和主题上有所区别,但诗化语言特征使得它们在用字上保持了一定程度的连续性和相似性,体现了中国古典诗歌的稳定基底,同时数据间的微妙差异也反映出诗歌的动态更迭与演进变化。
具体而言,中国古代不同时期诗歌之间的相关性表现出如下特点。第一,唐代以前诗歌相对独立,各时期诗歌黏合度不高,唐诗因与之时期接近,字频序列也相对较近,但也有明显不同。第二,唐及以后诗歌的字频序列之间表现出强相关(相关系数大于0.8),一定程度反映出唐诗对后世诗歌创作的影响。第三,宋元诗歌字频序列极为相似,两者相关系数达0.96,且分别与唐及唐前诗歌的比较结果高度一致。前面提到元诗主张宗唐而避宋,而实际表现却与宋诗亦步亦趋,这一现象比较耐人寻味。这一结果似乎揭示出理论主张与语言实践之间相背离的复杂关系。元代诗坛虽有“宗唐得古”的鲜明口号,但数据表明,其整体用字习惯更近乎宋诗。元代文人(如元好问、虞集等)虽有“复古”倾向,在诗歌题材上或许追摹唐诗的兴象风神,但在日常化、理趣化的语言表达上,仍不免延续宋诗脉络。
需要说明的是,有关“以文为诗”或“宗唐得古”的诗学命题,其历史背景、具体意涵及表现层次较为复杂,本文仅从用字习惯的宏观相似性这一特定角度,采用字频序列相关性分析揭示了其演变趋势的某一侧面。这为我们理解古典诗歌在不同历史时期的风格变迁提供了一种可量化的解读视角,但并非对这些命题的全面定论。
4 结 语
本文通过对唐诗字频的统计分析,从数字人文视角揭示了唐诗语汇的基本特征,为理解唐诗的语言特性及其在中国诗歌史上的地位提供了新的实证依据。研究发现,唐诗内部字频分布遵循齐普夫定律,呈现出规律性的层级结构。通过将唐诗与唐文进行文体对比,勾勒出“诗”与“文”的字频差异与文体特征。唐文凸显政治社会官僚体制与形式礼节,大量使用连接虚词体现逻辑性和论述结构,而唐诗则强调自然意象与个人生活体验,语汇更具感知形象,反映了唐代诗人对自然界的细腻观察和内心世界的深刻描绘。通过与其他朝代诗歌比较,发现唐诗用字呈现出明显的继承与革新。一方面,唐诗与不同朝代诗歌在字频分布上保持一定的同质性;另一方面,“花”“水”“月”等字的相对高频使用,彰显了唐诗区别于其他朝代诗歌的独特性。另外,唐诗与宋、元诗歌字频序列表现出强相关,反映了唐诗对后世诗歌创作影响深远;而宋、元诗歌字频序列相关性最强,揭示了元诗对宋诗亦步亦趋的语言现象。
研究还通过诗文字频序列相关性的变化趋势,勾勒出中国古典诗歌与散文文体之间相互作用和诗歌语言形式的嬗变过程,为理解“以文为诗”这一重要诗学概念提供了语言层面的实证支持,也为把握中国古典诗歌发展脉络提供了新的视角。然而,本文字频分析虽关涉经典命题,但角度相对单一,字词组合、句法结构、主题内容等涉及较少。未来研究可结合语义向量、句法网络、主题建模等,引入更细分的朝代、流派或个体诗人文本展开综合性研究。
【注释】
① “对等原则”是罗曼·雅各布森(Roman Jakobson)在诗歌分析中提出的一个概念。诗歌的核心特征在于某种形式的对等,这种对等可能在不同的层面上呈现,如声音、词汇、语法结构、意义等。在诗歌中,这些元素通过重复、对照、对偶或对称等方式产生了一种对等关系,从而创造出音韵、节奏或视觉效果,赋予诗歌独特的美学特征。
【参考文献】
[1]刘石,尹小林. 以数字映射古代文学经典[N]. 光明日报,2022-03-23(11).
[2]冯志伟. 现代汉字和计算机[M]. 北京:北京大学出版社,1989:109.
[3]郭小武. 古代汉语极高频字探索[J]. 语言研究,2001(3):69-84.
[4]覃勤. 先秦古籍字频分析[J]. 语言研究,2005(4):112-116.
[5]李波. 史记字频研究[M]. 北京:商务印书馆,2006:38-292.
[6]海柳文. 十三经字频研究[M]. 北京:高等教育出版社,2011:13-99.
[7]海柳文. 《汉书》字频研究[M]. 新北市:花木兰文化出版社,2013:17-75.
[8]桑哲. 《三国演义》字频研究[D]. 曲阜:曲阜师范大学,2013:131-137.
[9]王德春. 语言学概论[M]. 上海:上海外语教育出版社,1998:132.
[10]欧阳修. 六一诗话[M]//何文焕. 历代诗话. 北京:中华书局,2004:266.
[11]谢思炜. 汉语诗歌词语管窥:以《唐诗三百首》为样本[J]. 清华大学学报(哲学社会科学版),2015,30(3):76-84.
[12]张景祥,安培壮,苏娜. 唐诗字频熵分析与通俗性定级[J]. 科技资讯,2009(6):241-243.
[13]朱崇才. 从高频字看宋词的女性化倾向[J]. 中国韵文学刊,1993(00):70-76.
[14]龚岚. 试论唐诗宋词中的高频字[J]. 江西财经大学学报,2009(1):104-108.
[15]刘明华. 唐人最爱说“不”:《全唐诗》软件字频检索如是说[J]. 中国典籍与文化,1999(4):29-30.
[16]彭定求. 全唐诗[M]. 北京:中华书局,1960:1-10222.
[17]尹小林. “四书”字频统计报告[J]. 数字人文,2022(3):126-139.
[18]李飞跃. 书同文字与再造书契:论古籍数字化时代的字符统一与文本规范[J]. 北京师范大学学报(社会科学版),2023(5):127-141.
[19]蒋绍愚. 唐诗语言研究[M]. 北京:语文出版社,2008:258.
[20]Swadesh M. Lexico-statistic dating of prehistoric ethnic contacts: with special reference to North American Indians and Eskimos[J]. Proceedings of the American Philosophical Society, 1952, 96(4): 452-463.
[21]方回. 瀛奎律髓汇评[M]. 李庆甲,集评校点. 上海:上海古籍出版社,1986:1738.
[22]贝特森. 英诗与英语[M].刘象愚,等,译//韦勒克,沃伦. 文学理论. 南京:江苏教育出版社,2005:195.
[23]Havlin S. The distance between Zipf plots[J]. Physica A: Statistical Mechanics and its Applications, 1995, 216(1-2): 148-150.
[24]刘宇凡,郭金忠,陈清华. 唐代以来汉语文学作品中的字频演变[J]. 中文信息学报,2011,25(3):93-97.
[25]程宁. 唐诗语体的历时演变:以虚字使用密度为中心[J]. 山东社会科学,2025(11):104-114,124.
[26]严羽. 沧浪诗话[M]//何文焕. 历代诗话. 北京:中华书局,2004:686.
[27]刘克庄. 刘克庄集笺校[M]. 辛更儒,校注. 北京:中华书局,2011:3996.
[28]胡应麟. 诗薮[M]. 上海:上海古籍出版社,1979:230.