❌

普通视图

Received before yesterday12 - 南京师大比特人文公众号

让音标不再难输入| 随园国际音标输入法(SYIME)测试版上线

2026年10月2日 00:00

潘莹雨霏 2026-10-02 00:00 江苏

随园国际音标输入法网页版,让音标不再难打。欢迎试用,后台反馈

SYIME

随园国际音标输入法

语言学概论、方言学、现代汉语、语音课、普通话课,老师最怕教音标,学生最怕学音标,弯弯绕绕的文字,奇奇怪怪的发音,加上电脑上很难输入,导致重要的基础知识难以掌握。

Unicode字符集早已支持了国际音标的符号,但是好用的国际音标输入法难寻,为了解决这个难题,南京师范大学语言大数据与计算人文研究中心推出网页版国际音标输入法,方便师生学习和使用国际音标。

特色功能:

1.相近读音直接敲击字母,比如输入s,可以获得相应的多个音标候选。

2根据舌位图\辅音表点击输入,并给出wiki上的开源读音。

欢迎在电脑端试用!

随园国际音标输入法 Suiyuan International Phonetic Alphabet Input Method(SYIME)v3.2

  • 符号数据:Unicode Character Database + 官方 IPA 简表(2005/2020 修订),共 564 个符号

  • 读音数据:Wikimedia Commons 经典 IPA 录音(P. Ladefoged 等,公有领域 / CC)

  • 音标字体:Doulos SIL 7.0(SIL Open Font License 1.1)

  • 获取方式:https://www.dhbase.com/unicode/SYIMEv3.2/

那个打不出来的 ɿ,

现在点一下就有了

方言调查记音,记到「四」「是」「市」这批字,韵母要写成舌尖元音——前一个标作 ɿ,后一个标作 ʅ。这两个符号,汉语方学界沿用了近百年,一般记音材料和调查报告里几乎处处都能见到。

可在电脑上,它们至今打不出来。拼音打不出,五笔打不出,Word 的「插入—符号」里翻上十分钟也不见得找得到——因为它们本来就在官方国际音标简表的主区之外。于是不少老师最后的选择,还是手写。

这不是孤例。凡是跟国际音标打交道的人都尝过类似的滋味:语音学中天天见的 ə、ʃ、ŋ 在标准键盘上没有对应键,只能用「插入—符号」一个一个捡;好不容易凑齐一句,粘到对方软件里缺字体,发出去是一串方框;跑到野外做调查,想用手机当场把一批音敲下来发给同行,多数方案却只对电脑友好。

字符其实一张都不缺,Unicode 里早就都有了。真正缺的,是一个顺手、离线、又不挑设备的入口。

南京师范大学语言大数据与计算人文研究中心出品的随园国际音标输入法(SYIME),做的就是这件事。它的思路很朴素:把官方国际音标简表,变成一张可以点的图。

打开就是那张表

页面主体是国际音标简表的三大部分——元音舌位图、辅音简表与超音段符号。

元音图按官方的舌位四边形绘制,横轴从前往后、纵轴从闭到开,按钮所在的位置就是发音的位置;成对出现的元音左为不圆唇、右为圆唇,比如 i 与 y。辅音表是发音部位乘发音方法的行列,同一格成对时左边清、右边浊,下方另附搭嘴音、内爆音这类非肺部辅音。超音段部分则收了重音、音长、韵律分界,以及方言调查几乎天天要用的五度标调 ˥ ˦ ˧ ˨ ˩ 和竖式调标。

熟悉这张表的人不需要重新认行列,眼到手到:点哪个符号,它就插进页面顶部的输出框。输出框与检索框悬浮常驻,往下翻到辅音表、声调表时仍能随时接着输入、随时复制。

图上看不见的,交给检索

简表本体是一百多个基本符号加几十个附加符号,而这套工具把图表之外的扩展字母也一并收了进来,合计 564 个符号,全部可查。查找方式有三种:记音用的助记键位(输入 sh 得到 ʃ)、中文描述(输入「清龈后擦音」),或者直接给 Unicode 码点(如 0283)。汉语方言记音常用的舌尖元音 ɿ ʅ 也在其中,点一下即出。

附加符号遵循「先基字、后附加」的顺序:先点一个 a,再点鼻化符,得到的就是 ã;送气、清化、音节化同此。这也正是手写时的习惯,不必重新适应。

它还有几处贴着使用场景做的安排:91 个符号在点击时会播放真人录音(涵盖全部元音与多数辅音,取自 Wikimedia Commons 的经典 IPA 录音),备课、自查、带学生认音标都用得上;白天与黑夜两种模式,夜间记音不至于刺眼;图表、检索与读音全部内置,完全不联网也能工作。

不只是网页版

除双击即开的网页版外,还打包了安卓离线 App,不联网、不注册,装完就能用,适合在田野现场边记边发。电脑端另附 Windows 全局热字符串脚本,装好后在任何输入框里先打前缀 ipa 再打键位、以空格收尾,即可直接换成音标——ipash 加空格出 ʃ,ipaNG 加空格出 ŋ。写论文时手不必离开键盘,也不会干扰正常的英文输入。

如需安卓版,请关注后私信小编。

谁能用得上它

  • 方言调查与语言保护工程的记音工作;

  • 语音学、音系学课程的课堂演示与作业;

  • 写论文、做 PPT 时需要插音标的每一个人;

  • 以及所有对"声音怎么写成字"感到好奇的人。

用之前要知道的

输出区内置了音标字体,显示一定正常;粘贴到别处若出现方框,是对方软件缺少音标字体所致,在 Word 或 WPS 里把该段字体设为 Doulos SIL 即可,微信、QQ 一般可直接显示。此外,输入法只负责把符号交给你,某一个音该怎么写,仍然是研究者自己的判断。

-写在最后-

回到开头那两个符号。ɿ 和 ʅ 在 Unicode 里已经躺了很多年——缺的从来不是字符,而是一个手指够得着的入口。

工具是小的,问题是真的。我们希望它能把「打一个音标」这件事,从翻表十分钟,改成一个点击。

Research Center for Language Big Data & Computational Humanities, Nanjing Normal University

研发人员:潘莹 王璐 李雨霏  冯敏萱 李斌  

版权所有,欢迎转发试用!

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

前沿 | 第十届全国语言学博士论坛(免会务费)

2026年10月2日 00:00

2026-10-02 00:00 江苏

第十届全国语言学博士论坛10月31日举办,面向语言学博士生征集论文提要。

转载自”语言服务“

第十届全国语言学博士论坛第2号通知

2026年,清华大学人文学院中文系将迎来建系百年华诞。百年文脉,薪火相传;学术底蕴,赓续绵延。为构建中华民族自主的学术知识体系,推动中国语言学研究创新发展,促进青年学者间的学术交流、助力青年学者成长,清华大学人文学院中文系与语言学研究中心于2016年创办全国“语言学博士论坛”,论坛创办至今已成功举办九届,广受学界好评。

站在新的历史起点,第十届全国“语言学博士论坛”定于2026年10月31日在河北石家庄举办。本届论坛由清华大学人文学院中文系、语言学研究中心主办,河北师范大学文学院、国家语言文字推广基地(河北师范大学)及河北省语言战略研究中心联合承办。论坛邀请了李国英(北京师范大学)、赵世举(武汉大学)、邢向东(陕西师范大学)、刘颖(清华大学)、郝美玲(北京外国语大学)、董正存(中国人民大学)、李冬鸽(河北师范大学)等专家学者进行主题报告。期待国内外在读语言学博士生投稿参会,共襄学术盛举。

一、论坛议题

(一)传统语言学论题(文字、音韵、训诂研究);

(二)现代语言学论题(语音、词汇、语法、语义、语用研究);

(三)普通语言学论题(语言理论及其他);

(四)方言与民族语言研究;

(五)国际中文教育与二语习得研究;

(六)自然语言处理与人工智能研究;

(七)语言学研究其他论题。

二、论坛形式

论坛设专家主题报告与博士生分组报告两个环节。其中,博士生分组报告安排专家现场点评。

三、报名方式

请有意参加论坛的博士生在2026年10月10日24:00前填写参会回执(请将论文的主要内容填在“论文提要”一栏),发送至会务组邮箱。邮件主题与参会回执的命名格式为“【博士论坛】+姓名+学校+专业”。会务组将组织专家评审遴选,并于2026年10月18日24:00前通知录用结果。

四、重要时间节点

投稿截止时间:2026年10月10日24:00前

入选邀请时间:2026年10月18日24:00前

论坛时间:2026年10月31日

五、论文提要说明

(一)字数:论文提要应在2000字左右;

(二)字体及字号:中文(宋体,小四号)、英文(Times New Roman, 12号)。

六、相关说明

论坛不收会务费,交通住宿费用自理。

七、论坛秘书处

(一)会务组邮箱:tsinghuayuyanxue@163.com

(二)联系人:第十届全国语言学博士论坛会务组 王曼卿

第十届全国语言学博士论坛会务组

2026年9月9日

请扫码下载参会回执(文件:《清华大学第十届语言学博士论坛参会回执》.docx)。

图片

或复制以下百度网盘链接至浏览器下载(提取码:2uxy):

https://pan.baidu.com/s/1L6bGmKMk5pegh2u637O_1Q?pwd=2uxy

本文来源:THU中文系

语言服务

22万+语言学人已关注

ID:Language-service

投稿邮箱:yuyanfuwu@yeah.net

投稿交流、商务合作、著作出版

请联系语服君

微信号:yuyanfuwu2023

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

专题征稿|Nature唯一人文社科期刊

2026年10月1日 00:00

心得君 2026-10-01 00:00 江西

分享一篇文章

语言学心得: 专题征稿|Nature唯一人文社科期刊

欢迎投稿!

1 期刊信息

期刊名称

Humanities & Social Sciences Communications

《人文社科通讯》

SSCI一区,2025 IF:3.6,排名:1/411、2/267

期刊信息

《人文社科通讯》(Humanities & Social Sciences Communications)是一本完全开放获取的期刊,刊载人文学科、社会科学及行为科学所有领域的学术研究成果。我们鼓励投稿来自具体学科内部或跨学科研究产生的成果。我们的目标是成为本刊所涵盖领域及其交叉领域中,开放获取研究的权威性同行评审平台。该期刊由Springer Nature出版,最初以 Palgrave Communications(ISSN 2662-9992)为名创刊,并以此名称运营至2020年6月16日。涵盖人文与社会科学所有领域的开放获取期刊;刊载论文、综述、评论以及客座编辑的主题系列;开放获取模式为您的成果提供高可见度。

2 专题和征稿信息

专题名称

手语:习得、应用与传承

Sign Languages: acquisition, application and transmission

专题介绍

手语是丰富、复杂且动态的交际系统,挑战着人们对语言、认知和文化的传统理解。它们在全世界聋人社群中居于核心地位,但其习得、应用与传承又广泛涉及更广泛的社会、教育和技术语境。

本专题集旨在将手语作为语言、文化和社会现象加以探讨。我们诚邀从人文与社会科学跨学科视角审视手语的研究成果,涵盖语言学、人类学、心理学(非临床)、教育学、社会学、文化研究、媒体研究及相关领域。感兴趣的主题包括(但不限于):

  • 习得与教育:手语作为第一语言和第二语言的习得;儿童与成人的发展轨迹;双语与多模态交际。

  • 应用:手语在教育、口译、媒体和数字平台中的应用;政策与无障碍获取;手语与技术(如人工智能、虚拟化身、翻译工具)。

  • 传承:聋人社群内的代际传递;文化实践与保护;机构和技术在维持手语存续中的作用。

  • 翻译与口译:手语之间的语言接触;手语与口语之间的跨语码实践;从手语到口语/书面语的翻译与口译。

  • 身份与社群:手语作为文化认同的标志;与种族、性别和残障研究的交叉议题。

  • 艺术、表征与媒体:手语与艺术实践(包括手语诗歌);手语在文学、电影和大众文化中的呈现;表征与可见性的伦理问题。

  • 历史与比较视角:手语的演变;跨文化与跨语言研究;濒危手语及其振兴努力。

  • 政策与倡导:手语的法律承认;权利、包容与社会正义。

3 投稿信息

投稿指南

投稿截止日期:2026年10月9日

4 主编信息 

主编信息

Felipe Barbosa, PhD University of São Paulo, Brazil

Claudia S. Bianchini, PhD University of Poitiers, France

Diana-Margarita Cordova-Esparza, PhD Autonomous University of Queretaro, Mexico

Maria Tagarelli De Monte, PhD Università degli Studi Internazionali di Roma, Italy

Christian Rathmann, PhD Humboldt-Universität zu Berlin, Germany

(以上为小编翻译,仅供参考。)

本文来源:HSSC

点击文末“阅读原文”可跳转官网

课程推荐

欢迎加入

“语言学心得交流分享群”

“语言学考博/申博交流群”

请添加“心得君”入群

请务必备注“学校/单位+专业/研究方向“

今日小编:心得君

审     核:心得君

转载&合作请联系

"心得君"

微信:xindejun_yyxxd

点击“阅读原文”可跳转官网

阅读原文

跳转微信打开

985高校:新增“语言学”工学学位!

2026年10月1日 00:00

2026-10-01 00:00 江西

华科大拟申报四个本科新专业,含目录外工学专业语言科学与技术。

转载自“语言学心得”

近日,华中科技大学本科生院公示学校2026年拟申请增设新专业情况。

公示信息显示:根据《教育部高等教育司关于开展2026年度普通高等学校本科专业设置工作的通知》(教高司函〔2026〕7号)文件要求,本科生院组织开展了我校2026年新专业申报相关工作,经校内审议及学校决策会议审定,2026年我校拟申请增设“具身智能”“脑机科学与技术”“语言科学与技术”“医疗器械与装备工程”四个新专业。

根据申报材料,“语言科学与技术”为目录外新专业,所属学科门类为工学,专业类为交叉工程类,学位授予门类为工学,修业年限四年。

培养目标显示,该专业旨在培育拥有扎实跨学科知识储备、前沿交叉思维、突出实践创新能力与国际化视野的高素质人才,使其能够立足语言工程前沿领域攻克复杂技术难题,助力相关领域科技创新突破,成为驱动行业发展、引领科技与产业变革的领军创新人才。

语言服务强国!

欢迎转发扩散!

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

月寄相思,星传祝福:哈工大冯骁骋教授团队共同打造基于大语言模型的在轨卫星数字人智能体

2026年9月30日 00:00

2026-09-30 00:00 江苏

哈工大冯骁骋团队在轨卫星数字人智能体成功运行,突破多项航天智能交互技术。

转载自“赛尔实验室”

中秋月圆,星河传情。近日,哈尔滨工业大学计算学部社会计算与交互机器人研究中心冯骁骋教授团队自研的在轨卫星数字人智能体,成功搭载八一04星“哈尔滨号”完成在轨稳定运行,并实现基于自然语言的交互的中秋解意。此次在轨可视化交互成果,以卫星舱内虚拟航天员数字人为呈现载体,让大模型航天在轨应用走出技术壁垒,以鲜活、亲切、直观的形式走进大众视野,开启了卫星智能交互的全新范式。

此次太空中秋问候的背后,是一套完全自主研发、深度适配航天极端场景的在轨智能体体系框架。该框架打通航天端侧专属大模型、卫星真实在轨运行数据与数字人交互链路,成功突破太空低算力、低功耗、强干扰环境下的复杂多模态交互技术难题。团队创新性将航天领域专属大模型与卫星全维度运行数据深度融合,让单一在轨智能体集成专业知识问答、卫星状态智能解读、在轨故障辅助诊断、自然语言交互等关键能力,大幅提升卫星在轨自主感知、决策与交互智能化水平。

关键技术一:“风筝”系列大模型筑牢航天智能底座

航天领域专属大模型是在轨数字人智能体的能力基础与交互支撑。冯骁骋教授团队深耕航天垂直大模型研发,于2024年推出国内首批中文航天领域大模型“风筝1.0”。该模型依托23万条高质量航天专业数据完成多阶段专项后训练,具备扎实的航天领域知识储备和精准的用户指令理解能力,航天知识问答准确率稳居行业领先水平。

2025年,团队迭代发布“风筝2.0”模型,突破单一语言壁垒,融合数十万条高质量英文航天数据,同时覆盖卫星姿态轨道控制、星载计算机、通信、推进系统、电源、机械结构等8大类20余小类核心构件的1万余条专业数据,实现跨语言航天知识泛化能力升级,问答精准度、场景适配度、细粒度内容覆盖能力实现全方位跃升。

此次升空的在轨数字人智能体,搭载全新风筝3.0端侧专用模型,可在太空低算力、极端工况下精准解析航天专业术语、研判卫星在轨运行数据,为星地通信提供自然语言智能交互新途径。

关键技术二:大模型协同驱动的卫星在轨智能故障诊断

卫星在轨故障诊断是保障航天任务安全、提升卫星在轨寿命的核心关键,也是航天智能技术的重难点问题。针对传统卫星故障排查效率低、智能化不足、依赖人工经验的痛点,团队创新构建确定性异常检测与大模型协同分析的全新技术体系,搭建起“遥测解析—异常事实提取—故障知识检索—智能辅助诊断”的全流程处置链路。

该技术体系可通过前端协议自动解析卫星遥测数据,结合阈值判定、状态匹配、冗余一致性校验等多重规则精准捕捉异常点位,完整留存故障触发位置、实测数据、帧号等核心溯源信息。依托航天大模型的专业知识能力,系统可结合异常点位、所属分系统、在轨运行工况,智能检索匹配故障预案与历史处置案例,自主研判故障成因、梳理佐证依据、输出标准化处置建议。同时,针对复杂疑难故障,创新引入迭代式检索增强机制,通过动态补充查询条件、精准筛选适配知识,提升诊断精度;面对证据不足、信息冲突的特殊场景,可主动提示人工复核,形成“智能研判+人工兜底”的双重保障模式,大幅提升在轨故障处置的安全性与高效性,实现可信交互。

展望未来:打造可自主进化的航天在轨智能体

目前,团队自研的卫星数字人智能体已实现稳定在轨应用,标志着我国航天端侧大模型与在轨智能交互技术迈入新台阶。面向未来航天智能化发展需求,团队将聚焦航天智能体自主进化核心方向持续攻关,构建“在轨数据积累—任务反馈分析—知识模型迭代—地面仿真验证—在轨受控部署”的闭环持续优化机制。

研发团队

顾问:秦兵、刘挺

负责人:冯骁骋

风筝模型:赵帅博、张慧怡

故障诊断:朱浩铭、马伟涛

数字人交互:周星宇、佟梓赫、杨亦乔、杨振华、陈睿涵、钟蔚弘、李启明

特别鸣谢哈尔滨工业大学航天学院韦明川老师团队给予的大力支持!

编辑:陈睿涵

初审:张   羽

复审:冯骁骋

终审:单既阳


哈尔滨工业大学社会计算与交互机器人研究中心

理解语言,认知社会

以中文技术,助民族复兴

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

计算语言学与计算人文博士报考系列(六)

2026年9月30日 00:00

2026-09-30 00:00 江苏

面向计算语言学等交叉方向,欢迎跨学科报考

在教育部积极推进“新文科”建设的背景下,人工智能、大数据等前沿技术为外国语言文学学科的交叉融合发展提供了前所未有的机遇。

计算语言学是语言学与计算机科学融合的前沿文理交叉学科,以人类使用的自然语言为研究对象,以自然语言的计算机处理为研究内容。该学科旨在探索和实现计算机对人类语言的深入理解与生成。

01

导师简介与学术任职

张永伟,文学博士,中国社会科学院语言研究所研究员、应用语言学研究室主任、语言学重点实验室语言资源与智能技术子实验室主任,中国社会科学院大学教授、博士生导师,北京大学硕士生导师,国家级青年人才计划入选者。长期深耕计算语言学、语料库语言学、计算词典学、语言智能资源建设领域,专注人工智能、大数据技术与语言学的交叉融合研究,是国内语言资源智能化、通用语料库建设、数字文献处理领域的骨干青年学者。

学术兼职丰富,兼任中国社会科学院语言研究所语料库暨计算语言学研究中心副主任、全国语言与术语标准化技术委员会计算机辅助术语工作分技术委员会委员,深耕语言学与人工智能交叉赛道,搭建传统语言学与智能语言工程融合的学术研究平台。

现面向全国招收计算语言学、语料库语言学、智能语言资源、数字人文方向博士研究生,欢迎跨学科优秀学子报考深造。

02

科研成果与项目经历

科研成果扎实丰硕,在《中国语文》《当代语言学》《辞书研究》等语言学权威核心期刊、国内重要学术会议发表学术论文20余篇,参编《新华字典》等国家级权威辞书,学术功底深厚、研究成果认可度高。

主持及核心参与多项国家社科基金重大项目、省部级重点课题,长期聚焦语言数据工程、智能语言处理、古籍数字化、术语智能计算等前沿方向。牵头搭建多模态语料库、文献数字化平台,深耕冷门绝学数字化、语言资源智能化落地应用,研究兼具理论深度与工程实践价值。曾获中国社会科学院研究生院优秀科研成果奖励,科研团队研究氛围浓厚、科研经费与平台资源充足。

03

核心研究特色

研究打通传统应用语言学+计算技术+数字人文工程,兼顾基础理论研究与落地应用:既深耕语料库建设、语言描写、词典学理论研究,又聚焦自然语言处理、文本智能标注、文献数字化挖掘、语言数据工程等前沿技术研究,形成“理论研究+数据建设+技术落地”的完整研究体系。

团队重点聚焦汉语智能处理、古籍数字化保护、多模态语言资源建设、术语智能计算、语言标准化工程等方向,适配多学科背景考生,包容性强、科研方向前沿。

04

博士招生方向(申请-考核制)

• 中国社会科学院大学文学院

语言学及应用语言学(计算语言学、语料库语言学、数字人文、语言智能处理方向)

05

欢迎报考的研究选题

• 通用汉语/专门领域语料库建设、文本标注、语言数据治理

• 计算词典学、术语智能挖掘、语言标准化与应用研究

• 汉语自然语言处理:文本分词、句法分析、语义挖掘、搭配计算研究

• 古籍文献数字化、文本挖掘、冷门绝学数字平台建设

• 多模态语言资源建设、数字人文、语言智能应用工程

06

期待考生背景

不唯专业、不唯基础,极度欢迎跨学科考生,重视学习能力、科研态度与学术潜力!

• 语言学背景:应用语言学、汉语言文字学、外国语言学、比较语言学等,有语料库、词典学基础优先;

• 技术背景:计算机、人工智能、NLP、数据科学、大数据分析,对语言学、人文社科研究感兴趣者优先;

• 交叉背景:数字人文、古典文献学、信息管理,熟悉文本标注、数据整理、文献数字化者优先;

• 无需同时精通语言学与编程,踏实肯干、愿意跨学科学习即可。

07

培养理念与平台优势

依托中国社会科学院语言研究所、语言学重点实验室核心平台,拥有成熟的语料库研发环境、充足算力、数据资源与科研经费。学生可全程深度参与国家级在研课题,直接参与语料库搭建、智能语言工具研发、古籍数字化平台建设等核心科研工作。

培养模式灵活多元,兼顾学术理论深耕+工程实践训练。在读期间全力支持学生参与国内外高水平学术会议,鼓励发表核心期刊、会议高质量成果,支持文献调研、数据采集、科研实践。

就业发展路径广阔,毕业生可入职高校、科研院所、语言工程机构、人工智能企业、数字文化机构等,从事语言学科研、语言智能研发、数字人文建设、语言资源保护等相关工作。

08

报考提示

招生采用申请-考核制,初审重点考察研究计划书、学术积累、科研潜力与写作能力。

有意向申请者可提前梳理研究设想、准备学术材料,邮件联系导师沟通选题与报考事宜。

• 邮箱:zhangyw@cass.org.cn

• 工作地址:北京市东城区建国门内大街5号 中国社会科学院语言研究所

• 温馨提示:欢迎踏实好学、热爱交叉学科研究的同学积极咨询报考!

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

论文推介|HiFTS:层次化反馈驱动的可解释多维作文自动评分

2026年9月29日 00:00

2026-09-29 00:00 江苏

北大吴云芳团队最新成果!

论文名:A Unified Framework to Elicit Structured Feedback for Interpretable Multi-Trait Essay Scoring

发表会议:ACL-2026 Findings

多维自动作文评分需要依据评分细则对相互关联的多个维度进行推理,而不能只做孤立的分数预测。现有反馈增强方法往往将评语生成与打分相分离,或对各维度独立评分,导致分数与反馈不一致,也难以对齐细则。与此同时,近期多维评分方法主要在英文基准 ASAP++ 上验证与调优;已有中文作文数据虽具备专家标注或多维标签,但普遍缺少面向中文写作的细粒度细则。

本文因此构建并发布中文多维自动作文评分数据集 CFMS-34,共包含 951 篇小学课堂考试作文。每篇作文由两位语文教育专家依据内容、结构、表达、规范四个维度的 34 项细则独立评分,并给出总分。相较于已有中英文资源,CFMS-34 的核心贡献在于提供贴合中文写作评价的细粒度细则,从而为中文场景下的多维自动作文评分提供可复用的评测基准。实验进一步表明,现有多维作文评分方法在 ASAP++ 上表现具有竞争力,但在 CFMS-34 上整体与维度评分性能均显著下降,表明英文基准中的方法优势难以泛化至中文细粒度评分任务。此外,当前主流大语言模型的零样本评分也仅达中等水平,表明 CFMS-34 对通用大模型同样具有挑战性。因此,该数据集能够检验现有方法与大模型在中文细粒度评分上的真实表现,为后续研究提供统一、可复用的公共评测基准。

模型框架图

在此基准上,本文提出了 HiFTS,一个统一的自回归框架(如图1所示):先生成由全局到局部的层次化思维链反馈,再据此预测各维度分数与总分。HiFTS 先从教师模型蒸馏基于细则的层次化反馈,再经监督微调与 GRPO 对齐,使模型联合生成评语与分数;推理时引入轻量全局先验,缓解长程推理中的语义漂移。实验表明,HiFTS 在 CFMS-34 与 ASAP++ 上的总分与维度分均优于现有方法,并能生成连贯、对齐细则的评语。表1展示了CFMS-34数据上的一个评价案例。

定性案例分析:针对同一篇作文,比较扁平反馈与层次化思维链反馈

论文链接:https://arxiv.org/pdf/2608.28407

数据和代码已公开于https://github.com/Atiyahsama/HiFTS

该论文已被 EMNLP 2026 Findings 接收,作者包含杨世航(北京大学),李山雨(北京大学),赵宁宁(北京师范大学),吴云芳(北京大学)。通讯作者为吴云芳(北京大学)。第一作者杨世航系北京大学计算机学院一年级研究生,研究方向为自然语言处理。

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

Unicode 18.0正式发布|13007个新字符,小篆、女真文终于数字化编码!

2026年9月29日 00:00

2026-09-29 00:00 江苏

Unicode18.0发布,新增万余字符,纳入小篆女真文等,多项技术同步更新。

你每天打字聊天、刷网页、看文档,背后都离不开Unicode这套全球通用文字编码标准。

2026‑09‑16,Unicode联盟正式推出 Unicode® 18.0.0,一次重量级版本更新,新增13007个字符,全集字符总量来到172808个。

✨本次最大亮点:三套全新文字体系正式纳入标准

01

三套全新文字体系

01

Seal(小篆 / 小篆书)

这是本次更新占比最高的部分,足足11328个小篆汉字。

源自秦代统一文字,两千多年的篆书古文字,从此拥有统一数字编码。古籍、篆刻、古文字研究,以后可以在电脑里规范存储、显示小篆字形,对传统文化数字化意义重大。编码区块:3D000‑3FC3F。

02

Jurchen(女真文)

收录金朝使用的女真文字,同时配套女真部首区块,编码段18E00‑191DF。

作为我国古代北方重要的表意古文字,女真文完成标准化编码,助力辽金文献数字化整理。

03

Proto‑Cuneiform

(原始楔形文字‑数字)

本次仅收录原始楔形文字的数字符号,后续版本会继续扩充其他楔形文字符号,还原两河流域古老记数系统。

02

其他重要新增

  • 3个全新货币符号

马尔代夫鲁菲亚、阿联酋迪拉姆、阿曼里亚尔官方货币符号,补齐多国货币的编码缺口。

  • 9枚全新Emoji表情

同步Emoji 18.0,丰富社交聊天符号库。

  • 多个全新编码区块

孟加拉文补充、音乐符号补充、杂项符号与箭头扩展、古楔形数字等多个新码区上线。

  • 全新规范文档 UAX #60《东亚文字数据》

专门为女真文、小篆、女书、西夏文这类大型东亚古文字设立配套数据规范,附带JurchenSources.txt、SealSources.txt两份全新数据源文件。

03

技术层面更新(开发小伙伴划重点)

换行算法UAX#14修改LB12a规则,修复自Unicode5.1遗留的破折号断行bug,改善文本排版表现。

文本分段规则UAX#29修订GB9c规则,优化婆罗米系文字字符簇切分逻辑,修正历史回归问题。

Unihan汉字数据库更新:新增、清理多项日语变体属性;CJK统一汉字扩展D区范围扩展到U+2B81E,硬编码范围的程序需要适配更新。

UCA排序算法:女真、小篆引入隐式权重排序;移除已经废弃的Shift‑Trimmed选项;补充藏文连写;对U+FFFE / U+FFFF特殊码点增加排序处理逻辑。

安全机制UTS#39收紧ZWNJ零宽连接符规则,清理大量无效混淆字符数据,提升域名、标识符防欺骗能力。

标准化变体序列新增CJK笔画、数学运算符变体,同步更新蒙古文字变体序列,对齐国内国家标准。

⚠️提示:系统、浏览器、字体库需要后续升级才可以正常渲染小篆、女真文等新增字符,旧环境会显示方框占位符。

04

朋友圈精简短版本(可直接复制发圈)

Unicode 18.0正式发布!新增13007字符,总量达172808个。

🔥重磅:小篆11328字、女真文正式编码入库,秦代篆书、金朝女真古文字完成数字化标准化;同时收录原始楔形数字符号、3种新货币符号、9枚新Emoji。

大量排版、汉字库、排序算法更新,传统文化数字化迈出一大步。

浏览器/系统等待字体更新后,才能正常显示古文字字形。

05

写在最后

这一次Unicode18.0不再以大量表情符号为卖点,把绝大多数容量给到东方古代文字。

两千年前秦代小篆、金朝女真文字,终于和现代汉字一样,拥有全球统一数字身份。

古文字不再只躺在纸本古籍,正式走进数字世界。

🔗官方完整文档:https://www.unicode.org/versions/Unicode18.0.0/

互动话题:

你最期待哪个古文字的数字化?还有哪些文字需要数字化?欢迎留言聊聊~

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

《外语学刊》2026年第5期目录

2026年9月28日 00:00

2026-09-28 00:00 江西

《外语学刊》为北大核心、CSSCI扩展版等多项评价体系收录的外语类重要学术期刊。

转载自“外语学刊”

《外语学刊》为全国中文核心期刊、全国百强社科学报、RCCSE中国核心学术期刊、中国人文社会科学综合评价AMI核心期刊(A刊)、中文社会科学引文索引(CSSCI扩展版)来源期刊。

本微信公众号如无特殊说明,推送文章均来自《外语学刊》已经刊发文章,版权所有。欢迎转载,转载请注明文章来源。

一审 | 苑唯佳 谢群

二审 | 陈庆斌

三审 | 孙颖

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

高端数据标注,为什么更需要语言文字标准

2026年9月28日 00:00

2026-09-28 00:00 江西

大模型时代语言数据标注升级,需构建标准体系支撑语言智能发展。

转载自“语标智研”

近日,《浙江日报》刊发《高端数据标注,标出AI新高度》一文,关注大模型时代数据标注产业正在发生的深刻变化。

文章指出,随着人工智能从通用能力训练加速走向行业应用,数据标注正由过去相对简单的“打标签”“画框框”,向高专业性、高交互性、高复杂性的方向发展。医生、律师以及不同领域专家开始参与数据标注,“模型预标注+人工校准”“人工标注+模型检验”等人机协同模式加快普及,数据标注也越来越成为一项融合专业知识、技术工具和工程管理的系统性工作。

这一趋势,对语言文字数据标注同样具有重要启示。

从标数据到标知识

过去谈到数据标注,人们往往首先想到的是给图像画框、给文本分类。但对于大模型而言,尤其是在语言智能领域,越来越多需要标注的并不是简单、显性的对象,而是隐藏在语言中的语义、关系、意图、情感、知识、推理过程以及人类偏好。

一句话应该怎样切分?一个词在特定语境中表达什么含义?两个实体之间是什么关系?一句回答是否准确、恰当、符合语言习惯?面对歧义、指代、隐喻、方言、口语和复杂语用现象,应当如何处理?

这些问题已经不是单纯依靠“会操作标注软件”就能够解决的。

从这个意义上说,高端语言数据标注,本质上正在从“数据加工”走向“知识编码”。语言学知识、专业领域知识和模型训练需求,需要被转化为明确、稳定、可执行的数据规则,再通过规模化标注转化为机器可以学习的数据。

而这个转化过程中,标准的重要性会越来越突出。

高质量标注,从有人标,到按什么标

高质量数据集建设,既需要高水平的标注人员,也需要高质量的标注规则。

同一个语言现象,如果不同项目、不同企业甚至不同标注员采用不同理解和处理方式,即使投入再多人力,也可能形成大量彼此不一致的数据。对于人工智能训练而言,这种不一致最终会转化为数据噪声。

因此,语言数据标注需要解决的不仅是“标什么”,还包括:

标注对象怎样界定、术语怎样统一、标注粒度如何确定、不同语言现象按照什么规则处理、复杂和边界情况如何判定、标注结果如何表示、质量如何检测评价,以及不同数据集之间如何实现交换和复用。

这些问题恰恰是标准化工作需要解决的问题。

可以说,标注标准是连接语言知识与人工智能数据工程的重要接口。

它一头连接语言学、语言文字规范和专业知识,一头连接数据生产、模型训练和人工智能应用。只有把专家知识进一步转化为规范化、结构化、可执行的标注规则,专业知识才有可能进入规模化的数据生产流程。

AI时代,语言文字标准内涵正在变化

大模型时代,语言文字标准的内涵也在变化

人工智能的发展,也在拓展传统语言文字标准工作的边界。

过去,语言文字规范更多关注文字、词语、拼音、转写、术语等方面的规范使用。进入人工智能时代,机器不仅需要“认识字”“认识词”,还需要理解更加复杂的语言现象。

这意味着,面向人工智能的语言文字标准,需要进一步关注语言数据如何被机器表示、加工、标注、评价和使用。

例如,文本语料如何切分,实体和关系如何标注,语音和方言如何转写,语义和语用信息如何描述,多模态语言信息如何对齐,标注质量如何评价……这些都正在成为语言文字标准与人工智能深度交叉的新领域。

标准的作用,也因此从传统意义上的“规范语言使用”,进一步延伸到规范语言数据生产和机器语言处理。

标准正在成为基础设施

《高端数据标注,标出AI新高度》原文特别提到,高端数据标注已经从单一的“标注平台”竞争,走向“数据工程体系”竞争。

这一判断值得关注。

未来真正具有竞争力的数据能力,不会只是拥有多少标注人员,而是能否形成涵盖数据采集、清洗治理、标注、质检、评价、编目、管理和应用的完整工程体系。

在这一体系中,标准实际上承担着基础设施作用。

没有统一的术语,专家之间难以准确沟通;没有统一的标注规则,大规模协作难以保证一致性;没有统一的数据格式,不同平台和工具难以互操作;没有统一的质量评价方法,所谓“高质量数据”也难以得到客观验证。

因此,高端数据标注的发展越深入,对标准化的需求反而越强。

语标智研观点

语标智研

语标智研认为,人工智能时代的数据竞争,正在从“有没有数据”走向“有没有高质量、可计算、可复用的数据”。

而语言数据质量提升的背后,需要语言学、人工智能、数据工程和标准化等多方面力量共同参与。

数据标注不是简单给数据“贴标签”,而是把人的知识、判断和规则转化为机器可以学习的形式。标准所要解决的,正是如何让这种转化更加准确、一致、可验证和可复用。

从这个角度看,人工智能语言文字标准不是数据标注产业的外围工作,而应当成为高质量语言数据建设的重要基础。

随着数据标注进一步向专业化、智能化、人机协同方向发展,围绕标注术语、标注方法、标注规范、数据质量与检测评价建立更加系统的标准体系,也将成为支撑语言智能高质量发展的重要工作。


文章来源:《浙江日报》
原标题:《高端数据标注,标出AI新高度》

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

一图读懂《中华人民共和国国家通用语言文字法》

2026年9月27日 00:00

2026-09-27 00:00 浙江

新修订语言文字法2026年施行,开启第29届宣传周,图解解读相关法律要点。

转载自“重庆教育”

图片

2026年1月1日起,新修订的《中华人民共和国国家通用语言文字法》正式施行。法律明确“每年9月第三周为国家通用语言文字推广普及宣传周”。2026年9月14日至20日,是第29届国家通用语言文字推广普及宣传周,主题为“依法推广普及国家通用语言文字 奋进强国建设新征程”。 

接下来,让我们跟随图解,一起来学习新修订的《中华人民共和国国家通用语言文字法》。

一、什么是国家通用语言文字

根据《中华人民共和国国家通用语言文字法》,国家通用语言文字是普通话和规范汉字,是国家法定全国通用的语言文字。

二、新修订的法律有什么变化

2000年10月,第九届全国人民代表大会常务委员会第十八次会议修订通过《中华人民共和国国家通用语言文字法》,首次以法律形式明确普通话和规范汉字为国家通用语言文字。2026年1月1日,新修订的《中华人民共和国国家通用语言文字法》正式施行。

《中华人民共和国国家通用语言文字法》的修订,标志着我国语言文字工作进入法治化高质量发展的新阶段。

三、国家通用语言文字

与每个人息息相关

点击下方视频,查看更多新修订国家通用语言文字法的内容——

《四分钟读懂新修订国家通用语言文字法》

来源丨教育部

声明丨“重庆教育”微信公众号刊载此文,是出于传递更多信息之目的。版权归原作者所有。若有来源标注错误或认为内容侵权,请及时联系我们更正或删除。

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

教师节专访 | 语言科技新思维的倡导者李葆嘉教授

2026年9月27日 00:00

2026-09-27 00:00 浙江

李葆嘉教授畅谈语言科技新思维,剖析行业机遇困境,寄语学子融会传统与技术。

转载自“语时俱进-汉语言”

守故研微

拓路知新

访谈语言科技新思维的倡导者——李葆嘉教授

前言

四季更迭,岁月流转,我们褪去大一的青涩,步入大二新阶段。有人锚定目标正勉力前行,有人规划前路稳步迈进,更多同学仍旧处于迷茫之中,思考未来将会怎样。人生与专业的课题亟待我们去探索,我们都渴望着一份指引与鼓励,激励我们勇敢而坚定地做出自己的选择。今天,我们有幸邀请到李葆嘉教授将作为我们的引路人,分享他的治学思考,为我们打开语言学与现代科技交叉的大门,带我们走进那瑰丽而新奇的语言科技新世界。

01

个人简介

李葆嘉  章黄学派传人、语言科技新思维的倡导者、“新文科”教育的先行者、南京语义学派的奠基人。南京师范大学文学院教授、博士生导师、博士后联系导师,曾任语言科技系主任、南京师范大学语言科技研究所所长、江苏高校哲社重点研究基地语言信息科技中心主任。兼任黑龙江大学俄罗斯语言文学与文化研究中心研究员、北京外国语大学语言博物馆项目专家委员会副主任、伊犁师范大学边疆中华文史研究中心特聘教授。致力于传统语言文字学、普通语言学、幼儿语言成长学、语言学思想史、语言科技、语言哲学等领域的研究,形成了传统方法与现代理论、微观考证和宏观阐释、语言学与相关学科融会贯通的风格,建构了用中国传统方法研治西方学术史的知识体系。发表论文270篇,出版专著21部、译著6部,总主编“语言科技文库”(35种)。

02

访谈实录

01

2001年您在南师大文学院牵头成立语言科技研究所、创办语言科技系,当时国内中文院系很少开展语言学和科学技术的交叉研究,是什么契机促使您搭建这个全新平台?当时对研究所和语言科技系的定位,和传统中文研究所和中文系的最大区别是什么?

答:20世纪的最后几年,我一直在思考:一是对以往语言学的沉思,一是对未来语言学的预想,并归结为语言学人才培养的思考。回望上世纪下半叶,图灵(1950)早就预见到计算机和自然语言将结下不解之缘,并提出检验计算机智能的最好方法就是语言信息处理能力测试。此后,机译试验(1954)、知识工程(1977)、大规模真实文本处理(1990)相继兴起,语言学教学和研究已经走到必须与计算机、实验技术结合的关口。但国内中文专业,语言学教学和研究还是以传统内省、考据、描写和阐释为主,信息时代急需的语言科技复合型人才十分匮乏。

要在学术道路上不断探索,要营造良好的学术氛围,要参与当代文化建设——这是我1986年研究生毕业进入高校工作时的想法。作为高校教师,除了常规教学活动,还要努力做好专业建设、学科建设和科学研究。这是我搭建语言科技平台的动因。同时,1996年我参与南京师范大学国家文科基地(中文)的规划工作,积累了专业建设的实践经验。2000年下半年,我由此萌发“语言科技新思维”。2001年2月,制订《语言科技系十年建设发展规划书(2001-2010)》,随后制订《语言科技复合型人才培养方案》。2001年11月,在中国语言学会第十一届年会上宣读《论语言科学与语言技术》。2002年3月,刊发《论语言科学与语言技术的新思维》。

我们当时对语言科技的定位,就是突出跨学科研究和复合型人才培养,形成系(本科专业)-研究所-实验中心三位一体的建制。我们的定位是以语言学为本,贯通文理工相关学科,走多学科交叉、跨院系整合、开放型运行的路子。把教学-科研-开发三者结合起来,致力于推动语言研究从传统人文范型向当代科技范型的转变。

02

您提出的“语言科技新思维”,在今天看来非常地有前瞻性,目前很多语言学的研究都应用了语音实验分析、心理和行为实验分析等技术手段来进行研究和验证。在当时的学术环境下,您看到了语言学发展什么样的趋势?是什么样的契机促使您提出这样的理论?

答:上世纪末,计算机科学、脑神经科学、基因科学陆续崛起,我看到一个大趋势:当代科学的共同特征就是精密仪器、数值计算驱动的技术化。语言本身既是人文现象,同时也可以做实验、计算处理。语言学不能只有描写、考据、内省,也需要技术手段拓展研究的深度、精度与效度。

2000年我意识到,语言学已经形成语言科学与语言技术互补的格局,由此提出“语言科技新思维”。当时的认识是:所谓“语言科学”,包括理论语言学、描写语言学、历史语言学、对比语言学、应用语言学等分支;所谓“语言技术”,包括语言信息处理、语音实验分析,以及语言的神经、心理和行为实验分析技术。 “语言科技”的内涵是:以语言学为枢纽,以计算机为工具,贯通文理工相关学科,以实现语言研究过程及其成果的技术化。“语言科技”的外延是:语言工程科技、语言教育科技和语言研究科技。语言工程科技的研究领域是“人-机对话”,其目标是自然语言能力的模拟。语言教育科技的研究领域是“人-人对话”,其目标是语言教育的多媒体和网络化。语言研究科技的研究领域是“人-本(文本)对话”,其目标是语言研究的现代技术化。这一新思维既突出了当代科技发展所要求的语言信息技术化,又体现了以语言学为本沟通文理工相关学科、培养复合型人才的旨趣。十一年后,我在《语言科技文库总序》中写道:虽然语言学家不可能也不必要都转向语言计算或实验研究,尽管描写、考据和内省始终是最基本的方法,但是具有一定的语言科技意识却非常必要。语言学家只有了解有哪些可供利用的资源、软件或仪器,才能提高其研究的深度、精度和效度;语言学家也只有了解信息处理的语言研究需求,才有可能为之提供可资应用或参考的基础成果。语言科技是21世纪语言研究的方向和潮流。

从20世纪80年代以来,知晓计算机科技,看到计算机和电子文本处理器,这些都引起我的好奇。从1995年,我开始使用计算机。新工具促使新思考,新思考促使提出新理论。在当时的学术环境下,我已经看到了21世纪语言学发展的跨学科、技术化趋势。

03

现在大模型时代到来,对比您当年语言科技新思维的构想,您觉得语言学研究迎来了哪些新机遇,又面临着哪些新困境?

答:26年前提出语言科技新思维,率先实践“新文科”教育,其目标之一就是实现语言研究的技术化,探索人机对话的语言模拟。当今大模型的出现,已经把语言技术推进到全新阶段,由此带来新的机遇。第一,海量语料、大模型工具降低了语言材料处理的门槛,语料加工、词汇统计、文本整理等工作效率大幅提升,可以辅助传统语言学的考据、描写工作。第二,大模型倒逼语言学重新审视人类语言能力,语义理解、话语生成、认知机制成为技术发展迫切需要参考的本体成果。语言学本体研究的现实价值进一步凸显。第三,拓展了语言学人才的出口,语言科技复合型人才,除高校科研单位之外,可以进入大模型企业,从事语料建设、模型评测、知识工程等工作。

同时也要看到现实困境。现在的主流大模型,本质上是基于海量语料的匹配、复制、拼接,并没有真正复刻人类的语言认知机制,这与我所提出的“人工语言脑工程”设想还有相当距离。第一,技术界很多模型开发偏向工程调优,对语言学本体理论重视不足,模型会产生幻觉、逻辑漏洞,根源之一就是缺少深层语义、认知机制的底层支撑。第二,反过来,不少语言学研究者容易陷入两个极端:或者完全排斥新技术,固守传统;或者盲目依赖大模型,放弃语言学本体思辨,把工具直接当成研究结论。第三,人才层面,社会需要既懂语言学本体,又懂技术的复合型人才,但现在学科培养体系里,本体语言学和技术训练之间的平衡依旧很难把握。总而言之,大模型是强大的工具,但不等于已经实现真正的人工语言智能,语言学本体研究非但没有过时,反而更加重要。

回望21世纪初,我曾提出面向语言系统模拟的语义语法学以及人工语能的研制思路(2003)。将“人工语言脑”设计为三个子工程:(1)语言基因图谱分析工程,建构元符号系统和提取词元语义特征,让计算机获得词元编码能力;(2)认知语义网络建构工程,建构元句法系统和提取句法语义特征,让计算机获得语句编码能力;(3)受限语言能力仿真工程,建构话语理解与生成机制以及语境模型,让计算机获得日常会话能力。并且预言,谁先研制出可计算语义网络和形式化语境模型,谁就可能最先研制出“人工语言脑”,谁就处于21世纪信息科技的前沿。这一工程显然已超一己之力。与语言信息技术专家相比,只能流于纸上谈兵。

2022年11月ChatGPT公布后,我就充满好奇,其语言能力到底通过什么途径实现的。当下大语言模型与人工智能热潮席卷各行各业,学界诸多议论也随之而生:或质疑人文社会科学借力AI开展研究的可行限度,或主张人文学者当恪守治学定力,勿被技术浪潮裹挟,迷失本位研究。对治学者而言,若要评判大模型,必先亲身实操和认真思考,探索大模型服务于人文社会科学研究的辅助路径,并直面应用过程中遇到的各类问题。与之同时,需要摸索其基本原理与运行特性,关键是认识大模型的固有缺陷。

从2023年秋开始使用豆包。一步一个脚印。遵循学术研究的基本思路(概述→事件→引文→归纳),大语言模型如果要参与学术研究,至少必须具有四种基本能力:第一,对某学术专题,能否给出历史的概述?第二,对某学术事件,能否给出正确的判断?第三,对某作者论述,能否给出准确的引文?第四,基于以上资料,能否给出合适的归纳。围绕“如何利用大模型做辅助性学术研究”,近两年先后草拟《大语言模型的历史概述能力》《关于“生物语言学”是谁最早提出来的讨论》《大语言模型的传讹、辩解和纠错能力:谁是语盟理论的创立者》《关于豆包仿古杜撰引文及其出处的讨论》《大语言模型尚未具备协助严谨学术研究的能力》《大语言模型基本原理与运行特性探赜》等。

大模型(虽然已具有训练语料中所含的大量知识)不等于大知识,不等于大智慧。从学科知识论、学术认识论立场揭示:“幻觉”的本质是学科知识体系的匮乏与文献核验机制的缺失。当前大模型实现的是受限的人工语能,尚未拥有完备的学科知识结构,难以适配严格的科学研究。在当今热炒人工智能的情况下,我以为,大语言模型要少炒,聊天机器人应慎用。当前聊天机器人可与人们进行浅层的常识对话,至于与人们深度共享、调用自然语言文本中积淀的海量语言知识的条件尚未成熟。若要充分利用自然语言文本中的人类智慧,仍需坚持不懈的理论创新与技术迭代。

04

传统文字音韵训诂、历史语言学、现代语义学、语言科技,在您的研究中是融会贯通的。您认为我们文学院语言科技方向的学生,该如何平衡传统语言学与现代技术的学习?

答:首先要明确:传统本体功底才是根基,技术只是工具,工具不能替代本体思考。文字音韵训诂、历史语言学等,培养的是语言材料解读、语言现象观察、逻辑思辨的基本能力,这是语言学人的底色,不能因为学习技术就轻视传统。没有扎实的本体功底,就算会操作工具,也不知道该处理什么问题,也看不懂工具输出结果的对错。其次,不能把二者对立起来。传统研究有大量浩繁的文献,现代语言科技恰恰可以服务于传统研究。各种语言的语料库、词汇检索系统、方言语音数据库,都是用技术手段服务于语言研究。同学们要建立这样的意识:技术是用来解决语言学问题的手段,不是学习的最终目的。

给学生的具体建议:第一,基础阶段务必把现代汉语、古代汉语、语义语法等课程学扎实,打好语言材料分析的基本功。第二,学习技术时,不要只追求掌握软件、代码操作,要追问:这个工具可以解决什么语言学问题,其局限在哪里,输出结果存在哪些偏差。第三,学会双向结合。做传统课题,可以思考能用语料库、统计、语音实验拓展研究;做语言科技课题,也要扎根语言事实,避免脱离语言本体空谈。总之,要牢记我们当年提出的“两动”理念:既要动脑,具备语言学理论思辨能力;也要动手,掌握工具实操能力。

05

我们专业要学习心理学、认知语言学、计算语言学等多门课程,但学生们对于未来的就业方向不是很清晰,感觉很迷茫。请李老师给一些建议。

答:我在《当代三大科技与当代语言学:促进及互动》(2021)中阐述:20世纪下半叶,世界科技进入新的飞跃时期,先后出现计算机科学、分子生物学、现代脑科学。现代科技促进了当代语言学的发展,计算机科技孕育了计算语言学、现代脑科学提升了神经语言学、现代生物学推进了生物语言学,由此呈现当代语言学和当代科技的互动。21世纪被认为是生命科学、脑科学和人工智能的时代。当代语言学的交叉性、实验性、高科技性和精密化趋势,促使语言学成为名副其实的“语言科技”。

我们的课程涵盖心理学、认知、计算语言学等,正是复合型专业的特点。课程跨度大,学生一时看不清出路,是很正常的。首先要破除一个固有印象:中文背景不只是仅有中小学教师、传统科研等出路。当初,我们专业的建设方针是“面向社会、面向科技、面向应用”。语言科技复合型人才,面向的是信息时代与语言相关的多元岗位。

第一,首先要认清自身的能力取向。一部分学生对代码、算法兴趣浓厚,可以往自然语言处理、语料库工程、知识图谱方向发展,从事数据标注规范设计、语料库建设、大模型评测等工作。一部分学生编程能力一般,但语言学本体、语义、语用功底扎实,可以从事机器翻译后编辑、AI教育内容研发、语言资源建设、AI模型语言学评测、术语库编纂等岗位。还有学生结合认知、心理学、神经语言学知识,可以走向与语言康复、言语病理、儿童语言发展相关的行业。当然传统路径依然开放:语文教师、高校科研、辞书出版、语言资源机构,都可以作为选择。

第二,在校期间不要被动上课。一方面学好各门课程,另一方面主动参与大学生创新项目、实验室课题,在项目中积累实践经历。我们过去很多本科生、研究生,就是在做语料库、语义网络、语音实验、语言康复的过程中,找到自己感兴趣的方向。“动脑、动手” 的理念,不能只停留在课堂。

第三,要主动拓宽视野,多关注行业发展。多了解自然语言处理、语言教育、言语康复等领域的实际工作内容,看看行业需要什么样的能力,对照补足自己。同时也要根据自己的兴趣和能力,有所侧重,不必强求做到面面俱到。语言学复合型人才的优势,就是兼具人文素养与科技视野,把这个优势发挥出来,就可以找到适合自己的位置。

必须认识到,高校专业学习和个人就业并不具有必然关系,后者受到社会经济发展和个人社会背景的制约。专业教育的精髓在于培养思维方式。有了这套思维方式,我们可以从事与专业学习相同的就业,也可以从事与专业学习相关的就业,甚至改行。

最后,再次强调我提出的“两动”(即动脑设计能力和动手操作能力)、“两新”(即知识更新能力和工作创新能力)教育理念,其实这是贯穿人生的理念。

03

老师寄语

预祝同学们在本专业学习期间,完成从日常思维方式到学术思维方式的转型,尤其是实现学术思维方式和现代科技手段的相结合,从而为迈出人生的下一步打下底气。

- END -

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

程宁 | 定量比较中的唐诗字频结构与文体分野

2026年9月26日 00:00

2026-09-26 00:00 江苏

运用数字人文字频统计,对比诗文,探析唐诗词汇特征与诗史地位。

本文来源:《文献与数据学报》2026年第2期

定量比较中的唐诗字频结构与文体分野

程宁

(中国社会科学院文学研究所,北京 100732)

摘要:采用数字人文方法,从字频统计角度考察唐诗的语体特性与语言规律,以深化对唐诗语言风格及时代审美风尚的理解,并为古典诗歌研究提供可验证的数据支撑。以大规模诗文总集《全唐诗》《全唐文》以及唐代以前的《先秦汉魏晋南北朝诗》、唐代以后的《全宋诗》《全元诗》为数据样本,采用字频统计、齐普夫定律、字频序列相关性计算等理论与方法,揭示唐代诗歌的用字风貌,并定量比较唐诗与其他文体特征的差异性。在唐诗内部,以其字频分布模式构建了五级字区,并得出以“花”“水”“月”为代表的唐诗偏好字例。通过字频序列相关性检测,发现唐诗与宋诗、元诗的字频序列均表现出强相关性,反映了唐诗对后世诗歌创作影响深远,而宋诗与元诗的字频序列相关性最强,说明二者在字词使用上较唐诗关系更为紧密。唐诗相较于其他朝代诗歌,其诗化程度最高,确立了完全不同于散文的诗性语言典范。

关键词:唐诗词汇 字频统计 定量比较 文体特征 数字人文

0 引 言

诗歌研究在关注作家文化与思想的同时,也要重视其组构作品的语言材料。传统诗学的核心在于理解诗歌的内涵与美学价值,在这一框架下,每个字词的使用都不是偶然,而是诗人选择的结果,反映了其创作意图和艺术追求。受限于研究手段,以往研究很难从宏观的角度把握诗歌语汇的关联特征和演变规律。通过大数据及其相关技术对古代文学经典文本进行深度分析,可使文学研究进入更宏观的视野,提高结论的精准性、稳定性及可验证性,促生新的研究理念、方法与范式[1]。与散文的线性体式不同,汉语诗歌的语汇高度离散化,它不依照一般语言序列的组织逻辑来构建诗行,而是通过“对等原则”①重写语汇纵向选择和横向组合的规则。在整个汉语词汇系统中,有哪些元素被认定为具有“诗性”而被广泛用于组建诗歌作品,并经过历代更迭,有选择性地进入到唐代诗歌文本的空间内构筑起唐诗基底,这可以借助计算机软件与频次统计等手段进行穷尽式梳理和发掘。

1 古诗文字频相关研究

字频指的是在给定的文本或语料库中某个特定字符出现的频率,通常用来衡量该字在语言中的常见程度以及它在特定文本或语境中的重要性。字频特征对语言文字研究非常重要。计算语言学家冯志伟曾提到,汉字除了传统文字学所认为的音、形、义三个要素之外,从使用的角度还应有第四个要素便是字频[2]。字频统计一方面可以辅助国家制定语言文字标准,另一方面可以为专门语料库中某种特定语言现象提供全量的计算和说明。关于字频的研究,学界积累了诸多成果。以古典文献为例,比较有代表性的论文如郭小武《古代汉语极高频字探索》[3],利用网络资源统计古汉语极高频字,分析其音、形、义及词性的分布特征,并附有六部文献的100个极高频字数据。又如覃勤《先秦古籍字频分布》[4],统计了27部先秦时期文献的字频情况,发现先秦古籍常用字高度集中,而低频字数量巨大,使用率极低,且大部分作品之间字频高度相关。除了代表性论文以外,还有字频研究的相关专著问世,较早的有李波《史记字频研究》[5],通过制定各项指标对《史记》用字进行了核心、高频、中频、低频、罕用分区和分类的全面考察。延续此路径展开研究的还有一系列其他论著和文章,涉及十三经、《汉书》《三国演义》等专门语料[6-8]。

语言词汇系统有基本词汇和一般词汇之分[9],而“高频”是构成基本词汇的重要条件,古典诗歌的语言系统也不例外。关于哪些文字常常被选入诗歌,古人在写作过程中早有体会。欧阳修《六一诗话》所载“许洞试僧”的诗坛轶事便是利用了字频思想来规范作诗[10]:

当时有进士许洞者,善为词章,俊逸之士也。因会诸诗僧分题,出一纸,约曰:“不得犯此一字。”其字乃山、水、风、云、竹、石、花、草、雪、霜、星、月、禽、鸟之类,于是诸僧皆阁笔。

这些字眼诗僧常用,一定程度上反映了其清幽隐逸之生活。其实,这并不仅限于诗僧群体,上述大部分字型用例在整个中国古典诗歌中均占有较大比重。谢思炜曾以《唐诗三百首》为样本人工厘定高频词分布情况,发现排名靠前的有很多与许洞所列之字重合[11]。倘若继续扩大样本,以《全唐诗》语料为基准,以字频统计为方法,那么唐诗整体的用字面貌便可以完全勾勒出来。

在古典诗歌领域,学界已有诸多立足于汉字字频来开展研究的成果。诗歌字频的统计至少有双重意义。一是可以利用字频信息考察诗歌的语言体式,如张景祥等[12]以《全唐诗》为语料,利用字频熵来考察唐诗语言的通俗性问题,给出了李白、白居易、王维、温庭筠等作家之间及各自作品内部的通俗性指数与量化关系。二是可以利用字频信息去分析背后的审美意象范畴,比较有代表性的如朱崇才[13]通过电子计算机检索系统统计得到《全宋词》中的前100个高频字,并以此为基础从两性文化视角来说明宋词的女性化倾向。龚岚[14]通过对比唐诗和宋词中的前20个高频字,发现唐诗和宋词具有大体一致的择字倾向,都重点关注人与自然的话题。围绕《全唐诗》的字频统计,刘明华[15]通过第三方公司开发的检索软件总结出唐代诗人最爱说的字是“不”,并对数字、山水、天象、季节等各类的前五个高频字进行了粗略描绘。综上,目前诗歌文献字频统计多集中于频率描写,而较少文体比较与诗史演变层面的讨论。本文尝试在此基础上,将字频分布、频秩结构与跨文体、跨朝代语料的比较结合起来,揭示唐诗的语汇特征,探讨它在我国古代诗史长河中所处的位置及发挥的作用。

2 唐诗的字频统计

2.1 统计数据与方法

唐诗的字频统计以中华书局繁体版《全唐诗》[16]为底本。《全唐诗》收录唐诗近5万首,总计约258万字。为跨朝代、跨文体比较研究,本文同样搜集整理了《全唐文》以及唐代以前的《先秦汉魏晋南北朝诗》、唐代以后的《全宋诗》《全元诗》数据进行联合考察。

关于简体字统计和繁体字统计哪个更合理,学界尚未形成共识。有学者采用简体统计“四书”情况[17],虽然可以一定程度上减少异体字带来的影响,同时也增加了义项辨识的困难。常见的如“云”与“雲”,若统一置为简体,诗歌中出现的自然物象与言说表达混为一谈,则基于简体的统计并不能反映真实的用语情况。当然,繁体字统计同样有其问题,如繁体缺乏统一标准,一字多码现象普遍。不过,允许异体并存的统计策略,在另一方面可以为语言文字学的历时考察提供真实样本的数据支撑。需要指出的是,由于现行的汉字体系尚未解决复杂的字际关系问题,现行的繁简转换方案与异体字整理表只能覆盖一部分字型,全覆盖的异文关联与转码规范需要国家古籍数字化工程的不断开拓与实践。有学者指出:“创建统一字符集和标准文本库将是继秦朝‘书同文’之后的全新规范,也是汉字系统继从刻画到书写,又到数码形态的再次重置”[18]。因此,本文以繁体版语料进行字频统计,是本着遵循古诗文原貌,揭示其历史特征的原则,也是在统一标准的新形态汉字体系构建出来之前的折中选择。

底本选定之后,首先对其进行语料预处理,采用正则表达式进行结构化清洗。清洗内容具体包括去除文本目录、诗题及诗注、作者及小传,仅保留诗歌正文部分。在正文中进一步去除标点符号,对有些诗歌正文存在标注不同异文的情况,如孟浩然“山暝闻(一作听)猿愁,沧江急夜流”,清除括号中异文,统一按原版本处理。

语料预处理之后,采用Python的Pandas库构建一套完整的字频统计分析流程。首先,从经过预处理的数据集中提取所有正文内容,通过字符串连接操作将其合并为统一的字符序列。随后,采用统计计数方法对序列中的每个独立字符进行出现次数统计,生成包含字型与频次的基础频率表。在初级统计基础上,进一步计算各项衍生指标:通过频次与总字符数的比值计算出相对频率(单位占比),以百分比形式表征每个字符在文本中的分布比重;采用累积求和算法计算累积覆盖率,该指标体现了前N个高频字符所能覆盖的文本比例,对分析文本的核心词汇构成具有重要意义。为增强统计分析的可解释性,本文还引入均频倍值指标,通过将每个字符的频次除以所有字符的平均频次,量化各个字符相对于整体平均水平的偏离程度。该指标能够直观区分高频常用字符与低频罕见字符。

2.2 统计结果与分析

一般情况下,汉语以单音节词为主,双音节词不占优势。这一点在唐诗中亦有体现。唐诗语言高度凝练,且讲究炼字,单字词所占比例较高。例如,蒋绍愚[19]在其著作中收录了唐诗用词89例,其中多字词仅20例,单字词占比接近78%。为了更加直观呈现唐诗高频字分布特征,本文采用Python的StyleCloud库,将《全唐诗》中按照频次由高到低排名的前1000字的字频结构化数据转化为视觉权重,通过配置视觉参数优化输出,生成可视化字云图,见图1。

图1 《全唐诗》字云图

从图1可知,“不”“人”“山”“无”“风”“一”“日”“云”“有”“何”诸字占据了整张图的较大比例,说明这些字在唐诗中较为常见,上文提及“许洞试僧”所列之字如“山”“风”“云”均在此列。限于篇幅,取降序排列前50位的字频进行展示,见表1。

表1 《全唐诗》前50位字频表

不难看出,上述常用字大部分可单独成词,且构词能力较强。“不”字出现最多,占整个语料库的1%。从排名第1的“不”字到排名第50的“青”字,累积覆盖率已接近20%,也就是说此50字已经覆盖了《全唐诗》20%的用字量,充分体现了语言运用的“省力原则”。

表1所示的前50高频字,是构筑唐诗意境的核心“字料”。这些字高度凝练地映射出唐诗中的三大核心主题:自然意象(山、花、风、水、月等)、时空感悟(时、年、夜、秋、春等)与个人情志(人、何、心、归、思等)。各主题相互交织,共同勾勒出唐诗意境。那些脍炙人口的经典诗句,往往并不依赖生僻奇字,而是由一组看似平常却高度凝练的常用字构成。如“春江潮水连海平,海上明月共潮生”“海日生残夜,江春入旧年”“空山新雨后,天气晚来秋”“君不见,黄河之水天上来”“露从今夜白,月是故乡明”“君问归期未有期,巴山夜雨涨秋池”等,其中反复组合出现的“江”“山”“月”“春”“天”“夜”“明”等字,均属于字频排序中的核心区间。这一现象表明,唐诗的经典化过程,在某种意义上亦是一个高频语汇不断被强化与再生产的过程,其结果是形成了一套兼具表达效率与审美指向的诗性语言资源。

另外,前50单字中多见同属一个语义场的系列词对,反映出唐诗常有的二元对立属性,如视觉感知的“日”“月”,行为动作的“归/来”“去”,哲学思辨的“无”“有”,方位存在的“上”“下”等。值得一提的是,表示季节的“春”和“秋”均出现在前50之列,经排检,唐诗大部分是将“春”“秋”作为实际的季节来写。为了加强对比,同时检索了“夏”和“冬”出现的频次和排名,发现“夏”频次为921,排名650位,“冬”频次为515,排名1020位。可以看出,唐代诗人爱写春、秋两季,且写“春”要多于写“秋”,写“夏”多于写“冬”。当然这里只是从字的频次考查,并未纳入写四季的其他借代手法,不过仍可根据这些信息大致看出唐诗季节书写的差异。

为整体把握唐诗用字的分布情况,本文对其字型按照字频高低划分区段。综合累积覆盖率和均频倍值,将唐诗字频区段划分为核心、高频、中频、低频、罕用五个层级。参照美国语言学家M.斯瓦迪士(Morris Swadesh)[20]提出的适用于各语言的核心词数量,从均频倍值由高到低排出唐诗的200个核心字,然后以均频倍值1来界分高频与中频,0.1界分中频与低频,0.01界分低频与罕用。表2展示了唐诗字频各分区的范围。

表2 唐诗字频分区表

可以发现极少数字的频率非常高,而大量字的频率非常低,其中1次用字就有1336例,字频排序呈长尾效应。美国语言学家G.K.齐普夫(George Kingsley Zipf)利用大量统计数据总结出描述词频分布的重要规律,后人称之为“齐普夫定律”(Zipf’s Law)。它描述了一种特殊的统计分布现象,即在自然语言中,一个单词的使用频率与其在频率表中的排名成反比。此定律被广泛应用在语言学、信息论以及社会科学等各种领域。唐诗字频排序同样满足齐普夫定律的分布特点。图2给出了唐诗的字频序列分布,用不同颜色标记了字区范围,且坐标系使用对数尺度呈现。

图2 唐诗字频序列分布图(双对数)

3 唐诗字汇的同质性与异质性分析

3.1 《全唐诗》与《全唐文》的字汇差异

字频能够反映文体特征。表1的字频信息既蕴含了不同文体的通用特征,也涵盖了诗歌的异质性特征。诗之所以为诗,从字频角度看其异质性,仅通过自身语料是很难明确的,而是需要纳入其他文体进行对比分析。鉴于此,本文以《全唐文》为例进行对比。《全唐文》是清代继《全唐诗》之后官修的一部唐代散文总集,共收录文章1.8万余篇,总计766.6万字。《全唐文》搜采浩博,与《全唐诗》时代相同而文体相异,比较适用于对比分析。

以中华书局版《全唐文》为底本,提取正文字型,进行字频统计与排序。最终得到排名前50位的高频字,依次是“之、以、不、于、而、其、有、人、为、者、无、也、天、大、所、一、下、则、子、中、公、可、臣、道、事、是、年、自、日、三、十、上、至、行、在、时、元、文、如、官、国、王、德、言、曰、州、书、明、得、今”。从中可以推知,《全唐文》凸显了政治社会官僚体制与形式礼节的话题。另外,大量的连接虚词如“之”“以”“于”“而”“也”等,体现出散文在文体形式上较为注重逻辑性和论述结构。

不同文体的共现高频字体现语言习惯和文化认知的统一。通过对比《全唐文》与《全唐诗》可以发现,二者前50高频字存在交集,共19例,如图3所示。这些字属古汉语基本字,作为历史文学叙事的触发字,其频繁使用反映了唐代诗人所强调的时空与社会秩序。

而高频字的差异,直观反映了“诗”“文”两种文体在题材焦点与表达方式上的根本分野。《全唐文》的独有高频字折射出唐代政治社会的等级秩序,反映在语言上正式严谨,强调逻辑与论证。而《全唐诗》强调的是自然意象与个人生活体验,选择的语汇更具感知形象,反映了唐代诗人对自然界的细腻观察和内心世界的深刻描绘。数据所揭示的独有高频字集,并非偶然,而是“诗缘情”与“文载道”不同功能导向在语言材料选择上的直接体现。《全唐诗》通过对高感知性意象词汇的偏好,确立了其区别于散文的、以营造意境与抒发情志为核心的语体身份。

图3 《全唐文》与《全唐诗》前50高频字韦恩图

3.2 《全唐诗》与前后朝代诗歌的字频比较

一代有一代之诗,诗歌发展是一个前后接续的动态演变过程。元代方回在其《瀛奎律髓》中有诗评曰[21]:

自齐、梁、陈、隋以来,专于风、花、雪、月,草、木、禽、鱼,组织绘画,无一句雅淡,至唐犹未尽革。而晚唐诗料,于琴、棋、僧、鹤、茶、酒、竹、石等物,无一篇不犯。

方回指出唐代诗人写诗运用较频繁的语言材料承继自前朝,而随着观察世界的改变,唐诗自身也较频繁引入了新的实词元素。“真正的诗歌史是语言的变化史,诗歌正是从这种不断变化的语言中产生的”[22]。唐诗作为历代诗歌中的典范,继承前代诗歌传统的同时,也存在不同于各时代的用语特质。分析不同时代诗歌的字频差异,可以从历时的角度把握唐诗的用字特点及诗史地位。

搜集整理得到唐代以前的《先秦汉魏晋南北朝诗》、唐代以后的《全宋诗》和《全元诗》三种大型诗歌总集作为跨朝代的对比语料,分别对其进行结构化处理和统计。《先秦汉魏晋南北朝诗》共计46.9万字例,含0.62万字型。《全宋诗》共计1315.2万字例,含1万字型。《全元诗》共计159.2万字例,含0.76万字型。语料预处理策略与《全唐诗》一致,基于各文本正文的字例数量统计得到每个字型的出现频次及单位占比,表3展示了不同诗歌总集排序前20位的高频字。

表3 不同诗歌总集前20位字频表

表3中有三点值得关注。第一,不同朝代的诗集在字频分布上具有较高同质性,排名第1位的字都是“不”,该字的单位占比都超过1%,且各诗集高频字在整体上重合度较高。有学者发现唐代诗人最爱说的字是“不”[15]。通过与《全唐文》对比发现,“不”实际上是汉语基本词,在唐文中排名第3位,使用也非常广泛。从历时角度来看,“不”字在诗歌创作中没有显著时代差异,不仅唐代诗人爱写,魏晋南北朝乃至宋元等历代诗人都爱写,并非唐代诗人所偏爱。第二,各诗集中有些具体高频字的相对排名有异,从相对排序与单位占比可窥探出后世诗歌对唐诗的接受程度。如“人”字的单位占比从《先秦汉魏晋南北朝诗》的0.55%上升到了《全唐诗》的0.81%,且这一占比在《全宋诗》与《全元诗》中得到稳定延续。再如“山”字之意象在《先秦汉魏晋南北朝诗》中排名相对靠后,单位占比0.38%,在《全唐诗》中则提升到了第3位,占比0.62%,而后在《全宋诗》和《全元诗》中均得到稳定保持。第三,从独用字和更高频用字,可窥探唐诗用字的偏重意象。例如,“花”“水”“月”在前20位的高频字中为《全唐诗》所独有,而“云”的相对字频比其他诗集都高。从整个排名来看,《全唐诗》中比其他诗集相对字频都要高的字型共计315个,其中覆盖率累积至50%的共有100个,形成唐诗特色用字,见表4。这些用例一定程度上反映了唐诗区别于其他时期诗集的独特性。

表4 唐诗特色用字表

3.3 不同诗文集字频序列的相关性分析

不同朝代诗文总集字频序列的整体差异能够揭示诗歌的动态演变。上文通过列举的方式指出唐诗相对于其他朝代诗文总集的局部特点,并初步发现不同诗歌总集在整体的字频排序上存在同质性。若要更准确地揭示它们具体在多大程度上相同或相异,就需要借助数学统计的手段进行分析。当然,文学现象背后成因复杂,仅通过特定维度的数学模拟和统计检验等手段很难直接给出全面而确凿的因果推论关系,只能通过计算的方式揭示其相关性而不是因果性,在一定程度上验证我们对某些文学问题的感性认识。

以色列学者S.哈夫林(Shlomo Havlin)曾提出一种能够量化两组元素Zipf序列分布差异的距离公式[23],国内有学者利用此方法对不同文学体裁的字频演变规律进行了验证[24]。本文发现,尽管此方法能够计算出字频差异距离,但不同集合大小对计算结果的影响相对较大,且不能提供不同文本集用字相异或相似的标准化度量指标。由于我们关注的不是距离而是不同集合在用字频次排序上的相似性,因此可采用斯皮尔曼等级相关系数(Spearman’s rank correlation coefficient)进行测定,计算方法如公式(1)所示。

(1)式中,n表示数据点的数量,这里指诗歌字频两个序列包含相同字的数量;di是数据点的排名差,rs是字频排序的差值。这里需要保证同一语料库中字频相同的字排序一致,是等级相关系数的值,取值范围在-1到1之间,值越接近于1,两组数据正相关性就越强,反之负相关性就越强。

首先,提取四种诗歌总集均频倍值大于1的共现字型排名数据。其次,将隶属不同文体的总集与《全唐文》进行对照。再次,调用Python的scipy.stats模块中的spearmanr函数,计算斯皮尔曼等级相关系数rs及显著性指标p值。最后,得到各组数据p值均小于显著性水平0.01,说明字频序列之间存在统计上的显著相关性。相关系数计算结果如表5所示。

表5 不同诗文总集字频序列的相关系数

表5呈现了各诗文总集字频序列两两之间的斯皮尔曼相关系数计算矩阵。可以发现,该矩阵呈现出高度显著的层级关联性。朝代距离越近的诗集,其相关系数越高,例如:《全宋诗》与《全元诗》之间相关系数高达0.96,呈现出近乎完全一致的字频分布模式;《全唐诗》与《全宋诗》《全元诗》之间相关系数分别为0.88和0.87,亦表现出极强的相关性。《先秦汉魏晋南北朝诗》与后续各诗集的相关性保持在0.72至0.75之间,体现了诗歌传统在字频选择上的延续与变革。与之相对,《全唐文》与其他诗集的相关系数则明显偏低(0.44至0.54之间),反映出文体(诗与文)差异对于字频分布的系统性影响。上述相关系数分布表明,字频结构既受朝代因素影响,也显著受文体因素的制约。

将诗歌纳入散文文体进行对照,一是为了凸显诗与文的本质差异,二是有意探究不同时段诗与文的交汇融通情况。观察《全唐文》与各诗集的对比结果,发现相对于诗与诗之间的相似性,诗与文整体的相关度普遍较低,这本在意料之内。不过从表5各组具体数值,可以发现一个有趣的现象:相对于其他朝代诗歌,《全唐文》与《全唐诗》的相关性竟是最低的(0.44),这一现象为进一步探讨诗体演变提供了重要切入点。下面分别从诗与文、诗与诗两个方面展开论述。

诗与文的交融是引发诗歌从古体到近体、从近体到白话之变的重要导索。表5反映了中国古典诗歌与散文之间复杂的相互作用和诗歌语言形式的嬗变,在一定程度上可反映“以文为诗”的沿革脉络。这里所说的“以文为诗”不单指宋人对韩愈诗歌特质的总结和评价,而是关涉诗歌特质及其与古文文体的关系。

中国早期的古典诗歌中本就存在诸多散文因素,从先秦至南北朝时期的诗歌在整体上与散文字频序列相关度最高。先秦两汉魏晋的古诗与散文的界限并不完全清晰,在用字、语序、节奏等多种语言形式和叙述方式上有较多共通之处,如“在”“于”“之”“我”等介词、连词、人称代词等在古诗中较为常见,具有浓厚的散文色彩,在频度排序上与散文较为接近。

从先秦至唐代的诗歌在语言发展上更多地表现出一种去散文化的趋势,一直到唐代的近体诗定型,导致诗与文的彻底分离,这可以从唐诗与唐文相关系数的表现看出。尽管《全唐文》与《全唐诗》同系唐代作品,二者在字频序列相关度上却较其他朝代诗歌总集最低,这说明唐诗实际确立了不同于散文的诗性语言的典型特征。尽管唐中期出现了韩愈“以文为诗”的异质风格,但在整体层面上并没有得到显著体现。正如笔者另一项研究发现,相较于其他朝代,唐诗虚字使用密度是最低的[25],这也意味着唐诗散文化书写程度最低,也是最具“诗性”的。

到了宋代,诗人强化了对散文表达方式的借鉴,使得诗歌与散文在相关性上得到提升。诗与文的重新靠拢一定程度上揭示了宋元时期诗人对“以文为诗”复古理念的接受与创变实践。北宋时期古文运动重兴,诗风发生新变,韩愈诗特质被众多诗论家关注、推广和仿效,经过苏轼、黄庭坚的承继与发展,“以文为诗”“以议论为诗”逐渐盛行北宋诗坛而开一代诗风。典型诗例如“不识庐山真面目,只缘身在此山中”“人生到处知何似,应似飞鸿踏雪泥”“想得读书头已白,隔溪猿哭瘴溪藤”“纸上得来终觉浅,绝知此事要躬行”等等,虚字频出,意象稀疏,句法顺畅,语义逻辑连贯,遣词造句各方面与唐诗迥异。宋代严羽在其《沧浪诗话》中对宋诗的这种散文化倾向进行过讥评[26]:

夫诗有别材,非关书也;诗有别趣,非关理也。然非多读书,多穷理,则不能极其至。所谓不涉理路,不落言筌者,上也。诗者,吟咏情性也。盛唐诸人惟在兴趣,……言有尽而意无穷。近代诸公乃作奇特解会,遂以文字为诗,以才学为诗,以议论为诗。夫岂不工,终非古人之诗也。盖于一唱三叹之音,有所歉焉。

严羽认为诗乃吟咏情性的艺术,不能因理而废情。与此观点类似的人还有同时期的诗坛领袖刘克庄,其在《竹溪诗序》有言[27]:

唐文人皆能诗,柳尤高,韩尚非本色。迨本朝,则文人多诗人少。三百年间,虽人各有集,集各有诗,诗各自为体,或尚理致,或负材力,或逞辨博。少者千篇,多至万首,要皆经义策论之有韵者尔,非诗也。

刘克庄认为宋人能文不能诗,诗之存理而弃趣实则与文无异。纵观对“以文为诗”的历史评价可谓功过参半,它一方面模糊了诗文的功能界限,另一方面运用散文式的虚词、句式、章法等语言手法增强了诗歌的艺术表现力。

到了金元时期,诗歌的这种散文化倾向仍在持续。明代胡应麟在品评赵孟頫、虞集等诗人的作品时提到元诗“大概多模往局,少创新规。视宋人藻绘有余,古澹不足”[28]。由此可见,元诗承继前朝较多而创变较少。值得注意的是,尽管元诗式微,但其创作中同样存在“宗唐得古”的复古主张,讲求学唐而不袭宋,尤其是元代中期四大家格外推崇盛唐之音。从唐到宋、从宋到元这种复古流变的螺旋式发展看似较符合文学发展的理想模型,不过元诗论评家的这一主张似乎并没有实际奏效。在比较唐诗与元诗、宋诗与元诗的字频差异时可以看到,元诗与宋诗其实是非常接近的。例如:元好问“纵横正有凌云笔,俯仰随人亦可怜”完全是散文议论句,这种立论式的写法与王安石“不畏浮云遮望眼”的逻辑如出一辙;王冕“不要人夸好颜色,只留清气满乾坤”采用直白的口语叙述来借物讲理,是典型的宋调。当跳出小范围典型样本的经验建构,在元代数十万作品的更大窗口范围内进行观察时,才能相对客观地把握诗歌发展的原始生态。

上文比较了诗与文的字频序列相关性,下面观察表5中不同诗歌总集字频序列相关度。可以发现,尽管不同时期的诗歌在风格和主题上有所区别,但诗化语言特征使得它们在用字上保持了一定程度的连续性和相似性,体现了中国古典诗歌的稳定基底,同时数据间的微妙差异也反映出诗歌的动态更迭与演进变化。

具体而言,中国古代不同时期诗歌之间的相关性表现出如下特点。第一,唐代以前诗歌相对独立,各时期诗歌黏合度不高,唐诗因与之时期接近,字频序列也相对较近,但也有明显不同。第二,唐及以后诗歌的字频序列之间表现出强相关(相关系数大于0.8),一定程度反映出唐诗对后世诗歌创作的影响。第三,宋元诗歌字频序列极为相似,两者相关系数达0.96,且分别与唐及唐前诗歌的比较结果高度一致。前面提到元诗主张宗唐而避宋,而实际表现却与宋诗亦步亦趋,这一现象比较耐人寻味。这一结果似乎揭示出理论主张与语言实践之间相背离的复杂关系。元代诗坛虽有“宗唐得古”的鲜明口号,但数据表明,其整体用字习惯更近乎宋诗。元代文人(如元好问、虞集等)虽有“复古”倾向,在诗歌题材上或许追摹唐诗的兴象风神,但在日常化、理趣化的语言表达上,仍不免延续宋诗脉络。

需要说明的是,有关“以文为诗”或“宗唐得古”的诗学命题,其历史背景、具体意涵及表现层次较为复杂,本文仅从用字习惯的宏观相似性这一特定角度,采用字频序列相关性分析揭示了其演变趋势的某一侧面。这为我们理解古典诗歌在不同历史时期的风格变迁提供了一种可量化的解读视角,但并非对这些命题的全面定论。

4 结 语

本文通过对唐诗字频的统计分析,从数字人文视角揭示了唐诗语汇的基本特征,为理解唐诗的语言特性及其在中国诗歌史上的地位提供了新的实证依据。研究发现,唐诗内部字频分布遵循齐普夫定律,呈现出规律性的层级结构。通过将唐诗与唐文进行文体对比,勾勒出“诗”与“文”的字频差异与文体特征。唐文凸显政治社会官僚体制与形式礼节,大量使用连接虚词体现逻辑性和论述结构,而唐诗则强调自然意象与个人生活体验,语汇更具感知形象,反映了唐代诗人对自然界的细腻观察和内心世界的深刻描绘。通过与其他朝代诗歌比较,发现唐诗用字呈现出明显的继承与革新。一方面,唐诗与不同朝代诗歌在字频分布上保持一定的同质性;另一方面,“花”“水”“月”等字的相对高频使用,彰显了唐诗区别于其他朝代诗歌的独特性。另外,唐诗与宋、元诗歌字频序列表现出强相关,反映了唐诗对后世诗歌创作影响深远;而宋、元诗歌字频序列相关性最强,揭示了元诗对宋诗亦步亦趋的语言现象。

研究还通过诗文字频序列相关性的变化趋势,勾勒出中国古典诗歌与散文文体之间相互作用和诗歌语言形式的嬗变过程,为理解“以文为诗”这一重要诗学概念提供了语言层面的实证支持,也为把握中国古典诗歌发展脉络提供了新的视角。然而,本文字频分析虽关涉经典命题,但角度相对单一,字词组合、句法结构、主题内容等涉及较少。未来研究可结合语义向量、句法网络、主题建模等,引入更细分的朝代、流派或个体诗人文本展开综合性研究。

【注释】

① “对等原则”是罗曼·雅各布森(Roman Jakobson)在诗歌分析中提出的一个概念。诗歌的核心特征在于某种形式的对等,这种对等可能在不同的层面上呈现,如声音、词汇、语法结构、意义等。在诗歌中,这些元素通过重复、对照、对偶或对称等方式产生了一种对等关系,从而创造出音韵、节奏或视觉效果,赋予诗歌独特的美学特征。

【参考文献】

[1]刘石,尹小林. 以数字映射古代文学经典[N]. 光明日报,2022-03-23(11).

[2]冯志伟. 现代汉字和计算机[M]. 北京:北京大学出版社,1989:109.

[3]郭小武. 古代汉语极高频字探索[J]. 语言研究,2001(3):69-84.

[4]覃勤. 先秦古籍字频分析[J]. 语言研究,2005(4):112-116.

[5]李波. 史记字频研究[M]. 北京:商务印书馆,2006:38-292.

[6]海柳文. 十三经字频研究[M]. 北京:高等教育出版社,2011:13-99.

[7]海柳文. 《汉书》字频研究[M]. 新北市:花木兰文化出版社,2013:17-75.

[8]桑哲. 《三国演义》字频研究[D]. 曲阜:曲阜师范大学,2013:131-137.

[9]王德春. 语言学概论[M]. 上海:上海外语教育出版社,1998:132.

[10]欧阳修. 六一诗话[M]//何文焕. 历代诗话. 北京:中华书局,2004:266.

[11]谢思炜. 汉语诗歌词语管窥:以《唐诗三百首》为样本[J]. 清华大学学报(哲学社会科学版),2015,30(3):76-84.

[12]张景祥,安培壮,苏娜. 唐诗字频熵分析与通俗性定级[J]. 科技资讯,2009(6):241-243.

[13]朱崇才. 从高频字看宋词的女性化倾向[J]. 中国韵文学刊,1993(00):70-76.

[14]龚岚. 试论唐诗宋词中的高频字[J]. 江西财经大学学报,2009(1):104-108.

[15]刘明华. 唐人最爱说“不”:《全唐诗》软件字频检索如是说[J]. 中国典籍与文化,1999(4):29-30.

[16]彭定求. 全唐诗[M]. 北京:中华书局,1960:1-10222.

[17]尹小林. “四书”字频统计报告[J]. 数字人文,2022(3):126-139.

[18]李飞跃. 书同文字与再造书契:论古籍数字化时代的字符统一与文本规范[J]. 北京师范大学学报(社会科学版),2023(5):127-141.

[19]蒋绍愚. 唐诗语言研究[M]. 北京:语文出版社,2008:258.

[20]Swadesh M. Lexico-statistic dating of prehistoric ethnic contacts: with special reference to North American Indians and Eskimos[J]. Proceedings of the American Philosophical Society, 1952, 96(4): 452-463.

[21]方回. 瀛奎律髓汇评[M]. 李庆甲,集评校点. 上海:上海古籍出版社,1986:1738.

[22]贝特森. 英诗与英语[M].刘象愚,等,译//韦勒克,沃伦. 文学理论. 南京:江苏教育出版社,2005:195.

[23]Havlin S. The distance between Zipf plots[J]. Physica A: Statistical Mechanics and its Applications, 1995, 216(1-2): 148-150.

[24]刘宇凡,郭金忠,陈清华. 唐代以来汉语文学作品中的字频演变[J]. 中文信息学报,2011,25(3):93-97.

[25]程宁. 唐诗语体的历时演变:以虚字使用密度为中心[J]. 山东社会科学,2025(11):104-114,124.

[26]严羽. 沧浪诗话[M]//何文焕. 历代诗话. 北京:中华书局,2004:686.

[27]刘克庄. 刘克庄集笺校[M]. 辛更儒,校注. 北京:中华书局,2011:3996.

[28]胡应麟. 诗薮[M]. 上海:上海古籍出版社,1979:230.

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

徐杰 | 硕士与博士学位论文的异同

2026年9月26日 00:00

2026-09-26 00:00 江苏

徐杰辨析硕博论文异同,借比喻阐释二者选题、理论贡献层面的核心差异。

转载自“镜海语言学”

{

硕士论文与博士论文的异同

镜海心得 | 第71期

徐杰

}

      不管是硕士学位论文还是博士学位论文,既然都是学术论文,它们的共同点当然是主要的。比如它们都要有明显的创新点,都要有新意。其主要结论都应符合“乍听起来意料之外,定神深思情理之中”的合理预期。都要尽可能地把复杂的道理讲简单,从简单的现象挖深意。要密切对接相关的理论,决不能就材料论材料,还要把自己的材料案例分析和相关的理论挂起钩来,积极参与文献中相关的理论对话。

     另一方面,二者之间也在问题范围和学术纵深等方面存在重要差别。如果把学生比作地产商的话,硕士生可以做二手承包商,从一个地产项目上选取一个自己做得了且有利可图的小工程来做。可以是这个小区的门窗,也可以是其卫浴设备等等。而博士论文选题则要做一手开发商。首席要拿到一幅好地段,最好是个富矿,先做好语料和理念的顶层设计,再分期实施。首期成果就是博士学位论文。毕业后接着二期、三期做下去,久久为功,自然形成独特的学术“领地”,让同行们将来再做与此相关的问题时绕不开你。

     一个成规模的学术议题就好比一套包含原理原则概念术语支撑起来的学术理论之超市货架。硕士生要把自己论文做出的结果(商品)都挂到货架里适当的位置上去。而博士论文则要带着自己案例研究结果(商品)幅度不等地重新摆布这组货架。不仅是消费理论、还要自觉地积极地对理论本身作出贡献,发展改进理论,或丰富、或延伸、或小修、或大改 。至于能走多远,爬多高,那就全看大家的能耐和魄力,端赖诸位的德、学、才、识了。

(图:澳门大学语言学研究中心一角)

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

计算语言学与计算人文博士报考系列(五)

2026年9月25日 00:00

2026-09-25 00:00 江西

国防科大原伟教授招博,采用申请‑考核制,主攻计算语言学等方向。

在教育部积极推进“新文科”建设的背景下,人工智能、大数据等前沿技术为外国语言文学学科的交叉融合发展提供了前所未有的机遇。

计算语言学是语言学与计算机科学融合的前沿文理交叉学科,以人类使用的自然语言为研究对象,以自然语言的计算机处理为研究内容。该学科旨在探索和实现计算机对人类语言的深入理解与生成。

01

导师简介

原伟,博士,国防科技大学外国语学院教授,博士生导师,博士后合作导师,“长江学者奖励计划”青年学者,中国英汉语比较研究会语言服务专业委员会理事、外语教育技术专业委员会理事,教育部国家语委国防语言能力发展研究中心专职研究员,江苏省国防语言智能处理军民融合创新平台专职研究员。主要从事计算语言学、计量语言学和数字人文研究,主持国家社科基金项目3项、国家社科基金重大项目子课题2项、中国博士后基金一等及特别资助项目2项、省部级课题2项及其他各类课题40余项。近年来出版专著3部,主编出版词典4部及教材5部,获得省级、军队级、地市级优秀成果6项,软件著作权6项,在SSCI、A&HCI、EI、CSSCI、CSCD等各类期刊发表论文50余篇。

  • 联系方式:yuanwei@nudt.edu.cn

02

招生对象

  • 拥有中国国籍的应届硕士毕业生,包括正在攻读硕士学位的军队在职军官和文职人员。如获录取,入学前须获得硕士学位证书,否则取消入学资格。

  • 拥有中国国籍的已获硕士、博士学位人员。直招入伍博士研究生招录对象须符合军队直接选拔招录入伍攻读研究生相关条件。

03

报考方式

04

报名网址

国防科技大学研究生招生信息网(https://yjszs.nudt.edu.cn/zsmh/index/new-index.view)

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

新闻|第五届哈清复自然语言处理学术交流会成功举办

2026年9月25日 00:00

2026-09-25 00:00 江西

第五届哈清复NLP交流会于京举办,师生报告研讨,评选海报,展望三校科研合作。

转载自“TsinghuaNLP”

9 月 13 日,第五届“哈尔滨工业大学、清华大学、复旦大学三校自然语言处理学术交流会”于北京成功举办。

哈尔滨工业大学车万翔、丁效、张伟男、冯骁骋、梁夏、朱庆福、蔡碧波、刘元兴、王昊淳;复旦大学黄萱菁、桂韬、傅金兰、陈新驰、曹艺馨、陈爽、纪焘等老师出席本次学术交流会,三校师生共 366 人参会。

第五届哈清复自然语言处理学术交流会合影留念

上午 9 时,交流会在北京如期举行。孙茂松教授首先进行开场发言,对哈尔滨工业大学和复旦大学师生的到来表示热烈欢迎。随后,孙老师分享了《一位人工智能导师研究历程中的“苦涩”教训与点滴心得》,就学术创新、学科建设等内容展开阐述。

清华大学孙茂松老师作教师报告

哈尔滨工业大学丁效老师就《神经解码与认知表征:认知状态的可读性与结构分析》作报告,围绕“从识别脑状态走向理解认知结构”这一核心问题展开,为脑认知研究与下一代人工智能的发展提供新的视角。

哈尔滨工业大学丁效老师作教师报告

复旦大学陈新驰老师在《智能体在真实科研与工作场景中的能力评测与初步探索》的报告中,围绕从经验中学习、在反馈中迭代、并学习科研品味三方面能力,评测了智能体在长期办公协作与科研实验场景中的表现。

复旦大学陈新驰老师作教师报告

启元实验室孙彦港老师就《从可扩展长序列建模到结构化表征学习》作报告,分享了团队在电磁信号基础模型研究方向的相关成果。

启元实验室孙彦港老师作教师报告

随后,复旦大学黄萱菁老师担任主持人,哈尔滨工业大学蔡碧波老师、清华大学韩旭老师及复旦大学纪焘老师齐聚教师圆桌论坛,围绕领域前沿、科研选题与学术成长展开深入探讨。

教师圆桌论坛环节

在午后的学生报告环节,来自三所高校的学生代表分享了各自领域的研究成果。复旦大学的仝竞奇同学在题为《智能演化的范式迁移》的报告中讨论了各阶段的局限及智能下一范式的学习与训练目标,并介绍了 Game-RL、AI Can Learn Scientific Taste 与 Thinking with Video 三项代表性工作。

复旦大学仝竞奇同学作学生报告

清华大学的何秉翔同学带来了题为《Rethinking On-Policy Distillation of Large Language Models》的报告,分享了 Rethinking OPD 系列的工作成果。

清华大学何秉翔同学作学生报告

哈尔滨工业大学的罗先镇同学在《从 Token 到 Action:数据如何塑造代码智能》的报告中,结合代码预训练与后训练的实践和思考,探讨了支撑这些能力的数据该怎么收、怎么选、怎么处理,以及质量、多样性、重复度和训练预算之间的取舍。

哈尔滨工业大学罗先镇同学作学生报告

随后,清华大学博士后肖朝军担任主持人,哈尔滨工业大学刘润萱同学、清华大学黄宇翔同学及复旦大学郭虹麟同学参与学生圆桌论坛,就科研目标、学界与业界的科研区别等内容展开讨论。

学生圆桌讨论环节

在茶歇与海报交流环节,师生围绕各自感兴趣的研究课题展开热烈交流。最终,在 92 个海报展示项目中,学生们评选出三篇最佳 Poster,每所高校各有一项成果入选。

哈尔滨工业大学成果《When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents》:

哈工大最佳 Poster 颁奖现场,颁奖嘉宾陈爽(右一)、获奖者郭家合(左一)

清华大学成果《Rethinking On-Policy Distillation of Large Language Models II: One Training Example》:

清华大学最佳 Poster 颁奖现场,颁奖嘉宾冯骁骋(左一)、获奖者符梓璇(左二)、何秉翔(右一)

复旦大学成果《AI Can Learn Scientific Taste》:

复旦大学最佳 Poster 颁奖现场,颁奖嘉宾李鹏(右一)、获奖者李明哲(右二)、李航成(左一)、仝竞奇(左二)

交流会最后,清华大学刘知远老师对本次活动作了总结,对自然语言处理的未来发展与三校合作表达了期待。

清华大学刘知远老师作总结发言

关于我们

清华大学自然语言处理与社会人文计算实验室(TsinghuaNLP)成立于 20 世纪七十年代末,是国内开展自然语言处理研究最早、深具影响力的科研单位,也是中国中文信息学会计算语言学专业委员会及中国人工智能学会因果与不确定性人工智能专业委员会的挂靠单位。实验室在学术总体带头人孙茂松教授及学术方向带头人刘洋教授、刘知远教授的带领下,围绕以中文为核心的自然语言处理,在语言大模型、跨模态大模型、中文信息处理、机器翻译、知识图谱、智慧教育、社会人文和艺术计算等方面开展系统深入的研究,在国内外具有较大的学术影响。近年来,实验室承担了国家 973 项目、国家重点研发项目、国家社会科学基金重大项目等多项重要研究任务,并与腾讯、华为等企业建立密切的学术合作关系。

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

计算语言学与计算人文博士报考系列(四)

2026年9月24日 00:00

2026-09-24 00:00 江苏

社科院龙从军研究员申请‑考核制招博,主攻藏语计算语言学,欢迎跨学科考生。

在教育部积极推进“新文科”建设的背景下,人工智能、大数据等前沿技术为外国语言文学学科的交叉融合发展提供了前所未有的机遇。

计算语言学是语言学与计算机科学融合的前沿文理交叉学科,以人类使用的自然语言为研究对象,以自然语言的计算机处理为研究内容。该学科旨在探索和实现计算机对人类语言的深入理解与生成。

01

导师简介

龙从军,文学博士,中国社会科学院民族学与人类学研究所研究员、民族语言文化行为实验研究室主任,中国社会科学院大学教授、博士生导师;西藏大学、中央民族大学兼职博导,招收藏学、民族语言NLP方向博士生,跨校平台联动,多渠道支持有志学子攻读博士学位。

龙从军教授深耕计算语言学、语料库语言学、数字人文,核心研究方向为藏语计算语言学、藏语方言调查、古藏文文献数字化标注,长期探索人工智能、大数据技术与民族语言研究的交叉融合,是国内民族语言NLP、藏语语料库建设领域的核心学者之一。担任中国民族语言学会副秘书长、常务理事,中国中文信息学会理事,中国民族语言学会青年工作委员会主任、语言资源与计算人文专委会主任、汉藏语言文化专委会副主任,西藏智库理事等,在民族语言学、计算人文领域搭建起跨学科学术交流平台。科研成果丰硕,已出版《藏文自动分词理论和方法研究》《藏语噶尔话语法标注文本》《藏文古文献〈拔协〉文本标注与语法研究》等专著5部(含合著),编著《中国民族语言应用研究》;在语言学核心期刊、国际计算语言学会议发表论文60余篇。主持国家社科基金、国家语委、中国社科院重点课题等省部级以上项目十余项。

他带领团队自主研发藏文OCR、藏语自动分词、词性标注、句法分析、语义角色标注等系列工具与大规模标注语料库,搭建古藏文文献数据库、民族语言口述语料标注平台,取得多项软件著作权与发明专利,相关成果广泛服务于藏语古籍保护、民族语言资源抢救、民族语言智能处理等领域,曾获教育部中国语言资源保护先进个人、民族所青年优秀专著奖等荣誉。

研究特色兼顾田野调查、语言描写与计算技术,打通传统民族语言学与数字人文、自然语言处理,既重视藏语方言、古藏文文献的基础描写,又强调语言资源数字化、模型构建、语料库建设等工程实践,欢迎兼具语言学基础、编程能力或文献功底的跨学科考生报考。

02

博士招生方向

  • 中国社会科学院大学文学院|数字人文;自然语言处理方向(民族语言计算语言学)

  • 西藏大学文学院|中国少数民族语言文学(藏语计算语言学方向)

  • 中央民族大学|中国少数民族语言文学(藏语计算语言学方向)

招生均采用申请-考核制。

03

欢迎报考的研究选题

  • 藏语(方言/古藏文)语料库建设、文本标注、语法描写

  • 藏文自然语言处理:分词、词性标注、句法分析、命名实体识别、语义角色标注

  • 古藏文文献数字化、古籍文本挖掘、藏文OCR与文献整理

  • 民族语言数字人文、少数民族语言资源保护、语言数据工程

  • 汉藏语系语言的计算语言学、实验语音学研究

04

期待考生背景

  • 语言学背景:民族语言学、汉语言文字学、藏学、比较语言学,有藏语基础优先;

  • 技术背景:计算机、人工智能、NLP、数据科学,对民族语言感兴趣;

  • 交叉背景:数字人文、文献学,熟悉古籍整理、文本标注者优先;

  • 无需同时精通语言学+编程,导师鼓励跨学科背景,重视学习能力、文献阅读能力与踏实的科研态度。

05

培养理念与平台优势

依托社科院民族所民族语言文化行为重点实验室,联合西藏大学藏文信息平台、中央民族大学民族语言智能实验室,导师组提供充足的田野调查、数据采集、算力资源。学生可深度参与在研国家级课题,直接参与藏语语料库、古籍数据库与NLP工具研发。

培养模式兼顾理论与实践,学生既可深耕传统民族语言描写,也能投身语言工程、数字人文前沿;在读期间支持参与国内国际学术会议,鼓励发表高质量期刊与会议论文,支持田野调查、古籍文献调研。三校平台互补,毕业生可继续从事高校科研、语言资源工程、民族文化数字化等方向工作。

06

报考提示

招生为申请-考核制,材料初审重点考察研究计划书、过往科研成果、学术写作能力。有意申请者可提前准备研究设想,邮件联系导师沟通选题。

  • 邮箱:longcj@cass.org.cn

  • 地址:北京市海淀区中关村南大街27号,民族语言文化行为实验研究室

中国民族语言研究正迎来数字化转型,期待有志于民族语言、计算语言学、数字人文的青年学子,共同深耕冷门绝学,用数字技术守护民族语言文化。

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

江苏省外国语言学会第十四届年会 暨第十八届江苏省外国语言学学术论坛(2号通知)

2026年9月24日 00:00

2026-09-24 00:00 江苏

2026年10月苏省外语言学年会于南师举办,聚焦数智赋能与学科范式重构。

转载自“南师外院”

2026年适逢“十五五”规划开局之年,外语学科正置身于双重时代浪潮的深刻重塑之中:以大语言模型、生成式AI为代表的数智技术正在改写语言研究的方法论与教学形态;国家高水平对外开放与国际传播能力建设的战略需求,则对外语学科提出了构建对外话语体系、服务文明互鉴的新使命。与此同时,《普通高等教育学科专业设置调整优化改革方案》(教高〔2023〕1号)明确提出“加快新文科建设”,要求“推动文科间、文科与理工农医学科交叉融合,积极发展文科类新兴专业,推动原有文科专业改造升级”,并强调“推进文科专业数字化改造,打造文科专业教育的中国范式”。以新文科建设为引领,外语学科在跨学科融合与数智化转型中实现自我更新与范式重构,已成为学科回应时代之问的必然选择。基于此,江苏省外国语言学会拟于2026年10月16-18日举办江苏省外国语言学会第十四届年会暨第十八届江苏省外国语言学学术论坛。大会主题为“数智赋能·文明互鉴:外国语言学的时代回响与范式重构”,组委会特邀省内外专家做主旨发言。现将有关事项通知如下:

一、主办与承办单位

主办单位:江苏省外国语言学会

承办单位:南京师范大学外国语学院

二、会议主题:数智赋能·文明互鉴:

      外国语言学的时代回响与范式重构

分议题(包括但不限于):

1. 生成式AI与外语教学研究的新范式

2. 数智技术与语言研究范式重构

3. 人工智能与外语教师专业发展

4. 话语分析与批评话语分析的新进展

5. 神经认知语言学研究

6. 中华文化外译与国际传播能力建设

7. 文明互鉴视域下的跨文化叙事与话语研究

8. 跨学科视域下的语言学理论创新

9. 外语学科自主知识体系建构

10. 多语种、多模态与区域国别研究

三、主旨发言嘉宾(按姓名拼音为序)

冉永平教授(广东外语外贸大学)

王海啸教授(南京大学)

王军教授(苏州大学)

辛志英教授(厦门大学)

徐晓东教授(南京师范大学)

俞洪亮教授(扬州大学)

张天伟教授(北京外国语大学)

郑咏艳教授(复旦大学)

四、会议时间与地点

会议时间:

2026年10月16-18日(16日报到)

会议地点:

南京师范大学随园校区(南京市宁海路122号)

江苏省外国语言学会理事会将于2026年10月16日晚上20:00开始,地点是随园校区700 号一楼报告厅。 随园校区原则上不允许外来车辆进入,建议参会人员选择公交出行。

五、会议报名

线上报名,有意参会者请于2026年10月10日前通过扫描以下二维码填写报名回执:

六、会议费用

本次年会暨论坛会务费为800元/位(在校研究生400元)。交通费及住宿费自理。参会者可通过线上转账缴费。

转账信息如下:

名称:南京师范大学

账号:320006607010149040493

为了方便后期财务核对发票信息,缴费时请备注:姓名+江苏省外国语言学会第十四届年会。如需发票,在参会人员确定后我们将统一建群,届时会在群里发送文件以便各位填写发票抬头、税号等信息。

七、周边住宿

本次会议不统一安排住宿,参会者可自主预订酒店。会务组结合会场位置,推荐以下酒店供参考,住宿费用自理。

1.全季酒店(南京新街口五台山地铁站店)

地址:江苏南京鼓楼区广州路177号

2.布丁酒店(南京宁海路南师大河海大学店)

地址:江苏南京鼓楼区苏州路17号公寓

八、会务联系

宋老师:13645167935

卞老师:15150646136

张老师:13813901076

会议具体日程将另行通知。热忱欢迎各位专家学者与研究生同学踊跃参会,期待与您相聚六朝古都南京,走进被誉为“东方最美校园”的南京师范大学随园校区,在这座百年学府中交流学术思想、共叙学人情谊。

江苏省外国语言学会

南京师范大学外国语学院

2026年9月

END

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

讲座预告 | Alessandro Panunzi:From Action to Language: Cross-Linguistic Patterns of Event Categorization

2026年9月23日 00:00

2026-09-23 00:00 江苏

南师大外国语学院将举办讲座,Alessandro Panunzi 依托 IMAGACT,探究动作动词与事件范畴化的跨语言模式,结合机器学习开展分析。

活动预告

南京师范大学外国语学院邀请佛罗伦萨大学人文学院副教授Alessandro Panunzi作题为From Action to Language: Cross-Linguistic Patterns of Event Categorization的讲座。讲座将以动作动词为对象,依托 IMAGACT 本体库,探究事件范畴化的跨语言差异,分析语义成分,结合机器学习,兼顾隐喻域应用。

活动安排

  • 时间:2026年9月23日(周三)13:30

  • 地点:南京师范大学(随园校区)700号楼一楼报告厅

主讲人简介

Alessandro Panunzi,语言学博士,佛罗伦萨大学人文学院副教授,并担任数字人文学实验室计算语言学与语言资源方向科研协调人。研究兴趣涵盖认知语义学、计算语言学、人工智能、口语语言分析、语用 - 韵律接口、语料库语言学、临床语言学及多模态研究。

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

报名开启 | “零代码·低成本”进阶实战班——人文大模型的搭建与应用

2026年9月23日 00:00

2026-09-23 00:00 江苏

人文大模型零代码实战班开启报名,多专家授课,实操赋能人文科研教学。

转载自“数字人文专业发展联盟”

2026年第二期

数字人文专业发展联盟 AI+本科教学系列培训

当古籍OCR可以自动识别异体字、当方言语音可以直接转写成文字、当你的文献库能“开口回答问题”,曾经只属于技术团队的能力,今天人文社科教师自己就能动手实现。

不需要写一行代码,不需要买一台GPU服务器。

本期培训由数字人文专业发展联盟与西安培华学院联合推出。6场专题课、3天集中实训,帮助学员快速搭建属于自己的专业级人文大模型平台。

本次培训线上线下同步进行,学员可自选不同班型!

本期主题:人文大模型搭建与应用的完整闭环

本次培训的课程设计遵循如下主线:建模 → 呈现 → 交互 → 资源 → 赋能 → 沉淀。六讲环环相扣,教授学员如何把AI从“聊天工具”变成“科研教学基础设施”。

01

古籍OCR大模型和普通话、方言语音识别大模型的搭建

彭志峰(暨南大学)· 10月16日上午

暨南大学文学院中文系讲师,广东省岭南数字人文实验教学示范中心(省级)副主任,暨南大学-科大讯飞方言语音科技联合实验室(省级)副主任,暨南大学汉语方言研究中心(省级)研究员,粤语语料库建设与大模型评测重点实验室(市级)研究员,研究方向为数字人文与方言智能。

一切从“模型从哪来”开始。基于腾讯云GPU服务器,全程零代码完成环境安装、模型推理、数据创建、参数微调与导出:用DeepSeekOCR2精准识别古籍扫描图像、老旧刻本、手写孤本中的繁体字与异体字,并智能校对错讹;用阿里FunASR实现普通话与方言语音的精准转写,为方言数据库、语音演变研究提供数据支撑。学完本讲,你将拥有自己的第一个专业大模型。

02

人文多模态资源3D叙事的流程、工具与应用

张宁(北京师范大学)· 10月16日下午

北京师范大学文理学院中文系副教授、硕士研究生导师,北京师范大学珠海校区图书馆数字人文中心主任,中国计算机学会(CCF)人文智能专业委员会执行委员。研究方向为古籍数字叙事、VR古籍游戏、数字人文教育等。 主持建设“文献多模态资源AI标注与问答平台”“京师.数字记忆3D展厅平台”“全球数字人文教育资源智能检索平台”。

模型和资源建好了,如何“看得见、传得开”?本讲教师将讲解三维空间框架下整合文本、图像、音视频与三维模型的叙事方法,从资源采集、建模优化到交互发布全流程演示跟练,助你上手生成个人3D叙事作品,同时分享以数字叙事成功申报科研基金的课题架构经验。

03

低代码搭建结合古籍文献的语音交互系统

邵鹏飞(科大讯飞)· 10月17日上午

科大讯飞中级算法工程师,研究方向为中文专业大模型的训练调优、性能加速与效果对齐,语音合成与音视频理解算法的数据研究,构建多语言文本前端处理流程。近年来为国内多所高校搭建中文专业大模型,开讲“中文大语言模型应用AI训练营”十二讲(共有全国近百间高校600多人参与学习),长期维护技术公众号“极地语音工作室”,分享前沿的语音数据处理方案、大模型搭建的工程实践经验。

如何让整理好的文献“被听见、被问到、答得有出处”?沿着“听—知—思—说”四层,教师将现场拆解一个完整系统:语音听清问题,检索古籍原文,依据原文作答并逐句可核验;再用人声把答案念出来,连古文的多音字、破读音都有实用解法。全部操作基于现成开源与云端接口,不涉及模型训练。课后提供完整代码与资源清单,可直接复现。

04

多模态档案资源开发利用的低代码、本地化AI应用实操

夏翠娟(中国人民大学)· 10月17日下午

中国人民大学吴玉章特聘教授,中国人民大学信息资源管理学院数字人文系教授、中国人民大学数字人文研究院副院长。主要研究方向为元数据与知识本体、知识组织与知识表示、关联数据与知识图谱、数字人文与数字记忆、元宇宙与人工智能技术图档案馆博应用、人工智能应用治理。主持国家社会科学基金项目2项,参与国家级科研项目10余项,在国内外学术期刊发表论文100余篇,参与撰编专著5部,担任国家社会科学基金项目评审专家以及国内外多家学术期刊外审专家或编委。

档案馆、图书馆、出版社手头沉睡的多模态资源如何智能化开发?本讲以实操演练方式,带你掌握档案资源向量化表示与低代码本地化智能应用的方法、流程与工具,让机构资源在本地安全可控地“活”起来。

05

腾讯云全场景AI 原生工作台Workbuddy的应用落地

冯津(腾讯云)· 10月18日上午

腾讯云文化传媒行业高级架构师。深耕文化传媒行业十余年,专注人工智能在内容生产、知识服务与文化数字化场景的落地应用。过往主持过多个行业大型项目的架构设计及执行落地,覆盖智能媒资、内容治理、多模态检索与智能体应用等多个方向。近年来致力于零代码、低成本大模型的工程化路径与行业应用结合的场景探索,沉淀形成可复用的建设方法论。

本课教师将教授学员如何把大模型变成日常办公助手。结合教育文化传媒行业真实业务场景,从零代码搭建个人与团队AI工作助手开始,现场完成WorkBuddy安装注册到应用实践全过程,同时兼及介绍CodeBuddy的基本安装方法与使用场景。让AI真正进入你的备课、写作与项目管理。

06

大模型驱动下的语料库构建:从资源加工到检索统计

沈威(华中师范大学)· 10月18日下午

华中师范大学语言与语言教育研究中心副教授,硕士生导师。研究方向为中文信息处理、现代汉语语法。作为主要起草人参与制定国家标准2项,在《中国社会科学报》《汉语学报》《语言研究》等刊物上发表论文40余篇。主持并研发了“当代小说语料库”“汉语复句语料库”“汉语中介语动态语料库”和“我国中小学生写作能力评价与教学策略研究数据库”等语料库。

科研的底座是语料。本讲聚焦大模型辅助的语料库建设全流程:语料的清洗、筛选与格式标准化,检索结果的统计分析与可视化呈现,并提醒你规避幸存者偏差、保证语料样本代表性,让你的AI辅助研究科学、可验证、能发表。

培训基本信息

日程安排

培训对象

  • 高校人文社科类专业教师(文献学、语言学、文学、历史学、档案学等);

  • 有相关科研需求的人文社科类硕博士生;

  • 对数字人文、古籍数字化、智能文献整理有实际需求的科研人员与文化机构从业者。

学员要求:具备基本计算机操作能力,无需编程基础,自带笔记本电脑,课前按照教师要求完成环境搭建;对古籍数字化、智能文献整理有实际应用需求者优先。

联系人

扫码添加工作人员

联系电话:185-1932-5994

费用与优惠

优惠政策(不可叠加,择最优一项适用):

  • 数字人文专业发展联盟成员单位人员报名可享9折优惠(线上、线下班均适用)。

  • 同一单位3人及以上集体报名可享9.5折团报优惠(不限报名身份,线上、线下班均适用)。

  • 学生特惠:减免600元(凭学生证,仅限线上班)。

优惠领取方法:学员正常扫码报名缴费,同时将学生证等电子证明资料及优惠申领说明,连带您的姓名、报名缴费时的注册手机号,发送至training@ancientbooks.cn,工作人员审核处理后,平台将原路退返优惠金额。对公转账或其他方式缴费的学员,请联系工作人员。

缴费方式:籍合学院平台在线支付(支持支付宝、微信);单位集体报名可对公转账,可开具增值税普通发票(培训费)。

退费政策:开班前7天以上申请全额退费;前7—3天退还80%;前3天内不予退还(可转让名额);因主办方原因取消培训全额退还。

餐宿安排:线下班培训期间提供午餐。学员统一入住西安常宁宫园林酒店(历史文化特色酒店,距校区约10分钟车程,培训期间安排接驳),288元/晚(标间含双早),费用自理;学员也可自行安排住宿。交通费自理。

报名方式

扫描二维码在线缴费报名

  • 报名时间:报名从通知发布开始,10月15日截止(线下班额满即止,线上班不设限)

  • 对公转账或需要其他报名方式的学员,请联系工作人员。

  • 报到、线上课等具体安排将在报名确认后另行通知。

证书与后续支持

  • 结业证书:由数字人文专业发展联盟颁发。线下学员获纸质证书(结业仪式现场颁发),线上学员完成听课任务后获电子证书。

  • 社群答疑:建立学员微信群,培训结束后1个月内提供线上答疑,常见问题沉淀为知识库(FAQ),长期分享数字人文领域最新动态与工具更新。

  • 成果汇报:培训结束后,根据学员情况,适时组织线上学习成果交流活动。

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

❌