普通视图

Received before yesterday12 - 南京师大比特人文公众号

LRCH2026语言资源与计算人文研讨会暨语言资源与计算人文专委会第四次全体会议顺利召开

2026年7月7日 00:00

2026-07-07 00:00 江苏

LRCH2026会议召开,交流民族语言资源与计算人文前沿并研讨发展规划。

2026年7月4日至5日,语言资源与计算人文研讨会(LRCH2026)暨语言资源与计算人文专委会第四次全体会议在中国社会科学院民族学与人类学研究所多功能厅召开。本次会议由中国民族语言学会主办,中国社会科学院民族学与人类学研究所、语言资源与计算人文专业委员会、民族语言文化行为实验研究室共同承办,南京师范大学语言大数据与计算人文研究中心协办。来自全国多所高校、科研机构、出版单位及企业的近40位专家学者齐聚一堂,围绕民族语言资源建设与发展规划、专委会学术共同体构建、语言智能与人文计算交叉创新等核心议题展开深入研讨。

开幕式

复盘成果,深耕民族语言智能研究

会议开幕式由中国社会科学院民族学与人类学研究所民族语言文化行为实验研究室主任龙从军研究员主持。会议系统回顾了专委会成立三年来的建设成果,持续搭建高质量学术交流平台,坚持每年举办学术年会,连续开设免费暑期培训班与系列学术讲座,吸引大批青年教师、硕博研究生积极参与;确立资源夯实基础,技术驱动创新的发展方向,推动语言资源建设与计算科学深度融合,主动拥抱人工智能时代的研究范式变革。

中国社会科学院龙从军研究员主持开幕式

致辞环节

直面挑战,共建民族语言数字资源平台

中国社会科学院民族学与人类学研究所丁赛书记强调,各民族语言资源是中华优秀传统文化的重要载体,是国家文化资源的核心组成部分,需以系统科学的方式整理利用多民族语言资源,通过会议机制连接分散研究力量,推动珍贵文献转化为可共享的学术资源。

中国社会科学院民族学与人类学研究所丁赛书记线上致辞

中国民族语言学会黄成龙秘书长指出,当前民族语言研究仍面临资源流失、自主知识体系建设滞后、专业人才缺口等挑战,呼吁学界打破学科壁垒,合力打造国家级民族语言资源公共平台。

中国民族语言学会黄成龙秘书长致辞

与会领导表示,推动语言资源与计算科学、人工智能交叉融合,既是新时代语言文字事业发展的内在要求,也是数字中国建设在人文社科领域的重要实践,希望专委会整合跨学科力量,做实学术成果,打造学术品牌。

随后参会代表观看了民族所的宣传片与民族语言文化行为实验室的宣传片,让与会代表了解了民族所的建设历程、人数规模、研究成果及目标等。

特邀报告

聚焦前沿交叉多领域研究亮点纷呈

本次会议共设8场特邀报告,覆盖民族语言类型学、智能技术应用、古籍数字化整理、评测体系建设、人文计算方法等多个前沿方向,集中呈现了语言资源与计算人文领域的最新研究进展。

中国社会科学院民族学与人类学研究所江荻研究员进行了题为《从量化比较考察蒙古语族及其方言的分类和分区》的主旨报告,以蒙古语族及其方言为研究对象,引入量化比较方法与主坐标分析降维思路,提出三大方言分区新方案,验证了“中部方言”的存在,并结合历史迁徙与语言接触现象解释西部方言内部复杂性,为民族语言谱系研究提供全新量化视角。

中国社会科学院民族学与人类学研究所江荻研究员

作特邀报告

暨南大学范俊军教授汇报了《推动语言学科领域的RAG普及》,聚焦检索增强生成(RAG)技术,针对大模型应用中的语料安全、结果幻觉等痛点,提出建库与分析分离的本地化解决方案,支持普通个人电脑离线处理语料,结合轻量级模型实现精准文献检索。

暨南大学范俊军教授作特邀报告

中国科学院自动化研究所张恒研究员汇报了《文本图像识别方法研究》,分享文本图像识别前沿技术,介绍端到端检测识别一体化、视觉-文本跨模态纠错等方案,并提出适配少数民族语言的增量学习框架,大幅降低小语种模型训练成本。

中国科学院自动化研究所张恒研究员作特邀报告

字节跳动张佳怡作《当古籍遇见AI,当整理遇见协同》主题分享,提出“识典古籍+飞书”双引擎模式,破解规模化协作瓶颈。目前识典古籍平台已上线近6万部古籍,月服务用户超240万人,全链路自动化使整理效率提升5倍以上。飞书依托统一数据权限体系,覆盖语料管理、协同点校等场景。该模式已延伸至藏文《中华大藏经》、蒙古文资源库等民族语言保护场景。

字节跳动张佳怡作特邀报告

邵鹏飞研究员作题为《智能体时代的语言研究新范式思考》的特邀报告。他围绕智能体技术对语言研究带来的变革,从研究流程、技术边界及研究者角色三个维度深入阐释。他提出,智能体技术可串联研究全流程、降低工程化门槛,为低资源语种研究带来新突破,但在语义解释、异常判断及学术责任上仍存在局限,需警惕幻觉风险,坚持人工校验的核心作用,研究者角色也将从工具执行者转向研究流程的设计者。

科大讯飞有限责任公司邵鹏飞研究员作特邀报告

陶扬研究员汇报了《汉字关系分层与汉语数据库的层位》。针对中文数据资源质量参差不齐、编码混乱的问题,他系统阐释了汉字关系分层理论,确立了从底层“流真层”(原始图像)到顶层“规范层”(通用规范字)的五层分级架构,通过异写字-异构字-代表字-规范字的逐级归集,实现不同场景下的字形与语义对齐,为汉语历史语言资源的结构化建设提供了完整理论框架。

中国电子技术标准化研究院陶扬研究员作特邀报告

南京师范大学李斌教授介绍了EvaHan古汉语技术评测体系和系列国际评测,以及五年来在古籍OCR识别、自动标点、词性标注、机器翻译等领域的最新进展。

南京师范大学李斌教授作特邀报告

唐旭日教授作题为《人文计算中的数学建模:以信息熵为例》的特邀报告。他从工程化视角提出数字人文的发展路径,主张将语言研究向“语言工程”转型,强调研究方案的确定性与可重复验证性,通过数学模型量化抽象的人文概念。他结合信息熵在语义演变、国家身份构建等研究中的应用案例,展示了量化方法在人文研究中的应用价值,为数字人文的工程化升级提供了新思路。

华中科技大学唐旭日教授作特邀报告

专题研讨与工作坊

凝聚共识,共话长效发展

特邀报告结束后,会议进入专题研讨环节,全体参会学者围绕专委会数据资源建设、评测赛事规划、协作模式创新等核心议题展开充分讨论。

7月5日上午,会议设置民族语言资源建设工作坊,由龙从军研究员主持。参会学者聚焦各民族语言语音资源的建设成果、现存问题与未来规划展开深度交流,进一步梳理了民族语言资源数字化建设的重点方向与跨机构协作机制。

民族语言资源建设工作坊

闭幕式

总结成果,展望未来

7月5日上午,会议举行闭幕式。龙从军研究员作总结发言,他表示,本次会议既系统复盘了专委会三年建设的经验与成果,也集中呈现了语言资源与计算人文领域的前沿技术与研究突破,进一步凝聚了跨学科、跨机构的研究共识。他指出,民族语言资源建设是兼具文化价值与时代意义的事业,希望专委会全体成员以本次会议为起点,持续深化合作,做实学术成果,共同推动我国民族语言资源数字化转型与计算人文领域的长效发展。

本次研讨会为全国语言资源与计算人文领域的学者搭建了高水平交流平台,进一步夯实了专委会的学术共同体建设,为推动我国民族语言资源保护、数字人文学科交叉融合注入了新的动力。

大会代表合影

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

孙茂松 | 大模型时代中文语料库的破局之路

2026年7月7日 00:00

孙茂松 孔存良 2026-07-07 00:00 江苏

以下文章来源于:语情局

语情局

语言之妙 妙不可言

随着数字化、网络化,尤其是智能化的持续深入发展,数据已成为国家关键战略资源。“十五五”规划纲要提出,“迎接数字时代,激活数据要素潜能,推进网络强国建设,加快建设数字经济、数字社会、数字政府,以数字化转型整体驱动生产方式、生活方式和治理方式变革。”语言资源作为重要的数据资源,对推动学科交叉创新、支撑智能社会构建、维护国家安全及提升国家文化软实力具有深远意义。

中文语料库建设是我国语言资源建设的基础性工作。近日印发的《教育发展“十五五”规划》提出,加强数字中文建设。推进新型国家语料库建设和应用。实施国家关键领域语言科技赋能计划。此外,《教育强国建设规划纲要(2024—2035年)》也提出了“建设新型国家语料库”的任务。《关于加强数字中文建设 推进语言文字信息化发展的意见》要求:“推动基础性语言资源建设,实施国家关键语料库共建共享计划,重点支持建设大规模中文语料库。”

语料库建设是一个“老”话题,英文语料库建设可回溯至20世纪60年代。中文语料库建设比英文晚了大约20年。那么,当人工智能发展到大模型时代,语料库建设呈现哪些新的特点?面临哪些主要挑战?又应该有哪些应对之策?这些基本问题都需要我们认真思索并回答。

语料库建设走过的路程

语料库建设的“初心”是面向语言教学和研究,同时面向自然语言处理技术研发。在其发展过程中,始终强调两点:一个是语料库的“大规模”,另一个是对大规模“生”语料库的“精加工”。

20世纪60年代,美国布朗大学建立了约100万词的BROWN语料库;70年代,英国兰卡斯特大学、挪威奥斯陆大学和卑尔根大学联合建立了规模相近的LOB语料库。

1995年,规模达1亿词的英国国家语料库(The British National Corpus, BNC)面世,其中书面语文本9000万词次,口语文本1000万词次。这在当时绝对属于名副其实的“大规模”了。早期语料库通常只进行词语切分、词性标注等基本加工。

90年代初,美国宾夕法尼亚大学构建的宾州树库(Penn Treebank, PTB)对300万词英语句子进行了深层次加工——句法标注,随后又构建了首个中文树库(Chinese Treebank, CTB),规模为10万词。

至2016年,CTB 9.0完成了200万词中文语料的标注。

2014年,斯坦福大学提出通用依存句法标注方案(Universal Dependency, UD),试图以统一标注规范对全世界任何语言标注依存句法结构。

据其官网统计,目前已完成逾3700万词的加工,涵盖186种语言。“精加工”多倚重人工完成,因此通常是浩繁的工程。

我国自20世纪80年代前后启动中文语料库建设,基本上是参照国外上述“大规模”及“精加工”的路数来做。部分具有代表性的语料库建设成果包括:北京大学基于《人民日报》构建的现代汉语标注语料库,规模约2700万字,进行了分词、词性、专有名词、多音词等标注;国家语委牵头建设的现代汉语通用平衡语料库,规模约1亿字,其中5000万字经分词和词性标注;北京语言大学BCC语料库(Beijing Language and Culture University Corpus Center),规模约62亿字,覆盖报刊、微博等载体和文学、科技等领域,并进行了适当加工。

2010年起,人工智能进入石破天惊的深度学习时代,并在2020年前后快速推进至大模型时代。语料库在大模型发展中起着关键作用,已演变为支撑人工智能基本能力迭代并迈向通用人工智能的核心要素。毫不夸张地说,没有语料库就没有语言大模型。在大模型时代,语料库建设的内涵和外延都发生了急剧变化,如对大规模“生”语料库的需求呈爆炸式上升,以人工标注手段为主的语言“精加工”则从语料库建设的主导地位退居至“不太起眼”的位置。

新型语料库建设的基本特点

第一,规模极其浩大。2020年,美国开放人工智能研究中心(OpenAI)提出语言大模型的规模法则(Scaling Law),指出模型的训练损失随数据的指数级增加而线性下降。在此驱动下,训练用“生”语料库规模大到无所不用其极。如2020年ChatGPT-3训练语料库约含3000亿词;至2025年,DeepSeek-V3的训练语料库已达约14.8万亿词。典型的开源语料库如C4(约1750亿词)、The Pile(约2000亿词)、RedPajama(约1.2万亿词)等,其规模与传统语料库相比有天壤之别。值得注意的是,传统语料库由于规模限制需要均衡采样,新型语料库则致力于收录“全空间高质量”内容。

第二,范围极其广博。传统语料库多集中于新闻、文学作品等典型类型,新型语料库则广泛纳入网页、杂志、百科全书、科技图书、学术期刊、辞典乃至代码等多源类型,如维基百科、ArXiv等平台的开放获取论文和GitHub等平台的代码数据等。

第三,语言极其多样。传统语料库多以单语或双语为主,新型语料库则试图打通所有语言,构建覆盖数以百种语言的多语言语料库,如CC100、mC4、OSCAR等。Meta发表于《自然》杂志的NLLB项目,构建了涵盖200多种语言、规模约450GB的多语语料。此外,古籍、方言、手语、盲文等特殊语言类型,也会一定程度上被新型语料库所收录。

第四,模态极其丰富。以文本模态为枢轴,将声、图、视频等相关模态数据对齐、融通,形成多模态语料库。近年来,图文对齐数据发展尤其迅速,如OpenAI的CLIP语料库含4亿图文对,LAION-5B多达58.5亿对,DataComp更扩展至128亿对。语音文本对齐数据规模也持续增长,如WaveCaps含约40万语音—文本对、VSDial-CN含约120万对等。视频作为融合文本、语音、图像的复合媒介也备受关注,如WebVid含1000万视频—文本对,VTP含2700万对。这些多模态数据构成了新型语料库的生力军,赋予人工智能多角度理解、“生成”大千世界的能力。

第五,加工极其专精。针对大模型训练的各类新型数据被不断构造出来,如文本问答数据集、图文问答数据集、大规模指令数据集等。此外,从浩瀚无比的语料库中筛选出高质量语料,对大模型训练越来越重要,同时极具难度,需要研发相关的数据治理技术。借重大模型技术构造大规模合成数据也成为常态。

中文语料库建设的主要挑战

上述特点为大模型时代中文语料库设计指明了方向。建设规模浩大、范围广博、语言多样、模态丰富、加工专精的中文语料库体系,理应成为推动我国人工智能发展、赋能智能社会建设的基础性工程。显然,这个工程极其艰巨。我们将主要面临来自数据供给、体系构建与合规治理三方面的严峻挑战。

一是中文语料相对匮乏。当前,主流开源语料库仍以英文为主。据阿里研究院《大模型训练数据白皮书》,全球网站英文内容占比约59.8%,中文内容仅占约1.3%,差距悬殊。在大模型训练广泛使用的Common Crawl网页语料库中,中文占比也仅为约4.8%。

二是中文语料库体系远未建立。面向大模型时代的“全空间高质量”中文语料库体系尚处于雏形。如中文百科全书、科技图书、学术期刊、辞典等高知识密度的语料在现有中文语料库中几乎难觅踪迹,高质量的多模态数据也十分稀缺。

三是数据治理机制亟待完善。当前语料数据治理仍较为粗放,缺乏顶层设计。具体表现为三点:第一,版权保护与数据共享难以平衡。图书、辞典、影视作品等是天然的高质量语料,理应成为国家语料库的重要组成部分。然而,其合规共享面临版权保护壁垒,国际上已有相关纠纷案例。例如,Anthropic公司在训练Claude模型时因不当使用版权数据,向作者及出版商支付了高达15亿美元的和解金。第二,标准缺失导致“数据孤岛”。各单位加工的语言数据格式不一、质量参差,阻碍了数据要素的流通与协同利用。第三,隐私与安全风险突出。在数据采集、加工和训练过程中,如何有效防范信息泄露,确保内容符合伦理与价值规范,是语料库建设中必须严守的安全底线。

上述挑战都是全局性的、深层次的。应该采取怎样的应对之策?需要我们知难而上、持续探索

中文语料库的建设路径

一是拓宽数据来源,突破数据供给瓶颈。系统推进出版物、古籍文献、地方志、历史档案等优质线下资源的数字化转化,激活存量语言资源。大力发展数据合成与增强技术,实现数据规模的跃升。

二是完善体系设计,整合全空间高质量数据。系统规划中文语料库的整体架构,重点推动图书、辞典、影视作品等高质量数据入库。同时,拓展多模态数据的来源与形态,鼓励各级图书馆、博物馆采集音频、图像、视频等多模态数据。此外,将方言、少数民族语言、手语、盲文等纳入建设范畴。

三是创新版权机制,整合关键语言资源。由国家相关部门牵头,探索建立关键语料的授权使用机制。依法合规构建解决了版权问题的国家关键语料资源。建立分级开放机制:基础共性数据向社会开源,高价值专业数据实行授权使用,保障建设者权益,形成可持续生态。

四是推动标准建设,强化全流程治理。加快制定国家或行业层面的语料采集、清洗、标注、质检与交换标准,打破“数据孤岛”。研发高效、智能、可复用的数据处理工具链。同时建立覆盖数据全生命周期的治理框架,明确隐私保护、安全审核、伦理审查等环节的责任与流程,筑牢语料库建设的安全底线。

大数据时代中文语料库的建设具有高度的紧迫性,但又难以一蹴而就。不行不至,行于当行。相信通过坚持不懈的群策群力、攻坚克难,中文语料库建设的新格局将逐渐形成,从而对我国人工智能的发展作出历史性的新贡献。


作者:孙茂松 孔存良,分别系清华大学教授、助理研究员

图片:光明图片/视觉中国

编辑:覃冬宇

阅读原文

跳转微信打开

筑牢规范标准根基 释放数字中文价值

2026年7月6日 00:00

2026-07-06 00:00 江苏

我国语言资源建设成果丰硕,但标准滞后,需完善标准体系破局。

本文来源:光明日报2026-07-05

随着生成式人工智能掀起新一轮科技浪潮,语言作为数据要素与文明载体的双重价值日益凸显。我国学者20世纪就提出了语言资源的学术概念,并在教学、科研和行业中加以实践。历经数十载耕耘,语言资源建设已取得斐然成就。目前,我国已建成世界上最大规模的语言资源库和中国语言资源知识图谱。从服务于语言研究和语言教学的数十亿字语料库,到支撑千亿参数大模型训练的超大规模中文数据集;从静态文本采集,到动态、多模态、深标注的综合性资源平台,语言资源完成了从学术“象牙塔”到产业“新石油”的蝶变,为提升国家语言能力、繁荣数字经济和推动数字中国建设提供了坚实基础。

物质因可用而稀缺,因稀缺而交换,进而具有了资源属性。大规模交换催生了对规范标准的需求,语言资源亦不例外。语言规范标准为语言资源建设提供了统一的前置约束与基础框架,确保了资源在形式、结构和描述上的一致性。这种一致性是实现语言资源高质量集成、互操作与可持续利用的基础保障。我国已发布百余项国家通用语言文字和民族语言文字信息化规范标准,为自然语言处理技术在人工智能、数字产品和信息产业领域的应用创新奠定了规范基础。相比于语言资源研究、实践和行业的快速发展,规范标准与法规的建设仍显滞后,这已成为制约语言资源建设和数字中文健康可持续发展的重要瓶颈,具体表现在以下三个方面。

一是技术迭代与标准缺位的矛盾,导致“数据孤岛”与“质量迷雾”。当前,语言资源呈爆炸式增长,但其建设仍处于“野蛮生长”阶段。各类资源在字符编码、元数据描述、接口协议与质量评估等方面缺乏统一标准,致使资源难以互联互通,形成众多“数据孤岛”,宝贵的数据要素无法在更大范围内有序流通和高效利用。生成式人工智能对海量语料的依赖,更使得语料准确性、文化适配性与伦理合规性缺乏标准评估的问题十分尖锐。缺乏高质量、“干净”的数据“燃料”,不仅制约大模型性能的进一步提升,更潜藏放大算法偏见、引起价值误导的风险。这从源头制约了人工智能的健康发展,限制了中文在数智时代生产要素价值的释放。

二是产业发展与治理盲区的矛盾,引发“无序竞争”与“权属风险”。语言数据产业活力充沛,但因数据权属、流通交易、安全隐私、伦理审查等规则不明,易陷入无序竞争,也使得数据作为生产要素的价值难以通过规范市场充分释放。在全球数字竞争中,中文语言字符编码、语义标注、多模态融合等基础标准的滞后,直接关系到国家文化安全、数据主权和标准主导权。若核心标准受制于人,将在全球数字治理中陷入被动,阻碍中华文化在数字空间的传播力。

三是学科融合与人才断层的矛盾,凸显供需困境。语言资源建设是文、理、工深度交叉的一个领域。高质量语言资源建设急需既精通语言学基本原理、懂得数据工程技术、掌握人工智能工具,还具备法规伦理意识的复合型人才。大规模数据工程也要求从业者在伦理、工具、意识上达到一定标准。近年来,关于“谁是可用人才”“如何培养人才”的讨论广泛而深入,但仍存在考核缺乏标准、高级人才培养欠规范等问题。职业院校、高校、科研院所和企业都在努力“各自发明”对语料库人才、语言资源人才的定义与培养方案,许多规划难以落地。

直面上述挑战,我们需要将加强规范标准与法规体系建设作为破局的核心抓手,为语言资源的开发、利用与治理立规立矩,护航赋能。

其一,坚持规划引领,构建前瞻协同的标准体系框架。应紧扣《关于加强数字中文建设 推进语言文字信息化发展的意见》要求,进行顶层设计与系统规划。重点围绕“资源数字化转化”“生成式资源质量与安全评估”“资源治理与赋能应用”等任务,加快研制覆盖字符编码、元数据、语义标注、质量评估、接口协议、权属界定等关键环节的标准规范,形成一套逻辑清晰、相互支撑的标准体系,筑牢数据质量底线。

其二,聚焦应用场景,以标准赋能产业升级与文化传播。标准体系建设需坚持需求导向,优先瞄准智慧教育、数字文博、无障碍服务、网络内容生态等领域,研制急需的应用标准。通过标准引领,促进语言资源的高效流通与高质量利用,赋能人工智能技术创新和数字文化产业升级,最终确保“中文在全球数字空间和人工智能关键应用场景中的使用占比显著提高”的目标得以实现。

其三,推动跨界融合,培育高水平的复合型人才队伍。打破学科与行业壁垒,创新“语言+人工智能+治理”的复合型人才培养模式。鼓励职业院校和高校设立交叉学科,支持产学研联合培养。同时,探索建立语言资源建设相关从业人员的能力标准与评价体系,为国家关键语言语料基础设施的“新基建”提供坚实人才保障,以期缓解人才供需脱节问题。

规范标准体系是数字中文建设的基础工程,是激活语言资源数据要素价值、护航其安全高效流通的制度保障。面对技术迭代加速、应用场景深化和国际竞争加剧的新形势,亟待构建系统完备、科学规范、运行高效的语言资源标准体系。这不仅是破除数据壁垒、提升资源质量、优化学科生态的技术路径,更是强化数据主权、维护文化安全、提升国际话语权的战略举措,也是推动我国由“语言资源大国”迈向“语言资源强国”的关键举措。以标准建设引领发展方向、以规范治理夯实应用根基,方能使中文语言资源在技术赋能与人文传承的双重任务中释放更大价值。

(作者:饶高琦,系北京语言大学副研究员)

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

刘培俊:为青少年搭起阅读的阶梯

2026年7月5日 07:00

2026-07-05 07:00 江苏

解读青少年阅读素养框架,构建三维模型,分阶梯并融入智能阅读。

来源:《人民日报》2026-07-03

青少年是祖国的未来,民族的希望,青少年阅读是全民阅读的重中之重。从小具备扎实的阅读素养,事关终身学习与一生成长。但如何才能让青少年阅读素养逐步提升,常常令人困扰。读的书太容易,进步缓慢,太难,又易有挫败感;内容太窄,视野打不开,太泛,又缺乏深度;都说边读边思、循序渐进,但到底该沿着什么样的路径,才能实现素养的阶梯递进?这就需要科学引导。 

不久前,教育部印发《中国青少年阅读素养框架》(以下简称《框架》),便迎向这一问题,通过确立青少年阅读素养的框架结构、指标体系与进阶路径,为跨学段、系统化的阅读素养培养提供专业支撑,引导青少年阅读素养自我进阶,推动教育教学及阅读资源建设等相关工作。 

《框架》紧扣提高青少年阅读素养发展需求,在理论研究与实证调研的基础上,创建了“知识—能力—价值”三维阅读素养模型。该模型是一个内在关联、动态循环、螺旋上升的有机整体,深刻体现了“知、行、信”融合的育人理念:以阅读之“知”奠基,以阅读之“行”践履,最终升华为稳定的阅读之“信”。其中,阅读知识是阅读素养的基石,旨在解决“用什么读”的问题;阅读能力是阅读素养的内核,旨在解决“会不会读”的问题;阅读价值是阅读素养的灵魂,旨在解决“爱不爱读”与“为何而读”的深层问题。以知导行、以行促信、以信励知,共同推动阅读行为从工具层面提升至人格塑造与精神成长的高度。 

《框架》将阅读素养指标分为4个阶段12个梯级,形成大中小学一体化的阅读素养发展图谱,为全学段衔接、全学科育人提供清晰的路线图。具体而言,基础认读阶段,以慢读、朗读为主,夯实理解根基;拓展理解阶段,以速读、默读为主,提升信息处理能力;深化评鉴阶段,以精读、研读为主,培育科学思维;融通创新阶段,以研究性阅读、创造性阅读为主,实现学以致用。 

通过《框架》,可以深切感受到,阅读素养是立体多维、循序渐进的。以阅读能力为例,既有理解性阅读能力,指读者从文本的字词、语句和语篇里提取信息,并结合自身经验建构意义的能力;也有评鉴性阅读能力,侧重对文本的内容、形式、逻辑等进行审美欣赏、理性审视和价值判断的能力;还有创造性阅读能力,凸显将阅读所得应用于具体情境,解决问题、提出新思路或新方法的能力。《框架》还创造性提出“阅读认同”的概念,强调读者在阅读中产生的持续的内在动力与稳定的读者身份归属感。从最初阶段的“认识到阅读是有意思的事,对阅读产生亲近感”,到较高阶段的认识到阅读是有意义的事,“将阅读与修身、求知、济世的追求深度融合,通过阅读不断充盈生命、厚植文化自信”,让青少年和社会大众在更深层次、更开阔的视野里来认识阅读的价值与意义。 

古往今来,“读书破万卷,下笔如有神”常被用来形容深入阅读后文思泉涌的状态。然而,这样的状态正面临来自人工智能的挑战。大语言模型可以“秒读”万卷书,常现神来笔,刷新了数千年来人们关于阅读的认知。《框架》着力顺应这一时代趋势,引导青少年运用人工智能工具辅助阅读,将智慧阅读能力细化融入教育体系和评价范畴,使其逐步掌握有效的人机协作阅读方法。 

青少年阅读,需要科学的理念指引、规范的标准指导、阶梯的行动指南。“徒法不足以自行”,让我们携手从“爱读书、读好书、善读书”出发,落实《全民阅读促进条例》,推进《框架》实施,为提升青少年阅读素养提供参照,为构建阅读教育体系提供依据,为优质读物出版与选择提供参考,为校家社协同育人提供框架,赋能青少年全面发展、健康成长。 

 (作者为教育部语言文字信息管理司司长) 

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

好文推荐丨孙傲、袁毓林:离合词离散形式的加工机制——来自 ERP 实验的证据

2026年7月3日 00:00

徐惠 2026-07-03 00:00 江苏

文章介绍古籍数字化项目,阐述资源建设、技术应用与发展前景。

本文原载于《语言科学》2026年第2期

离合词离散形式的加工机制——来自 ERP 实验的证据

孙傲   袁毓林

 《语言科学》 2026年第2期

 关键词:离合词;ERP;词汇工具包;形式转喻

提要

       文章通过两个脑电实验,分别考察了离合词合用与分用两种情况下的加工反应。实验结果显示,在孤立加工时,离合词同复合词、动宾短语诱发的脑电反应不具有显著差异;在加工离散状态下的离合词时,包含类离合词的句子诱发了更大波幅的 N400 成分,三类句子诱发的 P600 成分不具有显著差异。文章认为,在离合词的词汇知识中,存在离用与合用两种形态。在加工离合词句时,可以直接利用离散形式的结构知识进行加工。类离合词句的预期性低,但是仍可调用离合词的词汇知识,实现对结构的加工。实验结果表明,离散形式的生成与加工可能并不涉及复杂的句法推导过程,而是直接经过形式转喻,套用粘合式动宾结构的各类扩展模式。这使得句法加工过程更为便利。

论文全文

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

7月1日起|两项人工智能语言文字规范标准正式实施

2026年7月2日 00:00

语标智研 2026-07-02 00:00 江苏

以下文章来源于:语标智研

语标智研

立足语言规范标准,服务语言智能发展

2026年7月1日,《机器合成普通话水平测评等级标准及测评大纲》(GF0030—2026)和《人工智能 语料库 基础术语》(GF0031—2026)正式实施。

在庆祝中国共产党成立105周年之际,人工智能语言文字标准化建设迎来新的重要节点。2026年7月1日,《机器合成普通话水平测评等级标准及测评大纲》(GF0030—2026)《人工智能 语料库 基础术语》(GF0031—2026)正式实施。

这标志着我国在机器语音测评标准化与人工智能语料库基础概念体系建设方面,迈出了具有基础性意义的一步。

图片

一、两项规范正式实施

GF0030-2026《机器合成普通话水平测评等级标准及测评大纲》

该规范面向“机器合成语音的评价需求,系统构建了:

  • 机器合成普通话水平等级体系

  • 面向多维度语音质量的测评框架

  • 与实际应用场景相适配的测评实施路径

它为合成语音系统的规范化评价提供了统一尺度,也为智能语音技术发展中的可测、可评、可比奠定基础。

GF0031-2026《人工智能 语料库 基础术语》

该规范从基础概念入手,对人工智能语料库相关核心术语进行了规范界定,主要涵盖:

  • 语料库构建与管理相关术语

  • 数据处理与标注相关概念

  • 面向人工智能应用的基础术语体系

通过统一术语表达,为后续语料库建设、评测体系设计及行业协同提供了重要语言基础。

购书链接

语文出版社:

扫描下方二维码购书

↓↓↓

图片

图片

二、为什么是“今天”

今天,是中国共产党成立105周年纪念日,也是两项人工智能语言文字规范标准正式实施的日子。

标准规范的价值,不仅在于“发布”,更在于“实施”。自今日起,两项规范正式进入应用阶段,意味着:

  • 相关科研与工程实践有了统一依据;

  • 智能语音与语料库建设有了可操作、可遵循的规范;

  • 行业评价与数据治理迈向更加标准化、规范化的发展路径。

从规范发布到正式实施,是规范从文本走向实践、从制度设计走向实际应用的关键一步。值此中国共产党成立105周年之际,两项规范正式实施,既是我国语言文字规范化建设持续推进的重要成果,也是服务人工智能创新发展、夯实语言资源基础设施的具体实践。

三、面向智能时代的基础设施

 在人工智能快速发展的背景下:
  • 语音合成系统不断迭代

  • 大模型语料需求持续增长

  • 数据质量与评价体系成为核心瓶颈

两项规范的同步实施,本质上是在补齐两类基础设施:

  • 评价基础设施(测评标准) 

  • 数据基础设施(术语体系) 

为后续智能语言技术的发展提供更稳定的底座支撑。

标准规范的意义,在于让复杂系统有共同语言,让多元实践有统一尺度。

今天起,这两项规范正式进入实施阶段,也意味着我国在人工智能语言资源与智能语音评价体系建设方面又向前迈出了坚实一步。面向未来,标准规范的生命力将在应用中不断彰显,也将在技术迭代和实践创新中持续完善。

值此中国共产党成立105周年之际,祝愿伟大的中国共产党永葆生机、再创辉煌!我们也将坚持以高质量标准支撑高质量发展,为推进国家语言文字事业和人工智能技术创新贡献标准力量。

阅读原文

跳转微信打开

人工智能时代南方语言数据建设研讨会在暨南大学举行

2026年7月1日 00:00

2026-07-01 00:00 江苏

2026年6月27日至28日,人工智能时代南方语言数据建设研讨会暨南大学石牌校区顺利召开。本次研讨会由暨南大学文学院城镇民族社会语言服务与教育研究中心主办,来自中国社会科学院、中山大学、北京师范大学、云南民族大学、昆明理工大学、江苏师范大学、西南民族大学、贵州大学、吉首大学、黔南民族师范学院、楚雄师范学院、贺州学院、怀化学院、德宏傣族景颇族自治州融媒体中心、广东技术师范大学、广东人民出版社、惠州民族文化传习馆、世界图书出版公司广东公司等国内多所高校及科研机构、媒体机构、出版单位共40余位专家学者参加了研讨会。

01

开幕式及第一场主题报告会

6月27日上午在暨南大学第二文科楼郁文报告厅举行开幕式和第一场主题报告会。暨南大学社科处唐攀副处长、文学院魏霞书记、广东人民出版社严耀峰主任致辞。强调会议将围绕国务院《关于深入实施“人工智能+”行动的意见》,探讨“人工智能+”科学技术:加速科学发现进程、驱动技术研发模式创新和效能提升、创新哲学社会科学研究方法,为南方语言数据建设提供技术路径与理论支撑。

主题报告会由暨南大学邵宜、侯兴泉教授主持。中国社会科学院民族学与人类学研究所江荻研究员提出了基于语言词汇数据的少数民族语言语族语系自动分区分类方法。中国社会科学院语言研究所李蓝研究员呼吁建立适配AI时代的语言学研究新范式。云南民族大学杨光远教授以《华夷译语》古文献为例,阐述了德宏傣语的历史特征与演变脉络。怀化学院龙耀宏教授阐述了侗语词汇的音变别义系统。贺州学院邓玉荣教授对贺州语言文化博物馆十年建设历程进行了总结回顾。云南民族大学刘劲荣教授以拉祜语为例,系统阐述了境外调查和研究跨境分布语言的理论、方法和实践。

02

分组学术报告

6月27日下午在第一文科楼同步进行分组学术报告。

第一组由覃丽赢、宋成副教授主持,龙润田、宋成、王印娟、杨相洼、覃丽赢、赵亚先、刘宇亮、郭承禹和彭志峰等学者先后作分组报告,议题涉及汉字系南方民族文字识别及其数据库建设、AI时代无文字濒危语言文化调查记录和传承传播、布依语多模态语料库建设与低资源语言AI数据基础建构、新媒体背景下民族语文翻译、滇西北独龙语植物命名与分类、土瑶勉语传统生态知识调查记录、资源县方言语音地理研究、通道侗族群体普通话声调跨代际变异及其社会动因、粤语大模型评测数据集建构及开发应用。

第二组由鲁国贵、梁锋副教授主持。鲁国贵、肖自辉、马海布吉、梁锋、刘宗艳、沐华、岳扎丫、排爱翁和余红富等学者先后作了学术研究报告,涉及民俗语言、海外汉语方言语义知识库、彝语多模态语言数据库、山江苗歌的类型和语言格律、贺州语言文化博物馆语料库建设、楚雄彝族支系及语言分布、文化语境对景颇语汉语翻译的影响及应对策略、景颇族载瓦语礼貌用语、新闻标题语言风格及其应用技巧,等等。

03

第二场主题报告会

6月28日上午举行第二场主题报告会,由暨南大学邱婧教授、肖自辉副教授主持。中国社会科学民族学与人类学研究所龙从军研究员阐述了少数民族文字文本识别数据集与模型的最新研发进展。广东技术师范大学符昌忠教授探讨中国语言学研究的人类学转向及其文明探源意义。黔南民族师范学院蒙耀远教授阐述了新时代背景下的水书研究困境及出路。中山大学邵明园教授介绍藏语安多方言自然口语语料的采集标注和语料库建设的理论研究和实践经验。中国科学院软件研究所刘汇丹高级工程师强调语言资源建设需要严格对标国家标准,保障数据通用性与可持续性,才能使语言资源发挥最大的效用。暨南大学刘新中教授结合数智化技术重新提炼广州话音系,为方言本体研究提供新方法。

04

闭幕式

研讨会闭幕式由暨南大学范俊军教授主持。分组讨论会代表首先进行了总结汇报。最后范俊军教授作总结发言,他指出:我国少数民族语言和汉语方言领域,老辈学者在田野调查方面形成了奠定了很好理论和实践基础,年轻学者应继承和发扬光大;同时本土语言学研究也要与时俱进,在人工智能时代应充分利用AI助力语言科学研究;目前的紧要任务是本土语言学者从个人做起,将田野调查积累的大量语料以及个人学术研究成果,进行规范化、标准化和数据化,建立人工智能可用的我国语言学知识数据体系,促进“人工智能+”在我国语言学领域的真正落地。

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

南师大计算语言学团队赴鲁东大学参加CLSW会议

2026年6月30日 23:06

陈晓安 徐惠 2026-06-30 23:06 江苏

南师大计算语言学团队数字人文兴趣小组赴CLSW会议汇报多项计算语言与数字人文研究成果。

2026年6月26日至28日,第27届汉语词汇语义学国际研讨会(CLSW)在鲁东大学举行。6月27日上午,大会正式开幕。会议吸引了来自鲁东大学、北京大学、北京师范大学、南京师范大学等高校,以及韩国、越南等国家和地区的专家学者、青年教师、研究生参会。参会代表围绕汉语词汇语义学、计算语言学、语言资源建设及人工智能语言技术等热点议题展开深入交流,共同探讨学科发展的最新成果与未来方向。

南京师范大学计算语言学团队数字人文兴趣小组一行5人赴会,与来自国内外高校和科研机构的专家学者共同开展学术交流。

南京师范大学计算语言学团队数字人文兴趣小组

6月27日下午,南京师范大学计算语言学团队在分会场分别进行了多项学术成果汇报。其中,博士研究生郑峥作题为《生成式大模型驱动的英汉双语语块挖掘与分布特征分析》的报告介绍了采用经指令微调的大模型,在双语语料上实现语块抽取的研究工作;硕士研究生陈晓安作题为《越南语WordNet名词库的建设方法》的大会报告,介绍了越南语WordNet名词库的构建思路、技术路线及研究进展本科生卢欣和颜铃铃则分别汇报了《古汉语WordNet中并列复合词的标注规范——以魏晋时期词网分库建设为例》与《〈诗经〉酒文化计量研究》。前聚焦古汉语词网的标注规范,后者运用计量方法解读文学经典。四场报告充分展示了团队在计算语言学及数字人文领域的最新研究进展。

博士研究生郑峥:

《生成式大模型驱动的英汉双语语块挖掘与分布特征分析》

硕士研究生(越南)陈晓安:

《越南语WordNet名词库的建设方法》

本科生卢欣:《古汉语WordNet中并列复合词的

标注规范——以魏晋时期词网分库建设为例》

本科生颜铃铃:《〈诗经〉酒文化计量研究》

6月28日上午,团队还展出了题为《世界语言分布的可视化表达——世界语言地图数据库的结构与分析》的海报论文。博士研究生方灿灿围绕团队多类型的世界语言数据库的整体架构、语言数据的多维信息结构及三维地球仪和二维平面地图等可视化交互方式研究工作,与参会专家、学者进行了深入的交流与互动,为后续研究工作提供了重要参考。

博士研究生方灿灿介绍海报:《世界语言分布的

可视化表达——世界语言地图数据库的结构与分析》

此次参会不仅加强了南京师范大学计算语言学团队与国内外同行之间的学术交流,也进一步提升了团队的学术影响力,为今后开展推进语言资源建设与人工智能语言研究奠定了良好基础。团队成员表示,将继续立足学术前沿,深化计算语言学与数字人文研究,为语言智能技术的发展贡献更多力量。

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

第27届汉语词汇语义学学术研讨会在鲁东大学举行

2026年6月30日 23:06

徐惠 2026-06-30 23:06 江苏

CLSW2026在鲁东大学举办,海内外学者研讨词汇语义学前沿。

转载自“鲁东大学人文学院”

6月26日-28日,第27届汉语词汇语义学学术研讨会(CLSW2026)在我校举行。本届会议由我校主办,人文学院、区域国别学院、国际教育学院、汉语辞书研究中心承办,中文与东方语言信息处理学会(COLIPS)协办。我校副校长纪洪芳教授出席会议,来自北京大学、清华大学、中国人民大学、香港理工大学、澳门大学、美国俄勒冈大学、韩国釜山大学等海内外高校及科研机构的150余名专家学者参会。

纪洪芳代表学校向海内外专家学者莅临我校表示热烈欢迎。她表示,大语言模型快速发展背景下,词汇语义学是连通传统语言学与数字人文、人工智能的重要桥梁,期待与会专家围绕学科前沿深入交流、互鉴互启,成就一场美美与共的学术盛宴。

本届会议主席、国际计算语言学委员会(ICCL)首位华人终身委员、香港理工大学黄居仁教授指出,当前大语言模型的迅猛发展为语言研究提供了难得的历史机遇,以词汇语义学为基点,将不同领域进行整合,将是未来研究的重要方向,希望中青年学者能在本次会议中相互砥砺,彼此启发,碰撞出璀璨的思想火花。

黄居仁教授,北京大学董秀芳教授,美国俄勒冈大学井茁教授,北京语言大学于东教授,韩国釜山大学许喆研究员,鲁东大学亢世勇教授、冯海霞教授等7位专家学者作大会特邀报告,中国人民大学董正存教授、西南财经大学熊佳娟教授、中央民族大学曾立英教授、华中师范大学刘彬教授进行了集中报告。会议还设有5个分会场、1个海报展示会场,以及MDPI国际学术出版交流专场,与会学者围绕汉语词汇语义本体和应用研究、汉语词汇语义资源建设与研究方法、汉语词汇语义的计算方法与应用、汉语词汇语义交叉学科研究与应用等主题分享最新成果,展开热烈交流。

本届会议聚焦数智时代汉语词汇语义学发展议题,搭建起海内外多学科协同创新的高水平学术平台,对进一步提升我校语言学学科的国际影响力具有积极意义。

撰稿 | 荚凤来

编辑 | 高佳琪

初审 | 戴宗杰

复审 | 李连伟

终审 | 冯海霞

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

新书福利|李斌等著《从句法树到语义图——中文抽象语义表示与计算》

2026年6月28日 22:22

俊阳 俊洁 2026-06-28 22:22 江苏

句子语义描写与自动分析新作,文末有福利!

1. 内容简介

在大语言模型飞速发展的今天,自然语言处理技术已广泛渗透到社会生活的方方面面。然而,机器对语言的理解仍停留在表层形式层面,难以真正把握语言背后的深层逻辑语义,这成为制约人工智能向更高水平发展的核心瓶颈。在此背景下,由南京师范大学李斌教授团队撰写、科学出版社出版的《从句法树到语义图——中文抽象语义表示与计算》一书,系统构建了中文抽象语义表示的理论体系与技术框架,为破解中文语义理解难题提供了重要的解决方案。

中文作为世界上最古老、最复杂的语言之一,具有无形态变化、语序灵活、语义隐含等显著特点,其语义形式化研究一直是国际计算语言学界的难点。长期以来,中文语义计算多借鉴英文体系,难以适配中文独特的语言现象,导致兼语、连动、省略、构式等问题始终无法得到有效解决。本书针对这一现状,聚焦深层语义表示与智能化计算核心命题,在借鉴英文 AMR 标注体系的基础上,采用图结构解决汉语论元共享难题,对省略、重叠、疑问、明喻等传统方法难以处理的语言现象进行了系统的语义还原描写,构建了适配中文且具有普适性的语义结构理论框架与标注规范。

全书共 40万字,兼具理论原创性与工程实用性,从理论、资源、技术三个维度全面展现了中文抽象语义表示研究十年来的研究成果。在理论层面,系统阐述了中文抽象语义表示的基本原理、设计思想与标注方法;在资源建设层面,详细介绍了2万多句大规模中文 AMR 语料库的构建过程,并对非投影结构、虚词、一句多问等语言现象开展了细致的计量分析;在技术应用层面,深入探讨了语义自动分析模型,重点研究了大语言模型下的中文语义解析、推理与评测算法,为语义技术的落地应用提供了清晰的实践路径。

例1. 标注语料样例(图结构)

例2. 明喻的表层语义图和深层语义图

本书是国内首部系统介绍中文抽象语义表示与计算的学术专著,凝聚了作者团队十余年的研究心血。团队长期致力于语料库语言学、计算语言学与数字人文研究,制定了国内首个中文 AMR 标注规范,建立了规模最大的中文 AMR 语料库,2020-2025年连续举办了五届国内外自动语义解析评测竞赛,推动CAMR解析效果从60%左右提高到80%以上,为中文语义计算领域的发展作出了重要贡献。

本书可作为高校语言学、计算语言学、人工智能等专业的教学参考书,也可供自然语言处理研发人员、相关领域科研工作者参考。它的出版不仅填补了汉语句子语义形式化研究的空白,更为中文深层语义计算提供了系统化的理论框架与实践路径,将有力推动我国语言智能技术的发展,为国家数字中文建设与文化数字化战略提供坚实的学术支撑。

2. 袁毓林教授作序

3. 目  录

4. 作者团队

李斌、闻媛、许智星、刘依欢、霍凯蕊、肖力铭、宋丽、黄彤、戴玉玲、闫培艺、谢媛媛、张艺璇、李俊洁

感谢中文抽象语义项目(2014-2025)师生:

薛念文、俞士汶、曲维光、周俊生、冯敏萱、许超

卜丽君、戴如冰、葛四嘉、吴笑双、吴泰中、陈瑾、芦靖雅、徐静、计婷

CAMR研究相关链接

参赛邀请|第五届中文抽象语义表示解析评测

最新消息 | 第四届中文抽象语义表示解析评测任务

第三届中文抽象语义表示解析评测CAMRP2023在CCL举办

社会科学报 | 中文抽象语义表示解析评测CAMRP2022举办

MRP2020国际跨语言多框架语义分析评测结果出炉

学术前沿 | 句子语义研究新框架AMR获评LDC三十年亮点资源

全新中文抽象语义库CAMR V2.0重磅发布

📖 图书信息

  • 作者:李斌 等著

  • 出版社:科学出版社

  • 定价:158.00 元 

京东、当当、微信科学出版社商城已上架

粉丝福利:赠书3本。

在下方发表评论,集赞60个以上,可获得赠书一本。只有三本,先到先得!集赞满额后,截图发后台。

阅读原文

跳转微信打开

山师汉语言专业|培养、课程、就业梳理

2026年6月27日 00:00

招生新媒体 2026-06-27 00:00 江苏

分享一篇文章

山东师范大学本科招生: 国家级一流本科专业 | 汉语言

欢迎报考山东师范大学!

图片

山东师范大学文学院拥有国家级一流本科专业——汉语言,今天小招带大家走进汉语言专业,一起来了解一下吧!

培养理想信念坚定、专业情怀高尚、学科基础扎实、人文素养深厚、应用能力突出、敏于自我发展、初具国际视野的汉语语言学复合型、应用型人才。

image.png

现代汉语、古代汉语、语言学概论、语音学、汉语词汇学、汉语语法学、文字学、汉语方言学、汉语发展史、中国语言学史、中国古代文学专题、中国当代文学专题、外国文学专题、古典文献学等。

image.png

本专业所依托的中国语言文学博士、硕士学位授权一级学科,形成了本科、硕士、博士、博士后等多层次语言类人才培养体系。注重夯基固本,学风严谨扎实。创设“崮山语言学论坛”,引领学术参与,培养学术志趣。强化实践应用,拥有先进的语言实验室和国家语言文字应用推广基地,建有十余家协同育人实践基地,将现实维度、行业视角、应用品格融入培养目标。

image.png

毕业生可以继续攻读研究生,也能胜任文化、教育、出版、传媒、政府机关以及其他企事业单位与汉语言文字应用、教学、管理及研究等相关的工作。

image.png

王丽君:通过汉语言专业的学习,我的最大感受是:”我们所发出的每一个声音,说出的每一句话语,乃至书写的每一个汉字,都有其内在的规律性“。围绕语言的三要素——语音、词汇、语法,我们学习到丰富、博大、深厚的汉语言知识;语言学史、文字学等诸多内容开拓了我们的视野。越深入学习,就越能深刻地认识到语言文字的优美和神奇,更能体会到“中文”之美。

image.png

不提科目要求。

  最终招生专业及计划以各省招生主管部门公布的信息为准。

image.png

未经许可禁止转载到任何平台

山东师范大学本科招生(微信号:sdnuzb) 

编辑:张舒宜

责编:刘雪

审编:高艳丽 刘颖

终审:杜德彭

阅读原文

跳转微信打开

全国数标委 最新数据标准研制十大重点方向(2026)

2026年6月26日 00:00

小施同学 2026-06-26 00:00 江苏

以下文章来源于:数据设施

数据设施

紧密关注国家数据基础设施、可信数据空间建设运营,理清数据基础设施概念、标准、政策、动态、场景

一、多模态非结构化数据语义规则标准化研究

针对企业非结构化数据(文本、表格、图像)占比高、语义 规则缺失导致数据价值难以释放的问题,研究通用业务表格基础语义理解与表述规范,探索文本、表格、图像间基础的跨模态语 义对齐方法,规范同类业务实体、业务指标的语义映射基本原则 与通用匹配要求,结合典型业务应用场景梳理行业共性痛点和标 准化需求,形成适用范围适度、框架简洁清晰的多模态非结构化 数据基础语义规则标准体系,为相关标准制定及规范编制提供指 导和支撑。建议形成《多模态非结构化数据语义要求》标准草案 等研究成果。

二、面向城市全域数字化转型的城市智能体标准化研究

面向城市智能体建设缺乏指引带来的“碎片化”“资源浪费” 等问题,结合国内外情况调研,研究界定城市智能体的功能边界、 多智能体协同机制、与城市智能中枢的接口规范,以及基于大模 型的城市知识推理与任务调度标准。探索智能体在应急管理、基 层治理、营商环境优化等典型场景中的能力评估指标与互操作要 求,推动构建可扩展、可治理、可审计的城市级人工智能基础设 施标准体系。建议形成《面向城市全域数字化转型的城市智能体标准化研究报告》等研究成果。

三、数据基础设施大模型训练推理公共服务平台标准化研究

聚焦数据基础设施向大模型训推供数场景,系统分析当前平 台在架构、接口、安全及服务模式等方面存在的标准化需求,梳 理功能碎片化、互操作性不足等共性痛点,研究构建与数据基础 设施共性标准相衔接的大模型训练推理公共服务平台标准体系, 重点规划分布式训推、协同推理等核心能力标准研制路径,贯通 “需求识别—体系设计—路径规划”全链条,为数据基础设施在 大模型训练推理中释放价值提供标准化支撑。建议形成《数据基础设施大模型训练推理公共服务平台标准化研究报告》等研究成 果。

四、多主体复杂形态的数据市场标准化研究

聚焦数据交易复杂场景、数据产品复杂形态以及多元主体协 同模式,深度剖析当前数据市场建设总体态势和面临的主要问题。 研究提出适应多主体复杂形态的数据市场标准体系,规划重点标 准破解数据市场主体准入、分类管理、数据产品、服务形态、流 通交易、定价估值、安全合规、权益分配、信用评价、监管协同 等多方面存在的标准化障碍与制度瓶颈。建议形成《多主体复杂 形态的数据市场标准体系研究报告》等研究成果。

五、智能化数据工厂标准化研究

系统分析当前智能化数据工厂在平台架构、工艺流程、安全 及评估质检等方面的标准化需求,梳理数据获取成本高、数据偏 差大、质量管控难等共性痛点。研究工业级的数据工厂建设模式及标准,重点规划数据工厂多模态数据处理、标注、安全审查等 核心能力,贯通“数据采集—特征分析—数据标注—数据质检数据出库”等标准化工艺流程,以高质量数据生产有效推动数据 产业化发展。建议形成《智能化数据工厂 技术架构》标准草案 等研究成果。

六、高质量知识数据全生命周期标准化研究

聚焦高质量知识数据全生命周期管理与应用场景,系统分析 知识数据在生产、治理、核验、流通与应用等全生命周期中的标 准化需求,梳理当前存在的知识数据表达不规范、知识数据结构 不统一、质量评价体系不完善、跨平台互操作性不足等共性问题。 研究构建覆盖知识数据全生命周期的标准体系,重点规划知识数 据组织、知识数据关联建模、知识数据质量评测等关键标准,提 升知识数据的可管理、可流通与可应用能力,为高质量知识数据 体系建设及智能化应用提供标准化支撑。建议形成《高质量知识数据全生命周期标准化研究报告》等研究成果。

七、数据编织技术与标准化研究

针对跨域异构数据可信融通难、数据供给与计算资源错配、 落地面临技术碎片化与互操作性差等痛点,系统研究以“虚拟整 合、智能编排”为核心的数据编织技术,深入剖析其打破数据孤 岛、实现分布式数据计算的核心技术逻辑与技术架构,并厘清安 全合规边界,构建降低实施复杂度、促进生态互联的应用范式。 建议形成《数据编织技术要求》标准草案等研究成果。

八、多源异构数据本体模型标准化研究

聚焦人工智能面临的语义理解歧义多、推理幻觉高、跨任务 知识碎片化与难复用等核心痛点,研究本体模型构建方法标准, 明确语义抽取与对齐、异构数据映射转换、逻辑关系建模与行动 触发、融合演进及评估等核心方法及关系,贯通“数据理解—语 义抽象—逻辑规则与行动建模—场景验证—动态维护”全链条, 为打造可执行、可推理、可闭环的本体构建提供标准化指引。建 议形成《多源异构数据本体模型 建设指南》标准草案等研究成 果。

九、算电协同一体化实践路径标准化研究

聚焦算电协同一体化建设模式及实践路径,梳理现有建设模 式、案例与标准,解决当前模式分类模糊、实践路径不规范、场 景适配性不足等痛点,研究建立标准化的建设模式,明确各模式 的核心指标与适用场景,制定从规划、设计、建设到运营的全流 程标准化实践路径,提出可落地的标准化实施建议,为算电协同 规范化、规模化建设提供基础支撑。建议形成《算电协同一体化 实践路径标准化研究报告》等研究成果。

十、人工智能数据国际标准化研究

以 ISO、IEC、ITU 等国际标准组织数据标准化工作为基础, 结合人工智能场景化发展需求,研究前期元数据、数据质量、合 成数据、生成数据、数据去标识、数据利用等方向已有工作,研 提人工智能数据国际标准关键需求,构建一套覆盖人工智能数据 全生命周期且与业务场景深度融合的标准体系,支撑构建人工智 能数据国际标准化发展的核心路径。建议形成《人工智能数据国际标准图谱及发展路径研究报告》及人工智能数据国际标准新提 案等研究成果。

来源:

https://mp.weixin.qq.com/s/aC21VP88fvPf-i-CvfQ8oQ

关注数据设施

接收国家数据基础设施最新学习笔记

概念、政策、建设、运营、案例、标准

国家对数据基础设施最新定位(2026年)

国家数据基础设施试点第一批、第二批试点名单汇总

国家数据基础设施标准、技术文件汇总(附pdf下载)

数据基础设施有哪些官方名词解释

数据基础设施可以有哪些重点场景建设方向?

第一批国家数据基础设施试点上线的真实平台汇总(附可访问地址)

从国家数据局课题看数据基础设施发展方向

国家数据基础设施架构最新变化

国家数据局认可的可信数据空间架构

数据基础设施中的连接器和数据空间中的连接器有什么关系

国家数据局第一批可信数据空间试点 已建成哪些真实平台(附可访问地址)

数据基础设施典型案例架构图汇总(1)-架构图不知道怎么画,一文看全

数据基础设施典型案例架构图汇总(2)-精品图集

2026年“数据要素×”大赛新增数据基础设施赛道(附评价指标)

数据基础设施的原生应用场景是指什么

【数场】数据基础设施中数场是什么 2026年最新官方解释

数据基础设施典型案例架构图汇总(3)-精品图集

可信数据空间建设路径 3大阶段9大步骤

可信数据空间真实场景案例 总结(附图)

可信数据空间 接入连接器中数字合约的结构

可信数据空间 使用控制策略有哪些

可信数据空间 在异构连接器下如何实现使用控制

可信数据空间建设 要求考虑哪几方面的安全

我国最新智算总规模、数据生产总量分别是多少

可信数据空间建设 服务平台要求具备哪几方面的能力

可信数据空间建设 接入连接器要求具备哪几方面的能力

数据基础设施中 用户注册和登录流程(可信凭证方式)

数据基础设施中 两个接入连接器之间如何验证身份

阅读原文

跳转微信打开

新书推荐 | 刘浏:《春秋》三传计算人文研究

2026年6月24日 22:21

携好书而来的 2026-06-24 22:21 江苏

计算人文实证之作

《春秋》三传计算人文研究

著者:刘浏

出版社:南京大学出版社

出版日期:2025 年 11 月

ISBN:978-7-305-27471-8

PART1

内容简介

古籍研究正在经历一场深刻的范式演进——从文本的数字化迈向知识的深度挖掘与量化分析。如何借助人工智能与计算思维突破传统方法的限制,挖掘文本深层的语言特征与历史规律,已成为计算人文研究的核心命题。

《春秋》三传计算人文研究以先秦儒家经典《春秋》及其三传——《左传》《公羊传》《谷梁传》为研究对象,构建了一套“数据基础—计算方法—人文应用”层层递进的完整研究框架。全书立足三传显著的语体风格差异、先秦文本复杂的名号称谓系统以及详尽的史事记载,系统展示了从非结构化文本到结构化知识、再到量化实证的研究路径,呈现了计算技术在古籍知识挖掘与历史问题量化分析中的应用价值。

全书共 9 章:从面向计算人文的语料库构建与古籍实体规范,到基于机器学习与深度学习的实体识别、实体歧义的消解;从基于实体成分的人名量化、春秋女性称谓与联姻网络的量化考察,到大语言模型驱动的实体抽取;最终回归到对计算人文与古籍计算人文的理论辨析与人文反思。内容循序渐进,兼顾方法应用与人文思考。

PART2

宣传语

新的风格计算框架

《左传》重叙事、《公羊传》与《谷梁传》重释义,这类流传已久的文体判断,如何获得可比较的证据?本书以三传十二位鲁公时期的文本为单位,计算平均词长、词汇密度、标准类符形符比、平均句长、句子离散度五类指标,并把词语、句子转化为语义向量,映射成二维散点图;再与《国语》《吕氏春秋》《论语》《孟子》等七部先秦典籍并置考察。原本离散的文字由此形成可视化的语体图景:用词范围、句式节奏与叙事方式都能被直观比较,为三传文体差异和《左传》成书问题提供了新的量化参照。

从标注规范到实体识别:古籍AI先要“认得人”

机器如何分清“人名、地名、时间”,又如何读懂姓名、字、爵称、谥号之间的复杂组合?本书以《春秋经传引得》为基础,为三类实体建立细粒度标注规范,并将实体成分、上下文与词长等知识转化为模型特征。在十折交叉验证中,仅用上下文汉字的CRF模型总体F1值为0.86;加入实体成分特征后升至0.90,人名识别F1值达到0.89;继续加入词长特征后,整体F1值进一步达到0.92。这组数据说明,古籍智能处理的关键并不只是算法更新,更在于高质量标注资源与领域知识的持续积累。

从人物异名看见春秋社会结构

《春秋》三传中的4695个人名实体词,实际对应1421位人物;其中875人拥有两个以上名称,占61.58%。姓、氏、名、字、爵称、谥号与封地称谓的交错使用,并不只是语言现象,也记录着人物身份、经历与社会位置。有些人物的名称甚至多达10种,异名数量较多者往往也具有更高的社会地位和更丰富的政治活动经历。将人名拆解为可统计的成分后,春秋礼制、贵族阶层与社会流动的线索,便获得了更细致的数据观察窗口。

联姻网络如何映照齐鲁兴衰与诸侯政治

齐国何以在春秋外交中愈发强势,鲁国又为何逐渐式微?诸侯间的婚姻往来,究竟怎样影响一国的政治空间与发展轨迹?本书从129名女性人物出发,筛得99对有效联姻关系,构建出包含46个“姓+国”节点、67条关系边、对应44个诸侯国的联姻网络。齐国与17个诸侯国发生联姻、累计参与40次;齐、鲁、宋、晋、卫、郑六个核心国合计占全部联姻次数的64.14%。通过联姻强度、联姻广度及其年代变化的比较,书中将婚姻关系放回诸侯竞争、结盟与依附的政治格局中,为观察齐鲁关系的消长及诸侯国发展的差异,提供了一条可度量的新线索。

大语言模型时代,古籍研究真正缺少什么

大模型能否读懂古文,不能只看参数大小。本书以1863条指令微调数据和1407条测试数据,对通用模型与古籍领域模型开展实体抽取比较:古籍领域模型Xunzi-Qwen3-8B的F1值达到85.13%,略高于参数量更大的通用Qwen3-14B(85.06%),也高于同规模通用Qwen3-8B(83.55%)。这组对比为全书的核心观点写下注脚:模型固然重要,但高质量语料、标注规范与领域知识,才是让人工智能真正进入古籍研究的关键。

PART3

图书目录

(以下为全书目录,完整呈现至小节)

PART4

教研的必要性

(左右滑动查看封面 / 封底实拍)

(左右滑动查看内文翻开实拍)

PART5

读者反馈

这本书的突出价值,在于为《春秋》三传研究建设了可计算、可复用的基础资源。作者以《春秋经传引得》为底本完成文本数字化、分词校对和语料整理,并建立了面向先秦古籍的人名、地名、时间等实体标注体系,为后续研究提供了可靠的数据底座。

《春秋》三传中的人物称谓极其复杂,同一人物可能以姓、氏、名、字、爵称、谥号等不同形式出现。书中建立的细粒度标注体系,把这些原本难以直接计算的信息转化为可检索、可统计、可关联的数据,对先秦人物知识库建设很有启发。

书中关于女性人物的标注与分析很有新意。它不只统计女性出现次数,还进一步整理母家、夫家、国别、称谓等信息,并据此构建联姻网络,让原本容易被零散叙事遮蔽的女性活动与政治关系获得更清晰的观察视角。

从传统机器学习到深度学习,再到大语言模型,本书的比较很有价值。它提醒读者,在古籍这种低资源、强领域特征的任务中,模型规模并不是唯一答案,结构清晰、标准稳定的标注资源同样决定研究的上限。

……

PART6

作者简介

刘 浏 :南京农业大学信息管理学院副教授、博士生导师,管理学博士。主要研究方向为计算人文、大语言模型、文本知识挖掘与组织。目前主持国家社会科学基金一般项目、江苏省社会科学基金一般项目各 1 项,曾主持国家自然科学基金青年项目、江苏省社会科学基金青年项目,并参与多项国家社会科学基金重大项目;发表 A&HCI、CSSCI 检索论文 40 余篇,出版专著2部、教材1部。

PART7

购买链接

(使用手机扫码查看商品)

= END =

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

Claude Code 破译了一门 3500 年前的语言

2026年6月23日 00:00

2026-06-23 00:00 江苏

分享一篇文章。

AGI Hunt: Claude Code 破译了一门 3500 年前的语言

一位自学 AI 工程师用 Claude Code 搭建 Python 工具,声称破译了困扰语言学界百年的米诺斯文明古文字 Linear A。

有人声称用 Claude Code 破译了 Linear A,一种来自克里特岛、已经沉默了 3500 年的古老文字。

Linear A 泥板铭文
Linear A 泥板铭文

Claude Code 之父 Boris Cherny,也发文宣告了这个酷炫玩法:

Linear A 是什么呢?

它是青铜时代米诺斯文明使用的书写系统,大约从公元前 1800 年开始出现,一直用到公元前 1450 年迈锡尼希腊人征服克里特岛为止。

1900 年,考古学家 Arthur Evans 在克诺索斯发现了它,此后一百多年,无数语言学家和密码学家试图破译,全部失败了。

它的「姐妹文字」Linear B 早在 1952 年就被一个英国建筑师 Michael Ventris 破译了,那次破译则直接登上了《纽约时报》的头版。

但 Linear A 始终是语言学界最顽固的谜题之一。

Linear B 已破译,Linear A 仍是谜
Linear B 已破译,Linear A 仍是谜

而现在,这位叫 Tom Di Mino 的自学 AI 工程师,声称他用 Claude Code 找到了答案。

01

七年磨一剑

Tom Di Mino 不是学院派。

他是一名自学成才的 AI 工程师和业余语言学家,住在纽约哈德逊河谷地区,目前在 Subquadratic 担任首席工程师,此前在 JPMorgan Chase 和 Google 都工作过。

他从 18 岁起就开始研究古典历史和语言学,对 Linear A 的痴迷已经持续了整整七年,还两次亲自去克里特岛实地考察。

米诺斯祈祷铭文第一行符号
米诺斯祈祷铭文第一行符号

今年 1 月,他开始认真动手做破译工作。

他用 Claude Code 搭建了一整套 Python 脚本,能够查询、交叉比对和整理两个数字化的 Linear A 语料库:

GORILA(法国雅典学派在 1976-1985 年间编纂的五卷本 Linear A 铭文全集,收录了大约 1427 份铭文中的 7000 多个符号)和 SigLA(2020 年上线的开放式古文字数据库,覆盖了 400 多份铭文中的 3000 多个单独符号的字形变体)。

这套工具让他能在一个人类研究者根本无法企及的规模上,进行系统性的假设验证。

02

祈祷文的秘密

突破进展发生在 5 月 22 日。

Di Mino 在分析一系列 Linear A 祈祷铭文时,发现了一个规律:这些祈祷文遵循着一个固定的公式结构,而且在克里特岛五个不同的圣殿遗址都出现了

以 Iouktas 遗址出土的铭文 IOZa2 为例,祈祷文的第一行是这样的:

A-TA-I-*301-WA-JA · JA-DI-KI-TU · JA-SA-SA-RA-ME · U-NA-KA-NA-SI · I-PI-NA-MA · SI-RU-TE

公式中大部分符号都能通过 Linear B 的已知读音来辨认,因为两种文字共享 60 个核心音节符号。唯一不确定的,是每行祈祷文的第一个词……一个动词,它在不同地点以不同的地区变体形式出现。

这个动词包含 5 个已知的 Linear B 符号,还有一个只存在于 Linear A 中的未知符号「*301」。

Di Mino 判断 *301 的发音是「na」。

*301 = na,打开闪米特语的钥匙
*301 = na,打开闪米特语的钥匙

由此,他推导出这个动词的词根是「nawaya」,意思是「居住」。这个 N-W-Y 辅音模式,恰好就是希伯来语、阿卡德语等闪米特语系中表示「居住 / 栖息」概念的词根。

一旦打开这扇门,Di Mino 发现整段祈祷文的结构竟然和后来的希伯来祈祷文高度相似,只是祈祷的对象是一位女神。

03

不是新想法

Di Mino 的核心主张是:Linear A 记录的是一种已灭绝的闪米特语言,和圣经希伯来语的关系,类似于拉丁语和意大利语的关系。

这个方向,其实不算是完全的创新了。

早在 1957 年,美国学者 Cyrus Gordon 就在学术期刊《Antiquity》上提出过类似的理论。他注意到 Linear A 泥板上出现在陶罐象形符号前的词汇,和闪米特语中的容器名称有匹配,比如 ka-ro-pa 和阿卡德语中的 karpu(后来演变成了英语的 carafe),ku-ro 反复出现在泥板末尾,和闪米特语中表示「总计」的 kull 吻合。

但 Gordon 的理论没能生产出可用的翻译,也没有获得学术界的广泛认可。批评者认为他找到的匹配主要是词汇层面的,可能只是借词,不足以证明语系归属。

从找巧合到分析结构
从找巧合到分析结构

Di Mino 的方法不一样。

他不只是在找个别词汇的巧合,而是从祈祷文的语法结构入手,建立了一套系统性的对应关系。到目前为止,他提出了 40 个符号的读音方案(其中 13 个是此前完全未知的 Linear A 独有符号),还解决了 5 个 Linear B 符号的争议读音。

他编纂了一个包含 408 个 Linear A 词汇的英语词典,并撰写了一份 9 页的论文手稿,标题是《Ya Diktu:米诺斯山顶圣所奠酒祈祷公式语法》。

04

硬骨头

不过,这件事目前还没有定论。

Di Mino 的研究成果正在接受罗格斯大学和剑桥大学语言学专家的同行评审。同行评审能不能通过,还得等专家们说了算。

Tom Di Mino 个人网站
Tom Di Mino 个人网站

Linear A 之所以难,有几个绕不开的原因。

最大的挑战是,语料库太小了。

大约只有 1400 份铭文、7000 多个符号,其中大部分还是商品清单(多少罐橄榄油、多少头牲畜),语言信息量非常有限。对比之下,Ventris 当年破译 Linear B 时,可用的铭文数量更多,而且他的突破性假设「这是希腊语」恰好是正确的。

而 Linear A 的底层语言至今没有已知的近亲。

这意味着……即使你的翻译体系在内部逻辑上完全自洽,也不能证明它就是正确的。

AI 擅长模式匹配,但模式匹配出来的「合理」和历史真实之间,可能隔着一条鸿沟。LLM 再强,也不能凭空制造一块「罗塞塔石碑」。

05

不只是写代码

值得注意的是,Claude Code 在这里扮演的角色。

它不是「AI 自己破译了古文字」,Di Mino 用它来搭建研究工具,本质上是把 Claude Code 当作一个能写代码的研究助手。他让 Claude Code 帮他构建了一套 Python 脚本,用来在数字化语料库中做大规模的查询、交叉比对和假设检验。

这和大多数人用 Claude Code 写网页应用或者调 API 完全不同。

它把一个混乱的研究工作流,变成了可重复的研究循环。

可重复的研究循环
可重复的研究循环

收集证据、测试假设、留下可审查的痕迹,让别人能验证你的每一步。这个思路,放在软件工程以外的任何研究领域,应该都适用。

这也让人想到 Vesuvius Challenge,那个用 AI 读取被维苏威火山灰覆盖了两千年的古罗马卷轴的项目。2024 年已经有团队成功解读了部分文字,拿到了 70 万美元的大奖。

AI + 古代文本,正在成为一个新的交叉领域。

06

等着看好戏

如果 Di Mino 的破译最终通过了同行评审,这将是自 1952 年 Ventris 破译 Linear B 以来,古文字研究领域最重大的突破。

而且这次的故事,比 Ventris 那次多了个元素:AI。

Ventris 当年是个 30 岁的建筑师,业余时间用统计分析和纸笔推演破译了 Linear B,在 BBC 广播上宣布了他的发现,四年后在一场车祸中去世,年仅 34 岁。

Di Mino 则是个自学的 AI 工程师,用 Claude Code 搭了一套 Python 工具来做同样的事。

1952 vs 2026,方法变了本质没变
1952 vs 2026,方法变了本质没变

破译古文字的方法变了,但本质依旧是:得靠人类的洞察力做出那个关键的判断。

AI 能帮你在海量数据中跑得更快,但「*301 的发音是 na」这个突破性假设,是 Di Mino 七年研究的结晶。

至于结果……希望同行评审的好消息早点来吧。

◇ ◆ ◇

相关链接:

AI Clambake 原文:https://aiclambake.com/clamtakes/linear-a/

Boris Cherny 推文:https://x.com/bcherny/status/2068064304503660962

Tom Di Mino 个人网站:https://www.tomdimino.com/

SigLA 数据库:https://sigla.phis.me/

阅读原文

跳转微信打开

饶高琦 | 生成式人工智能时代语料库研究的话题变革

2026年6月22日 08:00

徐惠 2026-06-22 08:00 江苏

文章剖析生成式AI背景下,语料库研究目标、建设路径与理念的多重变革。

转载自“汉语堂”

引用方式:方梅,詹卫东,陈玉东,饶高琦,关越.“数智时代汉语语料库建设与应用”多人谈[J].辞书研究,2026,(3):43-57.

生成式人工智能时代语料库研究的话题变革

饶高琦

(北京语言大学语言科学与资源学院/中国语言文字规范标准研究中心) 

生成式人工智能技术快速迭代,人机共生成为语言生活的新形态。语料库作为语言理论与应用研究的核心基础资源,其价值与使命正在被重新审视。显然,生成式人工智能在功能和知识生产的生态位上,与语料库并非取代或承继关系。语料库的存在价值毋庸置疑——它仍是捕捉真实语言现象、支撑语言研究与人工智能技术发展的重要基础,也是经验主义语言研究方法的主要资源。荀恩东(2025)将其定义为“人类对语言生活和语言大数据的采样”。语料库的这一核心属性并不因语言社团(研究对象)的构成和语言数据的生产方式(技术方法)变化而改变。但随着语言生活进入自然人、机器人、数字人“三人”共生时代(王春辉2024),语料库对应的“采样之源”在构成上发生了巨大变化,语料库的建设方法和应用目标也得到了更新,因而势必驱动语料库的研究话题改变以适配数智时代的语言生活。为简便起见,本文将传统的语料库研究和应用称为前大模型时代,与此相对的是大模型时代。

一、研究目标变化:由语言社群变革驱动

语言社群作为语料库“采样之源”的核心构成,其变革是驱动语料库研究话题更新的核心外部因素。在前大模型时代,语言社群的主体是单一的自然人,语言生活的场景、内容与互动方式均围绕人类展开,语料库的采样范围、研究边界也随之限定在人类语言行为之内,研究话题自然聚焦于人类语言的规律与应用。而进入“三人”共生时代,语言社群的构成从“单一自然人”拓展到“自然人+机器人+数字人”。这种社群构成的变革,打破了传统的研究边界,倒逼研究话题向多元语言互动场景延伸。

语言社群的多元变革体现在众多具体场景之中,社交机器人便是其一。哪怕在前大模型时代,社交媒体中就有20%以上的公共事件信息(如疫情、英国脱欧等)由社交机器人发布。贸易战中更涌现出大量基于生成式模型的社交机器人。它们作为语言社群的新成员,参与到舆论传播、信息交互等语言活动中,产生了海量的人机话语、机机话语。(张洪忠等2019)而今天这一比例更是大幅增长,并具有超过人类原生信息规模的趋势。(Caoetal.2025)这些语言新现象,既与人类话语存在明显差异,又形成了新的语言生态。传统语料库聚焦人类语言的研究话题已无法覆盖这类新场景,亟需新增研究内容,探索多元主体的语言行为特征与互动规律。

这一变化带来了一些新的研究话题,笔者尝试对语料库研究可直接支持的话题进行归纳,并列举出近期可能产生重要影响的话题:1)人机多元话语的特点。重点探究三类话语在表达逻辑、语义传递上的差异,进而从话语运用的基础上描述新型语言生活的面貌和发展趋势。2)语言具身性带来的差异。语言的生成和认知具有具身性。人类的“身体”和生活环境塑造了自然语言,而机器没有这些条件。我们处在一个观察“身体”究竟如何影响语言的绝佳窗口中。3)在人机混合的舆论场中,人机、机机语用行为如何互相影响,这些影响又如何沉淀到人人交际之中。

二、建设路径变化:由数据生产方式变革引发

如果说语言社群变革是驱动语料库研究话题更新的外部动力,那么数据生产方式的变革则是其内部因素。语料库的核心是语言数据,数据生产方式直接决定了语料库的构成、质量与应用场景。当数据生产方式发生根本性变革时,语料库的研究话题也必然随之调整,以适配新的数据源与数据特征。

在建设理念上,前大模型时代强调“平衡采样”,追求主题、语体、来源、时间等方面的全面均衡,力求构建代表性强、偏差小的通用语料库,研究者视其为具有一定标准性的基础资源。大模型时代则新增了“需求驱动+平衡采样”的理念,根据下游任务、模型短板和实际场景定向优化采集,规模与质量并重,语料从“通用食材”变为“任务定制配方”。

在语料库与模型的关系上,前大模型时代的语料库是模型性能的硬性前提,后者依赖前者:没有优质语料,模型就难以出彩;模型更多是对语料的被动统计建模。而在大模型时代,数据生产方式出现了“师生模式”:高质量指令、示范样本扮演“老师”角色,主动引导和塑造模型学习,语料从静态输入转变为动态教学内容,其价值的高低更多取决于能否提出“好问题”和“好需求”。

最基础的还是对知识表示方式的认识不同了。在前大模型时代,知识以显式、符号化形式存在于文本的词汇、句法、实体关系中,语料库是可查询的符号知识库,依赖显式解析和模式匹配。在大模型时代,知识被深度压缩、分布式嵌入神经网络权重之中,成为隐式、连续的分布表示。语料库脱离传统“知识容器”角色,转而成为设定和调节网络参数、注意力分布和生成路径的测试材料。在这个过程中,数据质量重于数量,精炼提纯远胜粗放堆砌。

这种学术趋势催生了一系列和语料库建设有一定关联而极具挑战性的研究问题:1)探针实验(probing)成为理解大模型“内在思维”机制的工具。研究者通过设计精巧的探针追问:大模型到底是如何“想问题”的?它在不同层级究竟编码了哪些语法、语义、常识、世界知识?更好地理解和解释大模型的知识生产机制,是使其成为语料库建设生产力工具的基础保障。2)提示词工程和探针实验是一体两面。后者侧重工程实践,对研究者应用大模型能力至关重要。提示词工程也已与模型同步升级迭代,形成了上下文工程(上下文工程(Context Engineering)是设计和构建动态系统,向大模型提供恰当的信息、工具和背景知识,从而使模型可靠地完成复杂任务。它超越了单一的提示,强调管理整个上下文窗口。)和驭智工程(驭智工程(Harness Engineering)是围绕AI代理构建“harness”(“马具”式的框架),用于约束、引导和驾驭代理的行为,确保其在长期、复杂的任务中保持可靠、透明和易维护。)。过去依赖海量标注数据的监督学习,现在很大程度上已被“好问题+好示范”的技术取代。如何根据需要系统化地设计、优化、自动化提示?这不仅是工程问题,更触及认知科学与人机交互的深层议题。3)垂域语料生产和管理。生成式语料库大多是根据目标进行定制的垂域语料库(朱奕瑾,饶高琦2023),其重要性急剧上升。大模型落地于垂域,语料库研究和服务业越来越集中于垂域。设计蒸馏和微调方法,使模型高效“吸收”领域知识,进而根据需求生产语料;高效构建、持续迭代、隐私合规地维护领域语料;构建人在闭环中的语料生产、管理架构等,都具有很强的实践价值。

三、研究理念变化:新旧融合,螺旋上升

语言社群的外部变革与数据生产方式的内部变革,共同推动语料库的建设与研究理念实现螺旋上升。这种理念升级并非否定传统,而是在继承核心价值基础上的创新发展,最终实现语料库研究适应数智时代语言生活的目标。

在研究目标上,前大模型时代的语料库研究服务于“归纳、验证语言规律和现象”,视语料库为“证据库”,强调从真实语言使用中提炼可检验的知识,追求理论的解释力和可证伪性。大模型时代则新增了“试探模型表现”的探索式研究。研究者更多将大模型视为“黑箱”,通过精心设计的输入来探测其语言和知识的边界乃至涌现行为。此时,语料库的角色转变为“试题”或“测试集”——不再主要用于发现新规律,而是用于评估、诊断和迭代模型。这种转变使语言研究从“人类中心”的理论驱动,部分转向“模型中心”的表现驱动。

在科研伦理上,前大模型时代的语料库研究关涉的问题主要围绕版权与隐私。这些挑战多可通过法律合规、数据清洗和脱敏技术加以缓解,属于已经可控的“输入端”伦理。大模型时代则涌现出更复杂、系统性的伦理困境。尤其是在包含生成式数据的语料库中,回音室效应导致语料多样性下降、错误放大;溯源困难令研究者难以精确追溯原始信源;在训练和应用过程中,语料“好”和“安全”的定义也越来越模糊和难以量化。

最后,最根本的转变恐怕在于我们要更深刻地认识“压缩产生智能”的信息原理:真实世界(事件)抽象形成知识,但知识不再是显式存储(语料库),而是通过海量参数对语料的极致压缩与重构而涌现(神经网络)。由此衍生出问题:什么样的数据分布、什么样的压缩过程最容易催生“智能”?是否存在更高效的知识表示形式?知识蒸馏的极限在哪里?这些问题已经超越了传统语料库和自然语言处理工作,指向下一代人工智能的基础理论。

今日责编:山隹

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

IALP 2026 国际亚洲语言处理大会

2026年6月21日 00:00

IALP 2026 2026-06-21 00:00 江苏

以下文章来源于:纵横南北

纵横南北

发布相关的学术或者生活信息。

IALP 2026(国际亚洲语言处理大会)将于

10 月16日至18日在中国北京举行,由

中央民族大学与新加坡中文与东方语言信息处理学会(COLIPS)联合主办。截稿日期:2026年7月15日,热忱欢迎投稿参会!

CALL FOR PAPERS · 征稿启事

IALP 2026

2026 年亚洲语言处理国际会议

2026 International Conference on Asian Language Processing

📍 中国 · 北京|2026 10  16–18 

🌐 www.ialp2026.org

金秋十月,语言智能学界将相聚北京。2026 年亚洲语言处理国际会议(IALP 2026定于2026  10  16 日至 18 在北京举办,由中央民族大学新加坡 COLIPS联合主办,会议论文集由IEEE 出版,现诚邀各位专家学者踊跃投稿。

会议征稿范围涵盖自然语言处理、语音技术、语言学等领域。大会特邀台湾大学李宏毅教授新加坡南洋理工大学林静夏教授作主旨报告。论文投稿截止日期为2026  7  15 ,热忱欢迎各界同仁投稿参会!

01关于 IALP

IALP(国际亚洲语言处理会议)是COLIPS 主办的旗舰国际学术会议,也是亚洲语言处理领域最具影响力的会议之一。其前身为1986年创办的国际中文计算会议(ICCC),2008年正式更名为 IALP,并在亚洲各城市轮流举办。

会议聚焦自然语言处理、计算语言学与人工智能前沿研究,为全球学者搭建高水平交流平台。2026 年,IALP迎来第30盛会,大会将在北京举行。诚邀海内外专家学者相聚北京,共同探索语言智能前沿技术与未来发展。

02特邀主旨报告

大会荣幸邀请到两位语言智能领域的杰出学者作主旨报告(Keynote):

李宏毅教授

台湾大学电机工程学系教授 · ISCA Fellow(国际语音通信学会会士)

国际知名人工智能学者,在机器学习、语音处理和生成式 AI 领域具有重要影响力。他以深入浅出的教学风格闻名,公开课吸引数百万学习者,被誉为华语世界最具影响力的 AI 教育者之一。通过推动机器学习和大模型知识普及,他培养了大量 AI 人才,对华语人工智能生态的发展产生了深远影响。

林静夏教授

新加坡南洋理工大学(NTU)副教务长(Associate Vice Provost · 人文学院副教授

毕业于美国斯坦福大学,国际知名的汉语语言学专家。长期从事汉语语言变异、语言类型学、新加坡华语及世界华语研究,在多语社会中的华语发展与演变研究领域具有重要影响力。她主持多项研究项目,推动新加坡华语语言遗产的数字化保存,同时担任南洋理工大学重要学术管理职务,为语言学研究与高等教育发展作出了重要贡献。

03重要日期

▸ 论文投稿截止

2026  7  15 

▸   Late-Breaking 投稿截止

2026  8  10 

▸ 录用通知

2026  8  20 

▸ 终稿提交 & 注册截止

2026  9  5 

▸ 会议日期

2026  10  16–18  · 北京

04征稿主题

大会设三大主题方向(Track),涵盖但不限于以下内容:

🎙 A. 语音(Speech

低资源语音识别、合成与翻译;说话人识别、反欺骗、说话人日志与语音增强;语音/音频大模型与口语对话系统;多模态语音处理;语码转换与方言语音处理;可信、高效的语音技术。

📖 B. 自然语言处理(NLP

面向亚洲语言与低资源语言的大语言模型及多语言基础模型;机器翻译;信息抽取、检索与文本挖掘;检索增强生成(RAG)与问答;对话系统、智能体与推理;情感、文体与论辩分析;文本生成、摘要、蕴含与复述;评测、可解释性、安全与负责任的 NLPOCR、手写识别与文档智能;垂直领域 NLP 应用。

🔤 C. 语言学(Linguistics

亚洲语言的输入、输出与编码;语言资源、评测基准与语料库;语码转换、方言与地域变体;语言学习与智能辅导系统;音系、形态与分词;句法、语义、语篇与语用;计算语言学与数理语言学;认知建模与心理语言学;历史语言、古典语言、濒危及记录不足的亚洲语言。

05投稿须知

诚邀各位作者提交描述实质性、原创、已完成且未发表工作的完整论文(Full Paper):

✦ 语言:英文PDF格式。

✦ 格式:IEEE 会议论文双栏模板

✦ 篇幅:不超过 6 (含参考文献)。

✦ 评审:双盲评审,每篇稿件由 3 位程序委员会委员评审。

✦ 出版:录用论文将收入会议论文集(需至少一位作者注册参会),并将提交收录至 IEEE Xplore

06最佳论文奖项

🏆 最佳学生论文奖 —— NLP 与语音方向

🏆 最佳学生论文奖 —— 语言学方向

🏆 最佳学生报告奖

07组织机构

名誉主席:

阮秋琦(北京交通大学)、甘明刚(中央民族大学)

大会主席:

李海洲(香港中文大学〔深圳〕)、翁彧(中央民族大学)

程序委员会主席:

赵悦(中央民族大学)、于静(中央民族大学)、王磊(华为新加坡研究所)

组织委员会主席:

刘轩(中央民族大学)、蔡思琪(哈尔滨工业大学〔深圳〕)、董明会(深圳河套学院)

财务主席:

徐晓娜(中央民族大学)、吴龑(新加坡科技研究局)

注:完整组委会名单(含出版、宣传、财务、注册各分会主席及委员)请见大会官网。

主办单位· Organised by

  

中央民族大学 · 新加坡中文与东方语言信息处理学会(COLIPS

协办单位· Co-organised by

香港中文大学(深圳) · 深圳河套学院

技术支持· Technically sponsored by

IEEE 北京分会 ·IEEE 新加坡分会 SMC 专委会 ·IEEE 广州分会 SP/COM 深圳联合专委会

了解详情 · 在线投稿

www.ialp2026.org

论文投稿截止:2026  7  15 

金秋北京,与您相约 IALP 2026

阅读原文

跳转微信打开

上古70年•融合出版 丨让古籍“活”起来:“尚古汇典・古籍数字服务平台”的传承创新之路

2026年6月20日 00:00

徐惠 2026-06-20 00:00 江苏

上海古籍出版社介绍尚古汇典古籍数字平台资源、技术与服务成果。

转载自“上海古籍出版社”

本月主题为“融合出版:从数字化到数智化”

让古籍“活”起来:“尚古汇典・古籍数字服务平台”的传承创新之路

在中华文明数千年绵延发展的历史长河中,古籍作为传承中华优秀传统文化的重要载体,系统记载了中华民族的思想成果、历史经验与精神追求。2026年,上海古籍出版社迎来建社70周年。七十载春秋,一代代古籍出版人薪火相传,在纸墨间守护文明根脉;新时代征程,我们以数字技术为翼,打造“尚古汇典・古籍数字服务平台”(以下简称“汇典平台”),让沉睡千年的典籍走出深阁,在人工智能时代焕发新生。

2021年9月,在上海世纪出版集团统一规划下,“汇典平台”启动建设,2023年8月正式上线运营,实现了我社古籍数字化领域从零到一的历史性突破,开启了传统出版与数字技术深度融合的新篇章。

一、顺势而为:在时代课题中探寻破局之路

上世纪80年代以来,我国古籍数字化建设逐步兴起,各类专题数据库相继落地。然而,行业标准不统一、数字化水平参差不齐、内容同质化等问题,始终制约着古籍资源的活化利用。随着人工智能技术的飞速发展,社会各界对古籍智能化服务的需求日益迫切,全面提升古籍数字化建设水准,成为古籍出版行业必须回答的时代命题。

立足行业发展大势,我社提前谋篇布局:2020年1月,开展人才引进、队伍培养、制度改革,筑牢数字化专业团队根基;2021年9月,正式启动“汇典平台”建设。平台于2021年9月、2022年10月入选《上海市社会主义国际文化大都市建设“十四五”规划》《2021—2035年国家古籍工作规划》,跻身国家与上海市重点文化建设项目名录。

依托七十年来积累的深厚出版资源和专业优势,“汇典平台”以“资源+技术+服务”三维融合为核心,致力于破解古籍“保存难、传播难、利用难”的行业痛点,为古籍保护传承与开发利用探索全新路径。

二、厚积薄发:汇聚优质古籍资源,填补市场空白

作为古籍文献出版领域的中坚力量,我社七十年来深耕大型与超大型集成性古代文献资料、古籍整理和学术研究著作出版等关键领域,积淀了一大批立得住、传得开、留得下的精品力作。这些珍贵资源,正是“汇典平台”扎根铸魂的源头活水。

目前,平台已建成三大核心数据库,共收录典籍8000余种,总字数超21亿字,形成了整理本古籍与原版古籍相得益彰的资源格局。

•典籍整理文献数据库:学术研究的权威基石

该库收录资源以我社出版的核心整理本古籍为主,同时收录上海世纪出版集团内外相关出版社的优质资源,其中90%的资源为首次数字化,有效填补了市场空白。目前已上线五期,共收录资源5100余种、超12亿字。内容涵盖经史子集各部,核心资源包括“中国古典文学丛书”、“清诗话”系列、“中国历代书目题跋丛书”、“商周青铜器铭文暨图像集成”系列、地方文献及大家文集等,全面展现了我社在古籍整理出版领域的深厚积淀,为学术界提供了全面、权威的数字资源支撑。

•中国地方文献总库:地域文脉的数字档案

该库聚焦地方历史文化传承,收录地方志、家族谱牒、金石文献、地方文集、汇编档案等权威资源。

上海文献总库・上海府县旧志数据库:该库收录1949年前上海地区101种府县旧志,约4200万字,较完整地展现了上海的历史面貌。

上海文献总库・上海市志数据库:该库收录64种第二轮新编地方志书,约8000万字,系统反映1978-2010年上海改革开放的发展历程。

浙江文献总库(一期):该库收录《台州文献丛书》等500余种资源,约6000万字,丰富了地方文献资源谱系。

•汇编文献总库·文渊阁《四库全书》AI+版数据库:大众读典桥梁,学术研究利器

该库基于我社影印出版的文渊阁《四库全书》,完成数字化建设,收录典籍3000余种、79000余卷、总字数超8亿字。支持版式还原与流式双显两种图文对照阅读模式,配备精准全文检索、复制征引、查看原书图片等核心功能;同时集成自动标点、自动标引、文白翻译、智能问答等智能工具,既为普通读者搭建古文阅读桥梁,也为专业学者打造高效研究利器。

三、自主创新:打造古籍数智化核心技术体系

人工智能技术的突破,为古籍数字化与智能化发展开辟了广阔空间。我社坚持技术自主创新,依托深厚的专业积累,自主研发了涵盖古籍OCR系统、自动标点、自动标引、智能问答在内的古籍数字化核心工具链,显著提升了古籍整理与研究的效率。

2024年,平台推出原版古籍OCR“个人版”与“机构版”双版本系统,精准适配不同用户需求;2026年模型升级后,复杂版式、手写文字的检测准确率提升至99%以上。在此基础上,我社启动了古籍整理平台建设,在OCR系统的基础上,整合项目管理、图像管理、文本识别、多人协作、格式化导出等功能,构建一体化工作环境,大幅降低古籍基础整理成本。

2025年建成的“尚古汇典・古籍深度学习平台”,是专为古籍领域打造的低代码/无代码AI平台。用户无需编程,即可自主完成数据标注、模型训练到应用部署的全链路操作。平台预置近100个主流模型,提供知识问答、版式检测、文字检测、文字识别、自动标点、命名实体识别等开箱即用的功能,将以往繁琐的人工作业转化为高效的自动化生产力,实现了古籍数据向系统知识的深度转化。

四、多元发展:构建便捷服务的产业生态体系

截至目前,“汇典平台”已累计服务机构用户300余所,覆盖全国34个省级行政区及东亚、北美、欧洲地区,用户涵盖高校、科研院所、公共图书馆、博物馆、出版机构等。平台打造了“资源服务+技术赋能”双轮驱动的核心服务体系:

资源服务方面,面向海内外提供优质整理本和原版古籍的在线阅读、检索、征引、AI+服务,打破了传统古籍阅读的时空限制,极大提高了古籍资源利用率,为学术研究者和传统文化爱好者提供了便捷的数字通道。

技术赋能方面,一方面提供高精度OCR服务,解决古籍文献数字化转换难题;另一方面提供定制化数据库建设服务,先后完成四川大学“儒藏数据库”、“浙江文献总库”等多个专业数据库的建设。

通过“技术+内容”双重赋能,“汇典平台”既拓展了传统出版社的商业价值边界,又系统性推动了传统文化资源的活化利用与当代传播。

“汇典平台”的建设,不仅推动我社从传统纸质出版向数字出版转型,更成为上海出版行业合作共建的重要平台,聚合了行业优质资源,促进了出版社之间的资源共享与协作交流。

五、未来可期:让古老文脉在数字时代绵延赓续

七十载栉风沐雨,守正传薪;新时代勇立潮头,创新致远。“汇典平台”从无到有、从小到大的建设历程,仅仅是我社拥抱智能化时代的一个起点。

未来,我社将不断推进数据资源建设,持续提升古籍工作智能化水平,优化平台功能,探索更加多元的服务场景,贯通资源、技术与应用之间的链路,协同产学研各方共同参与古籍数字化建设,助力更多传统文化爱好者轻松跨越古文阅读障碍,更好地服务学术研究。

以数为舟,载文远航。站在建社70周年的新起点上,我社将继续秉持“传承中华文化,打造传世精品”的初心使命,以科技赋能文化传承,让千年古籍活在当下、走向未来,为建设中华民族现代文明贡献力量。

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

2026「漢字漢文教育」研究生國際研修營第一號通知(澳门科技大学·2026年7月)

2026年6月19日 00:00

徐惠 2026-06-19 00:00 江苏

澳门科大七月举办汉字汉文研修营,面向海内外研究生开放报名。

转载自“IJChL语言学报”

2026「漢字漢文教育」研究生國際研修營第一號通知

報 名 徵 集

「漢字漢文教育」研究生國際研修營是漢字漢語研究界聲譽頗高的跨國青年學子學術夏令營活動,由中國和韓國「漢字漢文教育國際聯盟」學術組織發起,影響力遍及中國、韓國、日本、越南等漢字圈國家。其主旨為:以漢字作為共有文化記憶符號,融合漢字圈國家學界力量,持續凝聚東亞學術話語,以國際研修營形式聚集各國青年學子,促進學界友好交流。 

為進一步推動漢字文化學術研究,促進國際學術合作與跨文化交流,為青年學者提供良好的專業培養機會,茲定於2026年夏季在中國澳門舉辦2026「漢字漢文教育」研究生國際研修營。本次研修營將在澳門科技大學舉辦,期待能為各國學者搭建多元化的學習與交流平台,同時也將促進研修營學員對澳門文化特色的感知與理解。研修營自即日起啟動報名徵集,誠邀海內外高校青年教師和研究生報名參與。現就2026「漢字漢文教育」研究生國際研修營相關事項通知如下,敬請知悉。 

(1) 會議時間:2026年7月13日至7月20日

(2) 會議主題:AI時代漢字作為共有文化記憶的符號

(3) 會議地點:澳門科技大學

(4) 舉辦單位

  • 主辦單位:澳門科技大學

  • 承辦單位:澳門科技大學國際學院、國家語言文字推廣基地(復旦大學)澳門夥伴基地、「一帶一路」葡西語國家與地區中文師資培訓基地 

  • 合辦單位(音序):北京師範大學文學院、東亞知識文化教育研究所、國立韓國教員大學人文社會科學教育研究所、廈門大學、香港大學中文教育研究中心、鄭州大學漢字文明研究中心、中國海洋大學、中山大學中國語言文學系(珠海)

  • 贊助單位:澳門基金會

(5) 主講嘉賓(按音序) 

  • 董志翹教授(北京語言大學/南京師範大學 中國訓詁學研究會學術委員會主任) 

  • 金錫永教授(韓國教員大學中文系主任 韓國中國人文學會會長) 

  • 李運富教授(鄭州大學 國家語委研究機構中華漢字文明研究中心主任) 

  • 牛振教授 (鄭州大學文學院副院長 國家語委研究機構中華漢字文明研究中心) 

  • 阮黃英教授(越南河內國家大學外國語大學) 

  • 汪維輝教授(浙江大學漢語史研究中心主任 教育部中文学科教学指导委员会委员) 

  • 許喆教授(韓國釜山大學佔畢齋研究所) 

(6) 招生規模及報名日程

  • 招生規模:30人(暫定),將根據投稿論文摘要進行評選。

  • 報名方式:在線報名(論題、摘要、關鍵詞)(論文摘要字數:300-500字,投稿信箱:hanzicamp2026@126.com

  • 論文摘要截止日期:2026年6月25日

  • 審查結果通知:2026年6月28日

  • 學員繳費確認截止日期:2026年7月3日

(7) 會務費及住宿安排

  • 會務費:1,200 HKD

    ※會務費包含:學習資料、教學相關費用、歡迎晚宴、閉幕晚宴

    (備註:在2026年6月20日之前投稿並入選研修營可享早鳥價1,000 HKD) 

    ※交通費、住宿費由學員自理。

  • 住宿安排(學員)住宿安排:澳科大學生公寓,四人間,1,200 HKD/每天/4人(根據實際錄取人數、性別等因素協調之後,按照以上優惠價格,共計需7天住宿,每位學員的住宿費用為2,100 HKD/7天/每人)

    ※綜上,每位獲錄取的學員需在7月3日24:00之前完成繳費確認,總計費用為3,300 HKD/每人,6月20日前投稿並獲錄取的學員早鳥價總計費用為3,100 HKD。

    ※繳費帳戶資訊:將於發送錄取通知書時一併提供。

    (特別提醒:入選學員在匯款時,請務必在附言中填寫:姓名+性別+2026漢字漢文研修營) 

(8) 聯繫方式

  • 會務聯繫郵箱:hanzicamp2026@126.com

  • 確認參加人員後,會務組老師將及時創建微信群便於聯繫。

(9) 餐飲安排:除歡迎晚宴和閉幕晚宴之外,學員可自行前往大學各食堂就餐。

(10) 文化參訪計劃:澳門媽祖閣、澳門歷史城區、氹仔龍環葡韻

(11) 日程表

2026「漢字漢文教育」研究生國際研修營秘書處 

2026年4月15日 

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

New | 澳门大学语言学学科QS排名首度跻身全球百强

2026年6月18日 00:00

镜海语言学 2026-06-18 00:00 江苏

以下文章来源于:镜海语言学

镜海语言学

澳门大学语言学研究中心官方公众号

澳大语言学首登QS全球98位,详述学科平台、期刊、跨学科等建设成果。

转载自“镜海语言学”

澳门大学语言学学科QS国际排名

首度跻身全球百强!

近日,国际高等教育权威机构Quacquarelli Symonds(简称“QS”)正式发布了2026年世界大学及学科的国际排名。澳门大学语言学学科表现卓越,以全球第98位的靓丽成绩首次跻身世界百强!这一历史性突破,标志着澳门大学语言学的国际影响力和学术竞争力迈上了一个全新的台阶。

回顾过去六年的排名历程,澳门大学语言学科走出了一条扎实的上升曲线。2021年起基本上以一年上一个台阶的速度进步,从当年的251-300区位,一路上升到2026年第98位,成功跻身全球百强。每一步提升都凝聚着澳大语言学学科全体师生的智慧与汗水,凝结着领导的关心和学界的支持。

在本年度QS语言学学科全球百强榜单中,中国两岸四地共有12所高校入围。年轻的澳门大学竟与北京大学、香港大学和台湾大学等一众语言学传统重镇同列,我们深感荣幸,心怀感激!

澳门大学语言学学科近些年来始终秉持“精钻研、跨学科、国际化”的发展理念,在学术研究、平台建设与国际合作领域持续深耕,取得了一系列重要进展。

组建研究中心,协同创新发展

2022年3月,澳门大学语言学研究中心在澳门大学人文学院揭牌成立。澳门特别行政区长期通行多种语言,文化景观多元并存,堪称“多元文化的鲜活博物馆”和“多种语言的天然实验室”;澳门大学人文学院针对不同语种,同时设有中文系、英文系、葡文系、日文系。这为中心整合学术资源,组织跨语种课题合作打下了坚实的基础。中心自成立以来,致力于推动各学系、各语种研究团队之间的协同发展,聚焦跨语言比较、深耕理论探索,持续产出大量高水平有影响的学术成果,同时进一步壮大了澳门大学语言学研究集群的力量。

欢迎访问澳门大学语言学研究中心官网:https://linguistics.fah.um.edu.mo/home/

深耕特色期刊,推动学术对话

《澳门语言学刊》2022年起由澳门大学人文学院接手主办。作为港澳地区最具权威性的语言学专业期刊之一,学刊始终坚持严格的匿名审稿制度,聚焦中国境内语言及跨语言研究,近年来又特别增设“境外语言学著作文摘”等特色栏目,促进境内外学术成果交流。我们还连续多年主办了“70后语言学优秀学者”的国际评选活动,其目的是尽可能减轻项目经费和刊物档次等时下所谓的指标对学术研究的过度干扰和扭曲,引导年轻学人聚焦体系性和原创性的学术贡献,受到了学界的广泛好评。2025年起,刊物携手香港三联书店升级出版流程,进一步扩大了国际传播力和学术影响力。

共筑学术高地,深化国际合作

澳门大学自2023年开始跟北京语言大学共同主办《中国语言学报》(Journal of Chinese Linguistics,JCL)。是年8月,“《中国语言学报》创刊50周年学术研讨会”在澳大成功举办,澳门编辑部同时启用。澳大参与主办后,积极推动刊物扩容。本刊原为半年刊,2024年起扩容为一年3期,2027年起又将进一步扩容为一年4期。作为入选SSCI和A&HCI双索引系统的语言学领域重要期刊,JCL汇聚海内外顶尖学者,探讨一系列前沿议题。澳门编辑部的成立,不仅强化了刊物的全球协作网络,也为澳大语言学学科进一步融入国际学术共同体注入了新动能。

拓新跨学科研究,筑牢神经语言学

与语言加工研究根基

澳大人文学院语言学学科积极开展跨学科研究的深度探索与实践,其中以神经语言学和多语言加工为核心的跨学科研究成果尤为突出。该领域的研究工作由翻译传译认知研究中心牵头,深度联动澳门大学认知与脑科学研究中心,并与科技学院、社会科学学院心理学系等机构开展跨院系合作,同时整合校内外多领域学术资源形成研究合力,成为推动学科创新发展的重要引擎。研究团队聚焦澳门多语言社会的独特优势,围绕中、葡、英三语展开跨语言、跨模态迁移的神经认知机制研究,综合运用眼动追踪、脑电图(EEG)、功能磁共振成像(fMRI)等前沿实验技术,系统探究三语者的语言加工、跨语言切换及执行功能的神经基础,为双语/多语优势假说提供关键的神经认知证据。在研究过程中,团队攻克了 MRI 扫描中多模态刺激呈现、头部运动控制、声音采集与降噪等多项技术难题,构建了澳门大学脑图谱(University of Macau Brain Atlas)—— 这一基于表面的功能性脑图谱数据库,整合了多语言、多模态、多人群的脑功能映射数据,即将面向全球科学界发布并开放使用,成为国际语言学与神经认知科学领域的重要公共研究资源,也让澳大在多语言脑认知研究领域形成了鲜明的国际特色与学术优势。

助力学科创新,搭建全球平台

2024年3月17日,由澳门大学语言学研究团队牵头,国际语法研究学会(International Association of Grammar Studies,IAGS)在中国澳门成立。学会筹备成立期间便得到了海内外知名学者的广泛响应和大力支持。2024年12月1-4日,澳门大学成功举办了学会的首届学术研讨会。中山大学2025年11月20-23日成功承办了第二届学术研讨会。两次研讨会都吸引了百余位语法学者踊跃参加。大家围绕形式语法、构式语法、方言研究、语言类型学、汉外对比、人工智能与语法研究等多个前沿议题展开热烈讨论。第三届学术研讨会即将于2026年11月20-22日在郑州大学召开。欢迎各位同仁共襄盛举,踊跃投稿!

有兴趣参加者请提供A4纸尺寸一页以内的中文或英文论文摘要。会议投稿截止日期是2026年8月14日,投稿邮箱为:iags_2026@163.com。

国际语法研究学会在内容上倡导“跨学科、跨学派、跨语种、跨国界、跨古今”的“五跨”新理念,在会议形式上倡导“平等、和谐、自在、简约、高效”的“五项”的新风尚。我们在国内外语言学领域的学术社团总数已经很多的情况下,之所以要成立一个新学会,绝不是为了赶热闹,凑数字,而是为了突破当今语法研究领域基于语种和学派的条块分割现状。我们就是要在语法研究领域打通古今与中外,对接事实与理论,引导跨界交流,激活大脑风暴,推动理论创新。我们尊重观点不同,享受学术差异!

虚心地学习他人,自信地展示自我

本着“平等、亲切、务实”的圆桌精神,由本校博士生主导的学术俱乐部“镜海语言学社”自2021年起每年举办一届“镜海语言学圆桌研讨会”,邀请澳门地区其他兄弟院校师生及在澳访问的学者跟澳大师生一起探讨共同感兴趣的学术问题,发表研究报告,交流研究心得。宾主一致认为我们的圆桌研讨会“极度宽松、极度务实、极度自在”。我们倡导师生互动、主客互动、内外互动。会议形式虽然简单,但是效果显著,意义重大。作为承办单位,我们自己的老师,我们的同学,不仅搭台,更要唱戏,人人都是此一学术活动平等的推动者和参与者。

创新学术传播,连接学界社群

由澳门大学语言学团队运营的微信公众号“镜海语言学”自创立以来,充分平衡专业深度与大众传播,一方面建立了“成果速递”“论文推介”等栏目,持续推送来自《澳门语言学刊》《中国语言学报》和澳门大学语言学团队的最新研究成果,另一方面特别设置了“镜海心得”专栏,积极接收来自学界同仁的踊跃投稿,将晦涩的学术问题转化为鲜活易懂的随笔,不间断地分享诸位同仁从日常研究工作中总结得来的宝贵经验。得益于学界同行的关注和支持,短短3年间,账号关注人数已由不足千人快速增长近万人,用户覆盖海内外众多高校的师生。公众号以新鲜活泼的内容和别具一格的形式赢得了学界朋友的广泛赞誉,成为澳大连接海内外语言学人的“云端俱乐部”和澳大语言学团队在学界发声的“天空麦克风”。欢迎更多同道扫码关注!

我们深知,自己的工作虽然取得了些许进步,但是仍有很多缺点和不足,有很多地方需要向兄弟院校学习。正因为如此,我们才更有必要以此为新的起点,不骄不躁,再接再厉,继续开拓创新,再攀高峰!站在全球百强的新起点上,澳门大学语言学学科将继续依托澳门“一国两制”的独特优势,以更开放的姿态、更扎实的工作,与全球语言学同仁携手,为语言科学的创新发展贡献更多“澳大智慧”。

此外,澳大语言学科为配合学校的发展战略,近年来大幅度地扩大硕士生和博士生的招生名额。我们热忱海内外有志学子积极报读!

让我们共同期待,澳门大学语言学学科在国际学术舞台上书写更加辉煌的篇章!

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

别让 AI 替你成长:它是助手,不是leader,更不是责任人

2026年6月16日 16:34

随园厚学 2026-06-16 16:34 江苏

过度依赖AI怎么办?

本文来自科学网博客

最近批阅课程作业、指导学生项目,有个现象越来越突出:不少提交上来的学习计划逻辑周严、地图美轮美奂、软件数据库功能强大、界面美观,纸面看起来无可挑剔,可一到面谈,稍谈细节,学生就支支吾吾答不上来。追问之下才坦言:内容大多是交给AI一键生成的,自己连通读一遍、调整都没做,就交了上来。

也许不止一个学生抱着这样的心态:反正 AI 能生成,凑出成品交差就行。把提示词丢给豆包,坐收一份看起来合格的结果,仿佛完成任务的是AI,自己只是个 “提交员”。可这里面藏着一个最根本的定位偏差:AI从来都只是助手,它做不了你的leader,更当不了你的责任人。把学习和成长的主导权拱手让给工具,最终买单的永远是自己。

AI做不了你的leader,因为它不懂“你是谁”。

很多人喜欢让AI直接做计划、搭框架、出方案,省掉了自己思考的麻烦。可AI输出的永远是“通用最优解”,它不知道你的作息习惯、你的知识盲区、你真正想达成的目标,更不知道你眼下的困境与诉求。

一份你自己梳理的学习计划,哪怕粗糙,也是基于你对自身精力、薄弱项、优先级的判断;而AI生成的完美时间表,本质是套在所有人身上的通用模板,放到你身上大概率水土不服。一张你亲手搭建的知识地图,哪怕有疏漏,也是你对学科体系的一次主动思考和建构;而AI自动生成的图谱再完整,也只是知识点的机械拼接,没有经过你的思考,就永远不会内化成你的认知。一段AI写出的代码,哪怕能顺利运行,如果你不懂背后的逻辑、不知道每一步为什么这么写,那它就永远不是你的能力。

这几天老师们在讨论,AI时代,我们普通老师能教给学生什么?!

这个灵魂拷问,不是今天才有!互联网来了,精品课程来了,搜索引擎来了,国外课程来了,AI来了,每一次,领导都会拷问我们,现在学生有了新武器,你的课还怎么上?!

这种焦虑在蔓延,可是答案又那么地简单!

孔子的教学相长、因材施教,苏格拉底的助产术,都是要培养人在社会中的知识技能、沟通交往能力,发现和解决问题的能力。如果我们懒于思考和训练,今后连提示词也许都写不出来,虽然在未来,AI的进化也应该不需要提示词。但是,人们发展AI,是为了提高生产力,而不是全员躺平,对于人的训练,能够把控和操作AI的人的训练培养尤为重要。

真正的leader,要定义目标、选择路径、为结果负责。而这些,只有身处具体情境中的你能做到。把方向权、决策权交给AI,看似省了力气,实则是放弃了对自己成长路径的主导权。你连自己要去哪、为什么去都没想清楚,工具给的路再平坦,也走不到你真正想去的地方。

AI更当不了责任人,所有后果最终都由你来扛。

应付作业的学生常有一种侥幸:反正老师看不出是AI写的,能过关就行。可过关容易,成长骗不了人。

作业不合格,扣分的是你;答辩答不上来,挂科的是你;将来走进职场、做研究,拿不出真才实学,碰壁的还是你。AI不会替你承担学术不端的风险,不会替你补上思维训练的缺口,更不会替你走过那些必须亲自试错、亲自打磨的成长环节。

学习的本质从来不是交付一份完美的成品,而是完成一次思维的训练。人与人的差异,除了外貌,更关键的在大脑。AI替你跳过了过程,直接给了结果,看似走了捷径,实则绕开了最核心的成长。

你让AI替你扛下了“完成任务”的责任,可人生里所有真正重要的关口 —— 考试、答辩、求职、做研究 —— 没有一关是AI能替你上场的。所有偷过的懒,最后都会变成实打实的能力缺口。

把AI放回“助手”的位置:人主导,工具赋能

当然,我从不反对使用AI。恰恰相反,在数字人文、计算语言学的领域里,大语言模型本就是我们必须开发和善用的核心工具。问题从来不是“用不用 AI”,而是“谁来主导谁”。

我们做语料库研究、做人文大数据分析,从来都是人文学者提出问题、定义标准、解读结果,技术工具负责处理海量数据、完成机械计算。AI再强大,也替代不了人对文本的细读、对历史的共情、对文学的审美,替代不了研究者的问题意识与价值判断。技术是用来拓展人的边界,而不是替代和掌控人的思考。

工具越强大,人的主体性就越重要。你越会驾驭工具,就越不能被工具驾驭。

写在最后

我时常跟学生说,大学四年最珍贵的,不是拿了多少高分,而是练出了多少能带走的能力。AI可以帮你更快地完成作业,可以帮你省去很多机械劳动,但它替不了你思考,替不了你试错,更替不了你成长。

别把AI当成可以甩锅的责任人,也别让它成为替你掌舵的 leader。它只是你手里的工具,是帮你走得更快的助手,而路终究要你自己一步一步走,方向终究要你自己选,成长的责任,也终究要你自己扛。

毕竟,你才是自己学业、学术和人生的第一责任人。

(PS:本文也是AI辅助完成,节约了大量的备课时间)

转载本文请联系原作者获取授权

比特人文

投稿邮箱:dhbase@126.com

扫码关注 获取更多资讯

图片

阅读原文

跳转微信打开

❌