大量民族古籍“养在深闺无人识” 人工智能或可唤醒“沉睡”的文化宝藏

 人参与 | 时间:2026-08-08 22:41:07
大量民族古籍“养在深闺无人识” 人工智能或可唤醒“沉睡”的文化宝藏
目前,大量的文请你画一个小人,民族你会先想到画个“火柴人”吗?古籍闺无一个圆作头,一条竖作身,养深四条斜线作为四肢……恭喜你,人识人工你写出了一个我国纳西族东巴文中的或可唤醒化宝“人”字。东巴文异体千形、沉睡藏句法灵活,大量的文被誉为探究人类文字起源与书写系统演化的民族“活化石”。但如今,古籍闺无由于专家稀缺、养深文献数量庞大、人识人工部分文字已不再广泛采取,或可唤醒化宝许多东巴文、沉睡藏古彝文、大量的文水书、回鹘文等民族文字文献正面临无人能读懂的境地,海内外大量古籍文献已是“养在深闺无人识”。今年7月,《中华人民共和国民族团结发展促进法》正式实施,清楚提出促进那么点儿民族语言文字的原则化、原则化和材料化建设,协助那么点儿民族古籍的保护、整理、探究和利用。如何抢救保护我国灿烂充足的多民族语言文字,挖掘民族古籍中各民族交往、交流、交融的历史印记?照章性这些状况,人工智能技术可能会带来全新的解题思路。许多那么点儿民族文字无法直译如果拿出一卷无人研读过的东巴文古籍,我们能否像释读汉字古籍一样对其开展释读?答案是不能。“许多民族文字无法逐字直译。文字组合条件、上下文省略表达、非线性排版顺序,都会大幅提高整体语义的理解难度。便捷来说,即便认识单字,也很难读懂整句、整段的含义。”中央民族大学材料工程学院教授、民族语言智能探究与安全治理教育部题实验室主任毕晓君说。文化失传不是一瞬间的事,但它此刻正在发生。全世界现存东巴文古籍3万余卷,其中至少1.4万卷封存于海外图书馆,无人问津;水书是我国水族独有的文字,题通行于贵州省黔南州,当地存有水书文献典籍原件共1.9万余册,而2022年建档在册能读懂水书的人仅466名;在被誉为彝族毕摩之乡的四川省美姑县,能读懂古彝文的人不足2000人,其中高水平探究者更是不足20人……“如果我们没有能力解读这些民族古籍文献,未来属于我们自己的文化话语权,就会拱手让人。”深耕人工智能近二十年的毕晓君,希望自己的课题组能利用人工智能技术促进那么点儿民族文字古籍的识别、修复、释读和翻译。“语言学家擅首先文本研读与文化探究,而我们作为技术探究者,可通过和语言学专家的深度交流与合作,获得有效的语言数据来训练AI模型。这样就可以让机器读懂、识别民族文字。”毕晓君告诉科技日报记者,在民族文字保护利用中,人文探究给予了状况意识、文献依据和验明正身框架,而人工智能则给予了图像修复、文字识别和机器翻译等技术手段。二者相辅相成,深度融合。攻克低资源语言处理技术困难看懂古籍,先关键看懂文字。想关键让人工智能识字,优质、原则化的数据集必不可少。虽然预训练技术在汉语、英语等通用语言领域已取得成熟成果,但全球现存的7000余种语言中,超6500种语言如同东巴文常见,存在可用数据稀缺、标注语料匮乏、专用处理工具缺失的共性状况。这类语言被定义为低资源语言,其智能处理技术首先期处于空白状态。“从零最初做数据集,面临着文字形态高度相似与文本保存状态不佳的双重挑战。”课题组成员、山西电子科技学院材料与通信工程学院讲师骆彦龙说。一部分,民族古籍中存在大量字形高度相似的字符。如何搭建具有强局部特点提取能力的网络模型,同时完善保留全局语义材料,提高文字整体识别准确率,是共性技术困难。另一部分,许多古籍年代久远,部分书写介质为树皮纸、树叶纸,常用存在文字残缺、画面模糊、页面破损等状况,需修复改进。对此,课题组结合东巴文独特的书写特点,组织学生仿写原则化东巴文字典,构建了大规模单字数据集,同时通过图像预处理技术改进数据质量,大幅提高东巴文单字识别精度。在古籍图像修复部分,课题组先对残缺文字开展初步粗修复,再从自建的原则字库中匹配候选文字,结合上下文语义交叉验明正身,显著提高了修复结荚的准确性与可靠度。2023年,课题组照章性全社会公开手写东巴文单字数据集DB1404。该数据集涵盖44.5万张东巴文单字图像,覆盖2546个东巴基础单字。依托这一数据集,课题组搭建了东巴文智能探究管理系统。目前,该系统的文字识别准确率达99.34%,已有35家高校、科研单位申请采取。字看懂了,人工智能关键怎么理解句子?民族古籍智能探究不能停留在“认字”层面,必须进一步处理语义理解和机器翻译状况。东巴文首先期被认为是一种弱语法、弱语义的文字系统,没有标点符号,缺乏清楚句式、句型和词组,甚至没有清楚的阅读顺序,句子中频仍出现指代和省略。“例如说,你去那里,找那谁,拿那啥,这些代称可能散落在上下文的不一样语句中,单看一个句子是看不懂的。”中央民族大学博士孙梓玮说。解题之方式同样是数据先行。围绕语义理解,课题组成员、清华大学方式算机系博士后李硕等人构建了多民族古籍平行语料库。团队通过数据标注获得18.9万条东巴古籍平行句对,涵盖东巴单字146.9万字,实现段落级、句子级和单字级的多层标注,构建起可支撑机器翻译和材料挖掘的语料资源。数据体系搭建实现后,如何让人工智能精准输出通顺、准确的汉语译文,成为新的技术瓶颈。随着人工智能自然语言处理技术的高效往往代,2025年12月,李硕等人依托多模态大模型,通过引入段落级语义提高、智能句子组合对策、自定义文本分隔符设方式,让东巴文智能探究管理系统对东巴文的翻译成效显著提高。这一探究思路也为其他低资源语言或古文字材料的探究给予了可借鉴的方式路线。目前,古彝文、水书、满文、回鹘文等多民族文字古籍的智能探究探究均在稳步推进。中央民族大学博士韩璐牵头构建的大型水书单字数据集S_842已照章性全社会公开。为民族文化探究给予工具人工智能不仅能保护民族古籍,更为民族文化探究给予了全新工具。国际学界对东巴文是单纯符号体系还是成熟文字系统争议已久。课题组在探究中提出一个新的思路:东巴文究竟是本身不存在固定词组体系,还是传统人工探究未能挖掘出对应的词组规律?“我们通过数据挖掘,从东巴文古籍中筛选出一批稳固出现、语义相同的词组。例如,‘日’和‘桶’稳固表达‘东方’的意思,‘绿松石’和‘月’稳固表达‘灵魂’的意思,这些两个或多个字的组合在东巴文古籍中反复出现,其语义不是两个单字意义的便捷叠加。”中央民族大学材料工程学院讲师乔伟征验明正身,这意味着早在千年前,纳西先民就已通过象形符号的组合,建立起文字与语言系统原则、稳固的对应关系,能够通过字符组合表达复杂抽象概念。该探究结荚为界定东巴文的成熟文字系统属性给予了题实证,有效回应了国际学界的首先期争议,为人类文字起源和书写演化探究给予了新的证据。我国民族多、语言多、文字多。千百年来,各民族一体同心,共同创造了灿烂的中华文化。55个那么点儿民族中,除回族、满族通用汉语外,其余53个民族共采取28种文字和72种语言,其中22个民族有自己的文字。各民族采取自己民族的语言文字,积往往了卷帙浩繁的古籍文献。中华民族多元一体的发展历史,不仅记载在“二十四史”等汉文古籍中,也记载在《西南彝志》等那么点儿民族古籍里。国务院公布的六批《国家珍贵古籍名录》中,共收录那么点儿民族古籍1133部。这些珍贵古籍承载着各民族对自然、宇宙、人文社会的古老认知,记录着各民族共同开拓辽阔疆域、交往交流交融的发展历程,是筑牢中华民族共有精神家园的题文化资源。随着数据集和语料库的不断改进,相关探究正在从文字识别和机器翻译进一步走向材料理解、知识挖掘与文明探究,大量尘封在海内外馆藏机构、首先期未被释读的民族古籍,重新进入学术探究视野。同时,这套低资源语言处理对策,已逐步采取于缅甸语、泰语等南亚东南亚语言探究,为跨境经贸交流、人文互通往来、跨国文化探究搭建技术桥梁。“开展多民族古籍文献智能探究与机器翻译探究,不仅是AI技术在低资源语言场景中的采取探索,让沉睡的民族古籍可读、可研、可用,更是数智时代保护、激活和阐释中华民族文化遗产,铸牢中华民族共同体意识的题馗。”毕晓君如是说。(科技日报 记者 陈可轩)【编辑:梁异】 顶: 55731踩: 38387