其他行业 · 企业知识库 / 内容生成
汉王科技古汉语大模型推动古籍数字化,人员成本下降30%、效率提升50%
汉王科技为国家图书馆构建古汉语大模型,提供句读、翻译、实体抽取辅助理解工具及档案自动著录/题名/分件,人员成本下降30%、效率提升50%,句读指标超培训标注员平均水平,翻译/实体抽取较ChatGPT领先最高55%/28%。
人员成本降30%,效率提升50%
人员成本
下降30%
来源披露
效率
提升50%
来源披露
句读指标
召回率/精度/F1均80%以上,超标注员平均
来源披露
企业痛点
01
业务背景
国家图书馆古籍文献数字化面临无句读、用语规范差异大、多次手抄翻译批注致差异,以及标引著录标准严、新手标注员培训成本高等痛点。
02
遇到的问题
古籍无句读、理解难度大;标引著录标准严、新手标注员上手难、培训成本高。
03
AI 解决方案
构建古汉语大模型,开发句读/翻译/实体抽取三个辅助理解工具;依托抽取生成能力开发档案自动著录/题名/分件等数字化应用。
- 1构建古汉语大模型
- 2开发句读模型(微调句读语料)
- 3开发翻译模型(古汉语-现代汉语双语)
- 4开发实体抽取模型
- 5开发档案自动著录/题名/分件应用
04
实施结果
人员成本:下降30%(-30%)
效率:提升50%(+50%)
句读指标:召回率/精度/F1均80%以上,超标注员平均
05
风险与边界
古籍版本差异大,模型需领域持续微调。
该案例来自北京市科学技术委员会、中关村科技园区管理委员会评选的北京市典型大模型应用,由汉王科技股份有限公司落地(落地客户:国家图书馆),具备较强的示范与可推广性,建议结合自身业务参考落地。
适合
图书馆、档案馆、文博机构古籍数字化
前置条件
古籍语料、标注数据
信息来源
1 个来源页面内容为结构化改写;关键结论应可追溯到以下材料。
关联报告:北京市科委、中关村管委会《北京市人工智能行业大模型创新应用白皮书(2023年)》 · 北京市科学技术委员会、中关村科技园区管理委员会 · 2023