业务前沿 | 当文化遗产开始“说机器的语言”:智慧数据如何打开档案的未知世界

在开放档案信息系统参考模型(OAIS)里,“数据”是以形式化方式对信息的可再解释的表示,适于交流、解释或处理,例如一串比特、一张数字表格、一段口述录音。它提醒我们:数字化只是数据进入机器可处理世界的一道门,而不是它成为数据的起点。那么,我们手上这些天然就是数据的材料,如何才能被机器可靠地理解、被智能地运用?这正是“智慧数据”(Smart Data)想回答的问题。

什么是智慧数据



大数据常被概括为多个“V”:体量(Volume)、速度(Velocity)、多样性(Variety)、可变性(Variability)、真实性(Veracity)。但这些V最终都指向一个未被言明的V——价值(Value)。
大数据靠规模自上而下地提炼出价值,智慧数据则自下而上地把价值托举出来。它的定义并不依赖体量,而依赖六种品质:可信的、情境化的、相关的、认知的、预测的、可消费的。




智慧数据生成的三个阶段



文化遗产如手稿、符号、壁画、声音、气味、三维文物和仪式行为,往往不是标准文本,也无法直接被机器读取。它们的意义还依赖特定的时代、地域、技艺和社群。机器能够识别一个符号,并不意味着它能理解这个符号为什么产生、如何使用以及对相关群体意味着什么。


数字化是把纸张、器物、声音、建筑等文化遗产转换成图像、音频、视频或三维模型。但如果只有一个文件,未来的使用者可能不知道它来自哪里,也无法判断它是否可靠。
因此,数字化必须伴随文献记录:原件由谁收藏,何时形成,使用什么设备采集,是否经过修复、裁切或图像增强,文件采用什么格式,归谁所有……这些信息共同构成数字对象的来源与证据链。


数据化是把图像、声音等非结构化资源转变为结构化或半结构化数据。
面对一页手稿,系统需要识别版面、文字行和字符;面对一件文物,需要记录名称、年代、材质、尺寸和制作工艺;面对一段声音,则要标注声源、时间、地点和相关物种。必要时还要使用规范词表、分类体系和统一标识符,以减少同物异名、同名异物造成的混乱。
人工智能可以提高识别和标注效率,但自动生成的结果应与人工著录明确区分,同时保留模型版本、置信度和专家修改记录。


情境化是智慧数据形成的关键。它把孤立的数据与人物、地点、时间、事件、作品、机构和其他馆藏资源连接起来。
一份琴谱可以关联谱字、指法、演奏音频、琴曲版本、琴家和传承谱系;一件三维文物可以关联出土地点、修复记录、同类器物和历史文献。通过知识组织系统、本体和知识图谱,不同机构、媒介与语言的数据才有可能彼此对话。
如果说数字化回答“它是什么样”,数据化回答“它包含什么”,那么情境化回答的就是“它与什么有关,以及我们为什么这样理解它”。



世界各地的智慧数据实践

KuroNet与eScriptorium
日本古籍中的“崩字”与现代日文字形差异很大,字符还可能相互连接、大小不一,并与纸张污渍和印刷纹理混杂。即使完成高清扫描,普通文字识别系统也很难直接处理。
日本人文学开放数据共同利用中心开发的KuroNet,利用人工智能目标检测技术在古籍图像中寻找字符并进行转录。其后推出的“miwo”应用允许使用者用手机拍摄古籍,再由系统把崩字转换为现代字符。当前模型尤其适合江户时代木刻本,也可辅助识别部分手写文献。

与之相似,开源平台eScriptorium提供了从导入图像、划分版面和文字行,到人工转录、训练模型、自动预测、专家校订和数据导出的完整流程。它提醒我们手稿识别并不是按下“OCR”按钮,而是机器处理与人工知识不断往返的过程。
Merlin Bird ID
美国康奈尔大学麦考利图书馆收藏来自世界各地的野生动物照片、录音和视频。单独保存一段鸟鸣,只能留下声音;如果把它与物种名称、分类体系、录制时间、地理位置、环境和记录者关联起来,它就成为可以用于科学研究的数据。

项目团队利用经过标注的照片和声音训练机器学习模型,并将成果用于Merlin Bird ID等识别工具。使用者录下一段鸟鸣后,系统可以提供物种预测;新的观察和专家核验又能继续丰富资料库。

这形成了一个循环:档案为AI提供可信训练数据,AI扩大档案的发现与利用范围,公众参与则不断补充新的记录。声音档案由此不再只是等待播放的文件,也成为支持物种识别、科学研究和生物多样性保护的基础设施。
EUreka3D
三维文物看似已经包含丰富信息,但一个能够旋转和缩放的模型并不天然就是智慧数据。除了几何结构和表面纹理,还需要记录文物尺寸、采集设备、建模方法、处理软件、精度、文件版本、权利状态,以及哪些部分来自原始测量、哪些部分属于推测性重建。这些关于数字对象形成过程的信息通常被称为“过程数据”或“旁数据”。

欧洲EUreka3D项目建设的数据中心,可以保存三维模型的不同版本和格式,管理访问权限,为模型添加Europeana数据模型兼容的元数据、情境信息和旁数据,并分配持久标识符。经过这些处理,三维模型才有可能被稳定引用,并用于研究、保护、教育、虚拟展览和扩展现实应用。
WarSampo
芬兰WarSampo以人物、部队、地点、时间和事件为共同节点,将伤亡名册、战地日记、历史照片、军事单位、战俘记录、战争墓地和历史地图组织成相互关联的知识网络。

对阵亡者家属而言,这意味着亲人的名字可以从一条冰冷的伤亡记录重新进入具体的时间、地点和社会关系;对历史研究者而言,则可以从个体追踪进一步转向群体比较,研究人员流动、部队经历、地域差异和战争伤亡等问题;对公众而言,战争也不再只是年份、战役和统计数字,而重新显现为无数具体生命共同承受的历史。

WarSampo把原本无法互相说明的材料转化为能够彼此印证的证据网络——让档案利用从“找到一份记录”,进一步走向“理解一个人及其所处的历史”。



真正的智慧数据,不只是让机器读懂文化遗产,更要让每一次识别、解释和关联都有出处、能验证、可追溯。只有这样,技术生成的“智能”才能转化为值得信赖的文化记忆。
编辑&排版 | 陶文琴
校对&审核 | 张晨阳 任婧怡





