AI 如何融入这个职业
博物馆档案管理员
角色概览
博物馆档案管理员负责获取、整理、保存并提供博物馆的文献遗产——涵盖机构记录、照片收藏、信函往来、展览案卷、捐赠人档案、口述历史以及与藏品相关的文献资料。与追踪实物藏品的藏品登记员不同,档案管理员管理的是为这些实物赋予背景脉络的纸质与数字记录线索:来源考据案卷、策展笔记、修复处理报告,以及机构自身的行政记忆。
在实际工作中,博物馆档案管理员活动于保存科学、信息管理与历史学术研究的交叉地带。他们任职的文化遗产机构规模不一,既有坐拥数百万件档案的大型综合博物馆,也有仅靠一位档案管理员支撑一切的小型专业机构——所管资料从19世纪的购置登记簿,到20世纪90年代的原生数字邮件往来,无所不包。
运营环境始终伴随着资源紧缺的慢性压力、未处理馆藏积压的持续增长、研究者对远程数字获取日益增高的需求,以及数字长期保存的巨大挑战——尤其是在老旧格式、过时介质、机构邮件和数字资产的指数级增长面前,多数博物馆至今仍未形成系统性的应对方案。
AI 如何重塑这一角色
这场变革并非以一次性的颠覆性浪潮到来,而是一连串有针对性的能力升级,正悄然重塑档案管理员的时间分配,以及哪些判断决策依然专属人类智慧。
最直接的转变发生在描述与元数据生成环节。档案管理员过去将大量处理时间花在撰写查找辅助工具上——这种层级化的描述文档使藏品能够被检索发现。如今,经过档案描述标准(EAD、DACS、都柏林核心)训练的AI工具可以从扫描文件中自动起草卷宗级和单件级的描述,将每盒档案的处理时间从数小时压缩到几分钟。档案管理员的角色也相应地从撰写者转变为编辑和质量把关者。
光学字符识别技术已成熟到能够处理19世纪的手写信件——这类长期被视为数字化主要障碍的材料——如今可利用诸如Transkribus等模型进行大规模处理,该模型能学习特定机构的手写风格。这意味着那些因转录积压而数十年无法利用的藏品终于得以重见天日。
在检索利用方面,AI驱动的搜索正在取代仅支持关键词的目录界面。语义搜索工具使研究人员能够使用自然语言和概念性术语查询藏品,而不再依赖受控词表。过去,研究者若想找到任何资料,往往必须先掌握档案术语,而这如今正被改变。这重新定义了档案管理员在参考咨询服务中的角色——用于将研究者提问转译为目录语言的时间减少了,更多的精力得以投入到复杂的来源追溯与背景解读之中。
来源研究工作流同样在经历变化。AI工具如今能以人类研究者无法企及的速度,将物件历史与被掠夺艺术品数据库、纳粹时期记录以及殖民时代的征集模式进行交叉比对。这在商业与伦理层面都具有深远意义:博物馆正面临日益严峻的、围绕藏品来源的法律与声誉压力,而AI正成为专家审查之前的第一道筛查关口。
AI能自动化的任务
- 手写文件批量转录:使用HTR(手写文本识别)模型对账本、登记册和表格类记录等标准化格式的手写文件进行批量转录。
- 检索工具草稿生成:根据扫描文件夹内容生成符合DACS标准的描述草稿,供档案管理员审阅与完善。
- 重复检测:在大型数字化馆藏中识别几乎相同的图像或文档,它们会造成馆藏数量虚增。
- 元数据提取:在收录原生数字文件时自动抓取创建日期、作者信息、地理位置数据和格式信息。
- 主题标记与关键词索引:利用基于档案主题词表(如国会图书馆主题词表、盖蒂艺术与建筑词库)训练的NLP模型进行主题标记和关键词索引。
- 格式识别与技术鉴定:在数字入藏阶段对数字文件进行格式识别和技术鉴定,标记过时格式、损坏文件及保存风险。
- 常规参考回复:通过AI辅助知识库,自动回答研究者关于馆藏范围、查阅政策和复制权限等常见咨询。
- 来源风险标注筛查:依据已发布的被盗、被掠夺或要求归还材料的数据库,进行来源风险筛查并标记。
日益增值的技能
档案鉴定判断力 — 决定保留什么、销毁什么、移交什么 — 始终是人类不可替代的核心能力。人工智能可以在大规模档案群组中揭示模式,但保管决策背后的机构、法律和历史推理需要情境化的知识,目前任何模型都无法可靠提供。
来源研究与返还专业能力的战略重要性日益凸显。随着人工智能承担首轮筛查工作,能够对殖民时期的藏品获取、大屠杀期间的掠夺以及原住民文化财产主张进行深入历史调查的档案管理员,其价值正不断攀升。这要求具备多语种研究技能、国际法知识以及外交判断力。
数字保存策略 — 特别是围绕模拟环境、格式迁移规划和原生数字鉴定 — 是全行业的技能短板,而人工智能无法填补这一空白。仍需要有人就博物馆2003年的电子邮件档案是否值得保存以及如何保存做出决策。
社区与利益相关方参与,尤其是与后裔社群、原住民民族和捐赠者家庭的互动,需要建立关系和文化敏感性,这是人工智能无法复制的。口述历史项目和社区档案计划依赖于人与人之间的信任。
档案工作流程中的人工智能输出质量控制和提示工程正逐渐成为一项实用技能。了解如何配置、评估和纠正人工智能生成的描述的档案管理员,比那些将人工智能工具视为黑匣子的人效率更高。
撰写资助申请与倡导工作,为数字化和保存争取资金仍然是人类的工作,而且能否为档案投资提出有说服力的理由,越来越与展示人工智能增强的生产力挂钩。
重要性逐渐减弱的技能
- 清晰打字稿或印刷文件的纯手工誊录工作 — 目前这一流程已基本实现自动化,投入大量时间于此是对专业能力的低效利用
- 对来源清晰、格式标准的常规档案材料进行机械式的MARC编目
- 物理卡片目录维护及传统检索工具的格式转换 — 仍在手动进行此项工作的机构已处于落后状态
- 记忆受控词表术语 — 当AI辅助描述工具能自动推荐标目时,所需技能便从记忆转向了评估
- 对可通过结构良好的在线检索工具和目录界面解答的问题,进行基础的参考咨询初步筛选
本行业 AI 采用现状
采用情况不均衡,且高度依赖机构规模。大型研究性博物馆——如史密森尼学会、大都会艺术博物馆、大英博物馆——设有专门的数字基础设施团队,并正在开展试点项目,使用 Transkribus、与 ArchivesSpace 的集成以及自定义自然语言处理(NLP)管线等工具。中型区域博物馆开始采用捆绑了 AI 描述辅助功能的云端数字化平台,但实施往往受限于工作人员配置和维护这些系统的能力。
数量占大多数的小型专业博物馆则基本处于采用前阶段,受到预算、人员规模和缺乏 IT 支持的制约。许多博物馆仍用电子表格或老旧数据库管理藏品,根本未开展任何数字化项目。
专业界通过美国档案工作者协会(SAA)等组织,正积极就档案描述中的 AI 伦理展开讨论——尤其是自动主题标注中的偏见、AI 可能延续藏品记录中历史性沉默的风险,以及从档案材料中提取训练数据所涉及的知识产权问题。
供应商方面,Preservica、CONTENTdm 和 ArchivesSpace 等平台正在逐步整合 AI 功能。市场尚未围绕一个占主导地位的 AI 原生档案平台实现整合,这意味着机构正在拼凑单点解决方案,而非端到端的工作流。
未来工作流程演变
未来五年,档案管理员的日常工作很可能会围绕三种工作模式重新组织。这三种模式目前已经存在,但尚未被清晰地区分开来:
配置与监督类工作 —— 搭建人工智能处理流水线,为自动化描述设定质量阈值,复核系统标记的异常情况,审计输出是否存在偏差或错误。这是一类前所未有的新工作,未来将占用越来越多的时间份额。
高判断力的智识型工作 —— 鉴定决策、复杂的来源研究、归还谈判、社群参与,以及对模糊或敏感材料的阐释。人工智能无法完成这类工作,而机构对此的需求正在增长。
战略性与倡导性工作 —— 为保存投入争取支持、制定数字化优先事项、撰写资助申请,并将档案置于博物馆更广泛的使命与公共项目之中进行定位。这类工作一直存在,但随着外界期望档案展现影响力,正变得愈发核心。
日常事务性的处理工作 —— 当前许多档案管理员的大部分时间都投入于此 —— 将大幅压缩。这并不意味着短期内必然带来人员精简,更可能的结果是积压问题的消解。大多数博物馆档案的处理积压以数十年计。人工智能辅助的处理工作将使机构最终得以着手整理那些已与研究者无缘数代人的藏品。
常见的人工智能应用场景
- Transkribus 用于手写机构记录、捐赠者通信和历史账目的手写文本识别(HTR)转录
- ArchivesSpace 与 NLP 集成,支持半自动化的档案检索工具起草和主题词建议
- Archivist's Toolkit / Preservica 的 AI 功能,用于大规模的长期保存风险评估和格式识别
- JSTOR Global Plants / Getty Provenance Index 交叉比对,对照已发布的研究数据库进行来源审查
- 基于自定义 GPT 或 Claude 的工具,可根据已处理的文件夹清单起草馆藏级范围和内容说明
- Google Vision API 或 AWS Rekognition,用于照片藏品的自动化图像描述和人脸识别标记(须注意重大伦理问题)
- 命名实体识别(NER)流程,从大型文档集中提取人名、地名和日期,以充实规范文档
推荐AI技术栈
| 功能 | 工具/方法 |
|---|---|
| 手写文本识别 | Transkribus(基于机构训练的模型) |
| 原生数字档案接收与格式识别 | Siegfried + DROID 用于格式识别;Preservica 用于托管式数字保存 |
| 检索工具起草辅助 | 集成 NLP 插件的 ArchivesSpace;为范围/内容说明定制的 LLM 提示词 |
| 图像描述与标签 | AWS Rekognition 或 Google Vision(对敏感内容需人工复核) |
| 面向研究者的语义搜索 | 集成向量检索的 Elasticsearch;加载 AI 增强发现层的 Omeka S |
| 来源筛查 | Art Loss Register API;盖蒂出处索引;自定义交叉引用脚本 |
| 重复检测 | SSDEEP 或面向图像馆藏的感知哈希工具 |
| 参考咨询服务 | 面向内部的知识库工具(Notion AI、Guru);公共 FAQ 的聊天机器人界面 |
该技术栈并非即插即用。大多数机构需要一位具备脚本编写能力(Python、XSLT)的数字档案管理员或系统图书馆员,才能将这些工具有机整合为顺畅的工作流程。
风险与挑战
**自动描述中的偏见放大。**基于现有档案检索工具训练的 AI 模型,会复现许多历史档案描述中常见的沉默、欧洲中心主义框架以及非人化语言。自动主题标签可能会系统性地误描述或抹除边缘化社群。这并非理论上的风险——图书馆与档案学文献中已有确凿记录。
**来源审查的虚假信心。**AI 能够对照已知数据库进行筛查,但没有警示标记不代表来源已获核准。若机构将 AI 筛查视为无需专家人工复核的充分尽职调查,就是在制造法律风险与声誉损失。
**数字保存债务。**AI 工具解决了发现与描述问题,却并未触及长期数字保存的根本性基础设施难题。若机构在投资 AI 辅助描述的同时,却不解决存储、格式迁移与继承规划问题,便是将档案工作建立在脆弱的根基之上。
**劳动技能退化。**如果初级档案员在成长阶段主要审核 AI 输出,而非从零开始撰写描述,整个行业就可能丧失使专家审核具有意义的深层智识训练。这是一种缓慢显现却真实存在的风险。
**供应商锁定与数据主权。**处理档案内容的云端 AI 平台,引发了这样的疑问:源于机构藏品的训练数据归谁所有?一旦合约终止或供应商被收购,访问权限又将如何?
**口述历史与社群藏品中的同意与隐私。**对口述历史录音及社群贡献材料进行 AI 处理,会引发现有档案框架本未涉及的同意问题。
未来展望(3–5 年)
博物馆档案管理员这个角色不会被自动化完全取代,但其工作方式将发生根本性重组。几十年来,这一职业的核心痛点——机构馆藏规模与可编目、可开放获取内容之间的巨大缺口——将随着 AI 辅助工作流成为标配而大幅收窄。这对研究访问而言,具有真正的变革意义。
该职业将在一定程度上分化为两类:一类是技术档案管理员,负责配置和维护 AI 处理系统;另一类是学科专家型档案管理员,专注于来源研究、归还、社群参与和阐释性工作。小型机构若不借助共享服务或联盟内基础设施,将很难在这两个方面都能建立起足够的能力。
归还与来源研究工作将在这一角色的职业身份中占据更大比重。围绕殖民时代藏品、原住民文化财产以及犹太人大屠杀时期资产的法律与道德压力在全球范围内日益增大,而档案管理员正是支撑或质疑这些所有权主张的研究基础设施的核心。
研究者的使用体验将大幅改善。由 AI 驱动的发现界面让非专业研究者也能顺利访问档案藏品——而目前,他们往往无法独立使用查找辅助工具。即便常规参考咨询可由系统自动处理,这种便捷反而会推高对档案参考服务的整体需求,从而实现更有意义的研究者参与度的净增长。
那些在引入 AI 描述工具的同时也投资数字保存基础设施的机构,将有能力真正开放馆藏的获取。而那些只投资 AI、却忽略底层保存基础设施建设的机构,最终只会拥有描述详尽但随时可能丢失的藏品。
最终洞察
博物馆档案管理员的核心专业价值从来不是快速录入描述或准确誊抄手稿的能力,而始终是判断何为重要之物的决断力,为存世之物赋予背景的深厚学识,以及代表那些历史被托付保管的社区的道义责任。AI 正接手那些长期以来过度消耗专业人员精力的机械性劳动。
真正的风险并非职业被取代,而是资源的错配。那些利用 AI 带来的效率提升来裁剪档案岗位,而非着手处理积压、改善查阅途径、投入来源考证与文物归还工作的机构,完全偏离了要旨。这个行业面临的机遇,是把释放出的能力重新导向唯有受过训练的人类才能承担的智识与伦理工作,并且大声阐明这一点,让机构领导层明白他们真正投资的究竟是什么。