AI将揭开梵蒂冈机密档案馆之谜
科技行者 3月20日 北京消息 梵蒂冈机密档案馆(Vatican Secret Archives)被列为世界十大禁地之一,它是罗马教皇的档案保管机构,也是欧洲教会中收藏档案最丰富,最古老的档案馆。
其珍藏的许多文件从未转录,即便教堂档案员也对其中隐藏的秘密一无所知。然而,机器视觉系统将会揭开中世纪文本的神秘面纱。

梵蒂冈机密档案馆颇为传奇。据称,该馆保存的往届教皇的私人信件和其他文件,不少内容可追溯至公元8世纪, 排起来可延绵85公里长。
馆内警戒森严,自1881年起,学者们接触到的文件极为有限,但其中的信息量却蔚为可观。
举个例子,一张长达60米的羊皮纸上记满了对法国圣殿骑士的审判供词,这场审判自1307年伊始,持续数年。这些信件中,有米开朗基罗的手稿,有国王亨利八世请求废除婚姻的申请书,还有苏格兰女王玛丽被斩首前的说情信。
此外,档案中还包含距今较短的通信文件,比如美国南北战争时期,亚伯拉罕·林肯和杰斐逊·戴维斯分别来信,试图说服教皇庇护九世支持各自阵营——北方联邦和南部邦联。还有二战期间,教皇与纳粹政权的往来信件都从未出版。事实上,1939年后的所有档案完全对外保密。
虽然这些文件禁止出版,但档案馆设有影像备份及档案保护工作室。与其他许多历史档案馆一样,他们已开始影像备份文件,供学者深入研究。
但档案存量过于庞大,光靠人工抄录备份,根本无法完成。那么,机器视觉技术是否能够起作用?
幸运的是意大利罗马第三大学的Donatella Firmani及其同事启动了“In Codice Ratio(‘编码系统’的拉丁文)”项目,旨在开发能够自动转录梵蒂冈机密文件(名为Vatican Registers)的系统。
该语料库收录了13世纪的18,000页官方信件,覆盖内容极广,从天主教到国王、王后,从政治到宗教,横贯欧洲各领域。Firmani及其团队表示:“这些文件此前从未转录,因此,历史意义可谓空前巨大。”
中世纪文本的特殊性给机器视觉技术带来了诸多挑战。由于手稿字迹风格各异,存在连笔(将相邻字母连成一笔书写)和特殊缩略语,因此传统的视觉识别算法无法胜任转录工作。
为解决这一难题,学者们研发了识别整个单词(不仅仅是字母)的计算机视觉系统。然而效果仍不理想。大多数单词在长篇文件中只出现过几次,所以很难创建满足机器学习需求的数据集。
如今,Firmani及其团队发明了训练文字视觉识别系统的新方法:将单词拆分为笔划,再像拼图一样将笔划组合起来。他们表示:“我们想开发一个能够转录尽可能多手稿的成熟系统。”
系统将单词拆分为笔划后,再试图将笔划组合成字母,分析所有可能的排列组合方式,最终排除所有不符合语法的组合。
例如,通常可将笔划组合为“iii”和“m”,因语法错误排除前者。同样的笔划组合还有“in”或“ni”,系统需进一步研究整个单词及其所处语境,再作出选择。[page]分页标题[/page]
Firmani团队首先创建了一个数据集,训练基于神经网络的计算机视觉系统。
该数据集需要进行标记处理。因此,视觉系统可学习笔划的排列方式与可能字母的映射。
他们将数据标记外包出去,将拼图似的单词拆分为模式识别问题(如拼图式验证码)呈现给120所高校学生,让他们数小时内共同人工标注包含15,000个单词的数据集。
标注结果十分理想。Firmani团队称:“我们能够准确转录数据集中65%的字母图像。”
显然,这一成果对转录中世纪文章和历史学家的研究而言意义非凡。但还有更多难题需要攻克。例如,小写字母的转录问题仍然存在,因此下一步的关键是扩大词汇量,将大写字母及中世纪文本中的缩略语纳入数据集。
梵蒂冈机密档案馆将如何利用这一科技尚不得而知,梵蒂冈文件(Vatican Registers)被转录后是否会公之于众也无人知晓。
但即使文件未能出版,Firmani团队开发的前沿技术也能帮助学者们进行相关领域的深入研究。例如,可利用单词、词组频率及其随时间的变化等数据展开历史文件研究。可作为分析历史文化的重要切入点。

- AMD助力微软Windows 11 为用户带来强大、可靠的计算能力2021-10-09 16:20
- 游戏玩家为之疯狂!Chinajoy2021 AMD展台那些火爆的瞬间2021-08-02 15:39
- 全场最佳 AMD Chinajoy2021展台圆满收官2021-08-02 15:38
- AMD 锐龙5000G系列处理器正式亮相Chinajoy20212021-08-02 11:50
- 极速制胜 制霸游戏 AMD携多款游戏神器扬威Chinajoy2021-08-02 11:44
- 央视《新闻联播》头条聚焦铁建重工,聚力攻克“卡脖子”技术难题2021-03-22 11:08
- 刚刚!我又上央视新闻联播头条了!2021-03-22 11:04
- 中国电科(3月1日-3月7日)要闻回顾 | 资讯轻阅读2021-03-22 10:47
- 我国将建第一个国家公园:为何是三江源2021-03-22 10:43
- 美国硅谷上演“大逃亡”:郊区成科技精英避难所2021-03-22 10:41

- 12:21南京市人才一期发展基金合伙企业子基金遴选结果公布
- 18:43水井坊发布2025年前三季度业绩报告
- 17:58去信任的商业文明:当算法取代权威,当信任回归众人
- 20:29助推高质量产业发展·创投实录|华青领创:敢于“掀桌”,方见新“视界”
- 12:32“第一届传媒可持续发展·ESG作品榜”正式发布 2025企业可持续发展大
- 18:28【一个世界 无限场景】泽瑞萬象元宇宙计划正式启动 & 全球首秀
- 07:45纳米晶体甲地孕酮,让肿瘤患者体重“向上”,生存“向上”
- 21:40创投集团直投企业瑞为新材获得第七批专精特新“小巨人”企业认定
- 12:19九牧智能卫浴助建中国“好房子”,杭州好房子私享会今日召开!
- 14:04金海汇成投资有限公司如何打造高效资产证券化产品
- 17:01ChainVault亮相伦敦区块链大会:引爆欧洲RWA新风口
- 17:00Auricore亮相伦敦区块链大会,定义黄金RWA全球新标准
- 17:00STC亮相伦敦区块链大会,开启绿色RWA的新篇章
- 16:59POLEX亮相伦敦区块链大会:AI驱动欧洲RWA金融新纪元
- 15:15专业筑基,体系赋能:YS(应氏)家族资产管理体系获著作权保护
- 11:34第一财经《秒懂金融》AI数智人应用案例再获奖项
- 20:38从专场招聘到长效生态,京东与黄河交通学院共筑产教融合新高地
- 14:09四川:投资消费双轮驱动,“十四五”扩大内需成果丰硕
- 10:262025第十八届金投赏商业创意奖获奖全榜单官宣
- 13:39百利好:白银风口下,投资的机会与风险在哪?
- 16:01全球变局下的中国青年科技创新 | 两说
- 10:52创投集团直投企业天晴空天完成超亿元A轮融资
- 09:38金海汇成投资有限公司财富增长密钥
- 10:54SYN VISION韩国发布会成功举办:开启短剧RWA财富新篇
- 13:03运鸿集团旗下【世界金融资产交易中心】获两项高含金量许可证
- 15:18创投集团直投企业典格通信完成超亿元融资
- 14:34CSCO肿瘤营养治疗专场圆满召开,纳米甲地孕酮为肿瘤患者治疗提供有力支持
- 10:17创投集团合作子基金投资企业摩漾生物完成新一轮融资
- 16:13Shokz韶音携手UTMB:以开放之声,守护山野间的奔跑
- 13:17聚力数据与低空新赛道,京东赋能千行百业新未来



