Archive-It:互联网存档服务 - 美国数字保存网站
互联网档案馆推出的付费网页存档订阅服务,帮助图书馆、博物馆和政府机构捕获和保存数字文化遗产。
行业分类: 美国数字保存、网页存档、文[文]化遗产、订阅服务
成立时间: 2006年(由Intern[章]et Archive推出)
所属国家: 美国网站(由Interne[来]t Archive运营)
网站语言: 支持英语(为主)
服务区域: 全球
官方网站: www.archive-it.org
网站介绍: www.archive-it.org 是互联网档案馆(Internet Archive)推出的付费网页存档订阅服务。Archive-It由Internet Archive于2006年推出。Archive-It以“帮助组织捕获和保存数字文化遗产”为使命——为图书馆、大学、博物馆、政府机构和非营利组织提供定制化的网页爬取、存档和访问服务。客户可设定爬取频率(每日、每周或每月),Archive-It自动抓取指定网站的快照并永久保存。截至2024年,Archive-It已为全球超过800个机构保存了数千亿个网页。所有Archive-It保存的网页同时被纳入Wayback Machine的全文检索范围。
Archive-It的核心[自]功能包括:Customiz[C]ed Crawling(定制爬取[c]——设定目标URL、爬取频[c]率、爬取深度和数据类型)、[c]Quality Assurance(质量保[n]证——在线查看爬取结果,标[.]记缺失页面和抓取错误)、A[c]ccess & Discovery(访问与[o]发现——机构自有存档页面的[m]全文搜索和浏览,可设置为公[文]开或内部访问)、Metad[章]ata Management(元数[来]据管理——为每个存档集合添[自]加描述、主题标签和管理元数[C]据)和API Access(API访问—[c]—通过RESTful API编程化管理和检索存档[c]数据)。Archive-I[c]t按存档数据量和爬取频率收[n]取年费。Archive-I[.]t的客户包括美国国会图书馆[c]、哈佛大学、斯坦福大学、史[o]密森尼学会和欧洲多国国家图[m]书馆。
Archive-It是全球[文]数字保存领域最重要的工具之[章]一。美国政府网站、联合国文[来]件和全球新闻媒体是Arch[自]ive-It最常保存的内容[C]类型。与Wayback Machine的被动爬取不[c]同,Archive-It允[c]许机构主动定义保存策略。在[c]COVID-19疫情期间,[n]Archive-It帮助数[.]百家机构保存了大量疫情相关[c]的公共健康公告和社区响应记[o]录。
使用说明: 访问www.archive-it.org ,在“Explore”页面浏览现有机构存档集合。机构在“Request a Quote”页面联系Archive-It团队获取定制方案和报价。登录管理面板创建新爬取任务,设定目标URL和频率。定期检查爬取质量并修正错误。在“Public Collections”页面搜索特定主题的历史网页存档。