El Web Archiving I L'arxivística

Total Page:16

File Type:pdf, Size:1020Kb

El Web Archiving I L'arxivística El Web Archiving i l’Arxivística Treballs de recerca del Màster d’Arxivística i Gestió de Documents Curs 2012-2013 Autor: Santiago Lopera Tutor: Joan Soler Títol: El web archiving i l’arxivística Autor: Santiago Lopera Resum: El present treball vol destacar el paper fonamental que la preservació digital ha de jugar per mantenir accessibles en el futur els documents del present, mitjançant l’estudi i anàlisi d’una de les seves branques més rellevants: l’arxivament de les pàgines web. Aquesta és una disciplina que te el seu origen en el camp de la biblioteconomia i les ciències de la informació i és aliena al món arxivístic del nostre país. La primera part del present treball ofereix un breu estat de la qüestió sobre l’arxivament de les pàgines web i, des d’una perspectiva arxivística, intentarà donar resposta a qüestions com en què consisteix l’arxivament de les pàgines web? Per a què serveix? Des de quan es practica? Quines organitzacions el practiquen? Com es captura i emmagatzema el web? En la segona part es proposa una reflexió sobre l’aplicació de l’arxivament web des de la disciplina arxivística, que pot donar un pas endavant en la seva evolució mitjançant l’assoliment d’aquest tipus de reptes. Paraules clau: Preservació digital, arxivament web, arxivística, Internet, Biblioteques Nacionals, documents electrònics, tecnologies de la informació i la comunicació. Title: Web archiving and records management science Author: Santiago Lopera Abstract: The following essay aims to highlight the essential role of digital preservation to keep the documents of today available for tomorrow by studying and analizing one of its most important branches: web archiving. This one is a discipline that has its roots in Library Science and Information Science, and it is completely alien to the world of the archives in our country. The first part of this essay offers a brief overview on web archiving and, from an archival science point of view, will try to answer questions like: What is web archiving? What is it used for? When did it begin? Which organizations are putting it into practice? How can we capture and store a website? In the second part, we will try to think about the implementation of web archiving from the perspective of the archival science, who can take a step forward in its evolution by the accomplishment of this sort of challenges. Keywords: Digital preservation, web archiving, records management, Internet, National Libraries, electronics records, information and communication technologies. 2 Sumari Sumari .......................................................................................................................... 3 Introducció .................................................................................................................... 4 Part I Web archiving...................................................................................................... 6 1. Què és el web archiving? .......................................................................................... 7 2. Quan es comença a arxivar el web? ......................................................................... 9 3. Per què arxivar el web? .......................................................................................... 10 4. Com s’arxiva el web? .............................................................................................. 11 4.1. Crawlers ........................................................................................................... 12 4.2. Models de captura............................................................................................ 12 4.3. Polítiques ......................................................................................................... 13 5. Entrebancs del Web Archiving ................................................................................ 14 5.1. Dificultats tècniques ......................................................................................... 14 5.2. Dificultats legals ............................................................................................... 18 5.3. Dificultats d’organització................................................................................... 18 5.4. Dificultats econòmiques ................................................................................... 19 6. Qui arxiva el web? .................................................................................................. 20 6.1. Biblioteques nacionals ..................................................................................... 20 6.2. Projectes supranacionals ................................................................................. 22 6.3. Universitats i organismes d’investigació ........................................................... 24 6.4. Empreses ......................................................................................................... 25 7. L’arxivament del web a Catalunya: el PADICAT ..................................................... 26 Part II El web archiving i l’Arxivística ........................................................................... 34 1. És el web un document d’arxiu? ............................................................................. 35 2. Per què els arxius de Catalunya no arxiven les webs? ........................................... 36 3. Incorporació de l’arxivament web a les tasques d’arxiu ........................................... 39 4. Escenaris possibles ................................................................................................ 41 Conclusions ................................................................................................................ 43 Glossari ...................................................................................................................... 46 Bibliografia i fonts ....................................................................................................... 47 Annexos...................................................................................................................... 51 3 Introducció La voluntat d’aquest treball és la de cridar l’atenció de la comunitat arxivística del país al voltant d’una de les branques de la preservació digital que més expansió es preveu que ha de tenir durant els pròxims anys, l’arxivament del web, i que fins ara és una pràctica inèdita als nostres arxius. Internet és un instrument que des de fa anys està experimentant una expansió que no té frenada, i no només és el mitjà per excel·lència a través del qual les persones intercanvien tot tipus de béns, d’informació, de dades, sinó que també és un sistema de producció de documents de primera magnitud. Aquests documents que viatgen pel ciberespai, de màquina a màquina, de servidor a servidor, de pàgina web a pàgina web, no acostumen a ser tractats arxivísticament, amb la consegüent pèrdua de contextualització que això comporta, i de garanties de fiabilitat, integritat, i autenticitat que la disciplina arxivística és capaç de garantir. No es pot dir, a juny de 2013, que la gestió dels documents electrònics sigui quelcom nou que s’acaba d’inventar, i malgrat això és una pràctica que no està plenament implantada als arxius de Catalunya. El tractament de les pàgines web, la seva captura, gestió i preservació és una faceta més de la gestió de documents electrònics que ha estat oblidada durant massa temps i potser ha arribat el moment de començar a pensar la manera com els arxivers i gestors documentals podem afrontar-la. Pensem, per exemple, en les seus electròniques que l’Administració desenvolupa per relacionar-se amb els ciutadans. Aquestes pàgines web contenen documents amb valor jurídic, generadors de drets i obligacions, i potser fóra bo aplicar l’arxivament del web a les seus electròniques per garantir una millor gestió de la seva informació. El treball es divideix en dues parts, en la primera s’intenta donar resposta de forma breu i fugint de tecnicismes, a qüestions com ara en què consisteix l’arxivament del web, quan es va començar a aplicar, de quina manera es duu a terme, o quines són les principals institucions que el practiquen avui dia. Intentem entendre també la peculiaritat de les pàgines web, i com la seva natura dinàmica i efímera dificulta el seu tractament des d’un punt de vista arxivístic. Aquests reptes requereixen noves respostes tecnològiques que han de ser desenvolupades sota els criteris de la gestió documental per poder garantir un tractament correcte de les unitats documentals que es creen, s’intercanvien o s’emmagatzemen a les pàgines web. 4 La primera part del treball es tanca amb un breu repàs als principals projectes d’arxivament web del món, realitzats per institucions líders que marquen la pauta del desenvolupament tecnològic i teòric, però que no ho fan sota criteris arxivístics ja que en la seva major part són biblioteques nacionals. Comentem també, i de forma destacada, el cas del PADICAT (Patrimoni Digital de Catalunya), de la Biblioteca Nacional de Catalunya, un projecte de referència internacional desenvolupat al país. La segona part del treball abandona el caràcter expositiu i intenta relacionar la pràctica de l’arxivament del web, creada i desenvolupada des de la biblioteconomia i les ciències de la informació, amb la disciplina arxivística. És, per tant, un apartat més arriscat en el qual l’autor intenta apropar-se al web archiving des d’una perspectiva arxivística, destacant la importància que la gestió documental comenci a veure les pàgines web com
Recommended publications
  • Cat (Curator Archiving Tool): Mejorando El
    “CAT (Curator Archiving Tool): mejorando el acceso a los archivos web”, presentado en International Internet Preservation Consortium meeting (Viena 2010) © Llueca, Cócera, Torres, Suades, De la Vega. Biblioteca de Catalunya & Centre de Supercomputació de Catalunya, 2010 CAT (CURATOR ARCHIVING TOOL): MEJORANDO EL ACCESO A LOS ARCHIVOS WEB Ciro Llueca, Daniel Cócera Biblioteca de Catalunya (BC) Barcelona, España [email protected] Natalia Torres, Gerard Suades, Ricard de la Vega Centre de Supercomputació de Catalunya (CESCA) Barcelona, España [email protected] Internet. La misión de PADICAT 2 es archivar la Internet ABSTRACT catalana. PADICAT es el archivo web creado en 2005 en Cataluña La BC forma parte del IIPC (International Internet Preservation (España) con el objetivo de capturar, procesar y dar acceso Consortium), y como en el resto de proyectos en permanente al patrimonio digital de Cataluña. Basa su funcionamiento, el archivo web con sede en Barcelona se estrategia de captura en el modelo híbrido (captura masiva del basa en la aplicación de una serie de programas informáticos dominio .cat; captura selectiva de los agentes productores de que permiten la captura, el almacenaje, la organización, la las páginas web catalanas; captura focalizada de preservación y el acceso permanente a una serie de versiones acontecimientos públicos). El sistema ofrece su colección en de las páginas web publicadas en Internet por una comunidad abierto, en Internet. Para hacerlo de manera óptima se ha determinada 3, en este caso la catalana, en España.
    [Show full text]
  • Catalan Policy and Experiences on Cooperative Repositories
    Catalan Policies and Experiences on Cooperative Repositories Miquel Huguet, Lluís Anglada and Ricard de la Vega • 12-03-07 Summary The Centre de Supercomputació de Catalunya (CESCA) together with the Consorci de Biblioteques Universitàries de Catalunya (CBUC) started in 1999 a cooperative repository, named TDR, to file in digital format the full-text of the read thesis at the universities of our country to spread them worldwide in open access preserving the intellectual copyright of the authors. This became operational in 2001 and today it is a service fully consolidated not only among the Catalan universities, but also used by other Spanish universities. Since then, there are four additional cooperative repositories which have been created: RECERCAT, for research papers; RACO, for scientific, cultural and erudite Catalan magazines; PADICAT, for archiving Catalan web sites; and MDC, for Catalan digital collections of pictures, maps, posters, old magazines... These five repositories have some common characteristics: they are open access, that is, they are accessible on the internet for free; they mostly comply with the Open Archive Initiative interoperability protocol for facilitating the efficient dissemination of content; and they have been built in a cooperative manner so that it is easy to adopt common procedures and to share the repository developing and managing costs, it permits more visibility of the indexed documents throughout the search engines, and a better provision for long-term preservation can be made. In this paper we present the common policy established for the Catalan cooperative repositories, we describe the five of them briefly, and we comment on the results obtained of our 6-year experience since the first one became operational.
    [Show full text]
  • Patrimoni Digital De Catalunya, a Year and a Half Experience
    Patrimoni Digital de Catalunya, a year and a half experience Ricard de la Vega Sivera, Natalia Torres, Joan Cambras Centre de Supercomputaci´ode Catalunya Abstract. E-repositories are part of the e-science, and they are based on the e-infrastructure. The Centre de Supercomputaci´ode Catalunya (CESCA) together with the Consorci de Biblioteques Universit`ariesde Catalunya started in 1999 a cooperative repository, named TDR, to file, in digital format, the full-text of the read thesis at the universities of our country in order to spread them worldwide in open access, while at the same time, preserving the intellectual copyright of the authors. Since then, four additional cooperative repositories have been created: RECERCAT for research papers; RACO for scientific, cultural and erudite Catalan maga- zines; MDC for Catalan digital collections of pictures, maps, posters and old magazines; and PADICAT for archiving Catalan digital web content; The main objective of the latter is to archive Catalan web sites. That is, PADICAT collects, processes and provides permanent access to the entire cultural, scientific and general output of Catalonia in digital format. The repository manager is the Biblioteca de Catalunya, as the institution re- sponsible for compiling, processing and distributing the bibliographic her- itage of Catalonia, while CESCA is the technology partner. On September 11th, 2006 the repository went into operation for the general public, with some thirty websites archived. After one year and a half, it has 2.720 captures of more than 1.000 websites. This includes 34 million files (HTML, images...) and two terabytes of data. The objective of this paper is to present PADICAT and our experience de- veloping and managing it.
    [Show full text]
  • Diapositiva 1
    ornadas sobre La preservación del patrimonio digital: conceptos básicos y principales iniciativas (Madrid, 14 a 16 de marzo de 2006) Presentación La importancia de los documentos digitales como medio de transmitir la información y el conocimiento es cada día mayor tanto cuantitativa como cualitativamente. La consulta de los objetos digitales, que pueden ser textos, datos, gráficos, imágenes fijas o en movimiento, grabaciones sonoras, programas informáticos, etc., está al alcance de amplios sectores de la población y les permite acceder a todo tipo de información. Los documentos de esta clase se generan directamente en formato digital o se convierten a éste a partir de material analógico ya existente. Sin embargo, pese a su difusión universal y a que constituyen un medio de expresión insustituible del conocimiento y la creatividad humanos, los documentos digitales tienen unas características físicas que los hacen mucho más efímeros, volátiles y vulnerables que los documentos tradicionales en papel. De hecho muchos documentos de origen digital, que sólo existían en formato electrónico, han desaparecido ya y son irrecuperables. La preservación del Patrimonio Digital o Preservación Digital es una preocupación presente en los actuales planes de actuación de los principales organismos internacionales relacionados con el mundo de las bibliotecas y del Patrimonio Cultural. Prueba de este interés internacional por la conservación de los recursos electrónicos son los documentos básicos sobre el particular aparecidos en los últimos años: Carta para la preservación del Patrimonio Digital. UNESCO, 2003 Resolución del Consejo de 25 de junio de 2002 sobre «Conservar la memoria del mañana: Conservar los contenidos digitales para las generaciones futuras» (2002/C 162/02).
    [Show full text]
  • El Projecte PADICAT (Patrimoni Digital De Catalunya) De La Biblioteca De Catalunya
    El projecte PADICAT (Patrimoni Digital de Catalunya) de la Biblioteca de Catalunya CIRO LLUECA Coordinador del projecte PADICAT (Patrimoni Digital de Catalunya) Biblioteca de Catalunya [email protected] RESUM Les tecnologies de la informació i la comuni- la compilació, el tractament, la preservació i la cació (TIC) han facilitat que el patrimoni cultu- difusió de la producció bibliogràfica publicada ral i científic, i la resta d’informació, es presen- a Internet: són els dipòsits digitals nacionals, tin en format digital. En resposta a aquest nom que reben aquests projectes impulsats repte les administracions de diversos països, habitualment per les biblioteques nacionals. des de la dècada dels noranta, han promogut La comunicació descriu el projecte PADICAT estratègies per garantir l’accés permanent a la (Patrimoni Digital de Catalunya), que la Biblio- producció digital. Aquesta garantia d’accés teca de Catalunya ha posat en marxa per asse- passa per assegurar en la mesura de les possi- gurar l’accés permanent a la producció digital bilitats actuals i futures el compliment del rep- catalana. te que suposa el cicle documental clàssic: PARAULES CLAU: Dipòsits digitals, Biblioteques nacionals, Preservació digital, Arxius web RESUMEN Las tecnologías de la información y la comuni- documental clásico: la compilación, el trata- cación (TIC) han facilitado que el patrimonio miento, la preservación y la difusión de la pro- cultural y científico, y el resto de información, ducción bibliográfica publicada en Internet: se presenten en formato digital. En respuesta son los depósitos digitales nacionales, nom- a este reto las administraciones de diversos bre que reciben estos proyectos impulsados países, desde la década de los noventa, han habitualmente por las bibliotecas nacionales.
    [Show full text]
  • Patrimonio Digital De Cataluña)
    Archivando la Web, el proyecto Padicat (Patrimonio Digital de Cataluña) Por Ciro Llueca Resumen: Desde 1996 varios países han llevado a cabo estrategias para garantizar el Ciro Llueca es diplomado en biblioteconomía y documentación por la Universitat de Barcelona, li- acceso permanente a la producción digital cenciado en documentación por la Universitat Ober- propia: las páginas web y el resto de recursos ta de Catalunya, y máster en documentación digital digitales publicados en internet. Estas estrate- por la Universitat Pompeu Fabra. Es coordinador del gias están orientadas a asegurar en la medida proyecto Padicat (Patrimonio Digital de Cataluña) en de las posibilidades tecnológicas actuales a la la Biblioteca de Catalunya. Profesor asociado del adecuación del ciclo documental clásico a las Departament de Biblioteconomia y Documentació de páginas web: la compilación, el procesamien- la UB, profesor de los estudios de periodismo en la to, la preservación y el acceso permanente a Universitat Abat Oliba CEU y consultor de los estu- la producción digital. Las bibliotecas nacio- dios de documentación de la UOC. Ha sido vicepre- nales han sido a menudo impulsoras de estas sidente (2003–2006) del Col·legi Oficial de Biblio- tecaris–Documentalistes de Catalunya. acciones y en el caso español, la Biblioteca de Catalunya (BC) ha puesto en marcha el proyec- to Padicat (Patrimonio Digital de Cataluña), dedicado al archivo de la web catalana. Este artículo presenta el proyecto Padicat. Palabras clave: Repositorios digitales, Bibliotecas digitales, Archivos web, Bibliotecas nacionales. Title: Archiving the Web, the Padicat Project (Digital Heritage of Catalonia) Abstract: Since 1996 numerous countries have set into motion strategies for guaranteeing permanent access to their dig- ital production: web pages and other digital resources published on the internet.
    [Show full text]
  • INTERNATIONAL CONFERENCE on WEB ARCHIVES and E-LEGAL DEPOSIT Documentary Heritage on the Internet
    INTERNATIONAL CONFERENCE ON WEB ARCHIVES AND e-LEGAL DEPOSIT Documentary heritage on the Internet Tuesday 9 July 2013 Conference Hall AGENDA 9:15-9:30. Registration and handout of documentation. 9:30-9:45. Opening of event and welcome speeches by the Secretary of State for Culture, José María Lassalle, and the Director of the National Library of Spain, Ana Santos Aramburo. 9:45-10:00. Presentation of the agenda and the speakers (Soledad Navarro, Web Service, National Library of Spain). 10:00-10:30. The web is a mess: how I learnt to stop worrying and love web archiving (Kristine Hanna, Director of Archiving Services, Internet Archive). 1 10:30-11:00. An introduction to the International Internet Preservation Consortium (Mary Pitt, IIPC Programme and Communications Officer). 11:00-11:30. Coffee Break. 11:30-12:00. Legal deposit in the digital area: archiving the French Web at the Bibliothèque nationale de France (Clément Oury, Head of the Digital Legal Deposit at the BnF). 12:00-12:30. Archiving the French Web: the BnF web archiving workflow (Sara Aubry, Digital Archivist and responsible for the architecture and tool specifications of the BnF’s web archive). 12:30-13:00. Scaling up to archive the UK Web (Helen Hockx-Yu, Head of Web Archiving, British Library). 13:00-13:30. Panel discussion: Future challenges for web archives, moderated by Icíar Muguerza (Web Service, National Library of Spain). 13:30-15:00. Lunch Break. 15:00-15:20. PADICAT, the web archiving project of the Biblioteca de Catalunya (Eugènia Serra, Director of the BC).
    [Show full text]
  • Web Archiving: International Case Studies and the Brazilian Case
    ARTIGO RDBCI: Revista Digital Biblioteconomia e Ciência da Informação DOI 10.20396/rdbci.v16i1.8648747 RDBCI : Digital Journal of Library and Information Science WEB ARCHIVING: INTERNATIONAL CASE STUDIES AND THE BRAZILIAN CASE ARQUIVAMENTO DA WEB: ESTUDOS DE CASO INTERNACIONAIS E O CASO BRASILEIRO AUTORES ARCHIVO DE LA WEB: ESTUDIOS DE CASO INTERNACIONALES Y EL CASO BRASILEÑO ¹Moisés Rockembach ¹Universidade Federal do Rio Grande do Sul Correspondence to Author ¹Moisés Rockembach Universidade Federal do Rio Grande do Sul Porto Alegre, RS - Brazil. Email: [email protected] ORCID: http://orcid.org/0000-0001-9057-0602 Submitted: 01/06/2017 Accepted: 29/08/2017 Published: 12/09/2017 JITA: HC. Archival materials. © RDBCI: Rev. Digit. Bibliotecon. Cienc. Inf. Campinas, SP v.16 n.1 p. 7-24 Jan./Apr. 2018 [7] RDBCI: Revista Digital Biblioteconomia e Ciência da Informação DOI 10.20396/rdbci.v16i1.8646067 RDBCI : Digital Journal of Library and Information Science RESUMO: O objetivo deste estudo foi delimitar conceitualmente e teoricamente o tema arquivamento da web, além de verificar estudos de caso internacionais e a situação brasileira sobre este tema. Pesquisa de natureza exploratória-descritiva, utiliza abordagem qualitativa, com a aplicação de metodologia de seleção e análise de estudos de caso internacionais para exemplificar o funcionamento do arquivamento da web em vários países, além da análise do contexto brasileiro. São abordados os modelos de processo e ciclo de vida do arquivamento da web, bem como aspectos legais. Dos exemplos encontrados, foram selecionados seis estudos de caso internacionais, contemplando uma variedade de contextos (organizações sem fins lucrativos, arquivos nacionais, bibliotecas regionais, bibliotecas nacionais, universidades, provedores de serviços), não encontrando nenhum sistema específico de arquivamento da web brasileira documentado na literatura, com somente alguns assuntos arquivados de forma esparsa.
    [Show full text]
  • Archiwizacja Webu W Europie – Narodowe Archiwa Sieci
    ARCHEION, T. CXXI WARSZAWA 2020 ISSN 0066-6041 e-ISSN 2658-1264 DOI 10.4467/26581264ARC.20.016.12973 BARTŁOMIEJ KONOPA ORCID 0000-0001-9843-5552 [email protected] (Uniwersytet Mikołaja Kopernika w Toruniu, Archiwum Państwowe w Bydgoszczy) ARCHIWIZACJA WEBU W EUROPIE – NARODOWE ARCHIWA SIECI Słowa kluczowe: archiwizacja Webu, archiwa Webu, archiwa cyfrowe, witryny Internetowe, badania nad Internetem Streszczenie Archiwizacja Webu, czyli działania mające na celu gromadzenie i zachowanie zasobów Sieci, prowadzona jest już od prawie 25 lat. Przez ten czas powstało wiele projektów realizujących to za- danie, a także parę organizacji, takich jak np. International Internet Preservation Consortium, które wspierają jego realizowanie. W artykule zaprezentowano rozwój działań w tym zakresie, a następnie omówiono wnioski z analizy funkcjonowania wybranych europejskich archiwów Sieci o charakterze narodowym, przeprowadzonej w oparciu o publicznie dostępne materiały ich dotyczące. Analiza ta miała na celu zbadanie, w jaki sposób obecnie archiwizowany jest Web w tej części świata. Rozpa- trzone zostały trzy główne zagadnienia: gromadzenie, opisywanie i udostępnianie zasobów dawnego WWW. Pierwsze z nich obejmuje zakres archiwizacji, a więc określenie tego, jakie materiały jej podlegają, a także wykorzystywanych w tym celu strategii, z których wynika ukształtowanie zbiorów. Drugie dotyczy stosowanych metadanych i innych elementów służących przekazaniu informacji na temat tego, co zostało w jej trakcie zgromadzone. Ostatni element analizy obejmuje zakres udostęp- niania zasobów archiwalnego WWW, występujące ograniczenia i ich przyczyny, a także wykorzysty- wane do tego narzędzia. W trakcie badań zainteresowano się również używanym przez poszczególne projekty oprogramowaniem. Uzyskane wyniki pozwalają stwierdzić, że model archiwum Sieci został wypracowany, a działalność analizowanych inicjatyw w Europie jest do siebie bardzo zbliżona.
    [Show full text]
  • III. DIGITAL PRESERVATION the IMPORTANCE of WEB ARCHIVES for HUMANITIES DANIEL GOMES and MIGUEL COSTA I. INTRODUCTION
    III. DIGITAL PRESERVATION THE IMPORTANCE OF WEB ARCHIVES FOR HUMANITIES DANIEL GOMES AND MIGUEL COSTA Abstract The web is the primary means of communication in developed societies. It contains descriptions of recent events generated through distinct perspectives. Thus, the web is a valuable resource for contemporary historical research. However, its information is extremely ephemeral. Several research studies have shown that only a small amount of information remains available on the web for longer than one year. Web archiving aims to acquire, preserve and provide access to historical information published online. In April 2013, there were at least sixty four web archiving initiatives worldwide. Altogether, these archived collections of web documents form a comprehensive picture of our cultural, commercial, scientific and social history. Web archiving has also an important sociological impact because ordinary citizens are publishing personal information online without preservation concerns. In the future, web archives will probably be the only source of personal memories to many people. We provide some examples of tools that facilitate historical research over web archives highlighting their potential for Humanities. Keywords: Web Archiving, Digital Preservation, Digital Humanities 1. introduction For centuries, historians have been analysing printed media published in the past, such as books or letters, to research and write history. So, today’s ordinary information will be tomorrow’s resource for historical research. The web has been replacing printed media and most of the information that characterizes our International Journal of Humanities and Arts Computing 8.1 (2014): 106–123 DOI: 10.3366/ijhac.2014.0122 © Edinburgh University Press 2014 www.euppublishing.com/ijhac 106 The Importance of Web Archives for Humanities current days is being exclusively published online.
    [Show full text]
  • Cat (Curator Archiving Tool): Improving Access To
    “CAT (Curator Archiving Tool): improving access to web archives”, distributed International Internet Preservation Consortium meeting (Wien 2010) © Llueca, Cócera, Torres, Suades, De la Vega. Biblioteca de Catalunya & Centre de Supercomputació de Catalunya, 2010 CAT (CURATOR ARCHIVING TOOL): IMPROVING ACCESS TO WEB ARCHIVES Ciro Llueca, Daniel Cócera Biblioteca de Catalunya (BC) Barcelona, Spain [email protected] Natalia Torres, Gerard Suades, Ricard de la Vega Centre de Supercomputació de Catalunya (CESCA) Barcelona, Spain [email protected] The BC is member of the IIPC (International Internet ABSTRACT Preservation Consortium) and, as in the rest of ongoing projects, the web archive placed in Barcelona is based on the PADICAT is the web archive created in 2005 in Catalonia application of several IT software that allows the crawl, (Spain) by the Biblioteca de Catalunya (BC), the National storage, preservation and the permanent access to a series of Library of Catalonia, with the aim of collecting, processing and versions of web pages published by the Catalan community 3, providing permanent access to the digital heritage of Catalonia. in Spain. Its harvesting strategy is based on the hybrid model (massive harvesting of .CAT top level domain; selective compilation of From the initial analysis of the Internet Archive, Kulturarw3 the web site output of Catalan organizations; focused (National Library of Sweden), Pandora (National Library of harvesting of public events). The system provides open access Australia), and Netarkivet.dk (The Royal
    [Show full text]
  • Archivamiento Web Conceptos Básicos, Estrategias Y Mejores Prácticas Mini/Manual Archivamiento Web Conceptos Básicos, Estrategias Y Mejores Prácticas
    Mini/Manual Archivamiento Web conceptos básicos, estrategias y mejores prácticas Mini/Manual Archivamiento Web conceptos básicos, estrategias y mejores prácticas Subdirección de Tecnologías de la Información Archivística y Documento Electrónico 2 MiniManual Archivamiento Web - Archivo General de la Nación Créditos ARCHIVO GENERAL DE LA NACIÓN JORGE PALACIOS PRECIADO -COLOMBIA Establecimiento público adscrito al Ministerio de Cultura Consejo Directivo Ministerio de Cultura Ministra: Mariana Garcés Córdoba Viceministra: María Claudia López Sorzano Presidenta del Consejo Representante de los Archivos del País Margarita Monsalve Salas Alcaldía Distrital de Barranquilla Academia Colombiana de Historia Juan Camilo Rodríguez Gómez Presidente Colciencias Juanita León Peñarenas Delegada de la Sra. Directora Autor Archivo General de la Nación Jhon Alexander González Flórez Carlos Alberto Zapata Cárdenas Director General Preparado por: Iván Eduardo Triana Bohórquez Comité Editorial Carlos Alberto Zapata Cárdenas Gráficas Claudia Ivonne Fáctor Lugo Ivan Triana Bohorquez Mauricio Tovar González Jhon Alexander González Flórez ISBN John Francisco Cuervo Alonso 978-958-8242-35-4 Natacha Eslava Vélez Dania Paola Asprilla Yurgaqui Archivo General de la Nación de Colombia Carrera 6 No. 6-91 Coordinación Editorial y Diagramación Teléfono: 328 2888 Fax: 337 2019 Dania Paola Asprilla Yurgaqui E-mail: [email protected] Sandra Cardona Carvajal Página web: www.archivogeneral.gov.co Catalina Lozano Ortega Bogotá D.C., Colombia - 2015 Fotografía de Carátula Las publicaciones del Archivo General de la Na- Atribución-NoComercial-SinDerivadas 2.0 Gené- ción de Colombia están protegidas por lo dispuesto rica (CC BY-NC-ND 2.0) -jadjadjad https://www. en la Ley 23 de 1982. Podrán reproducirse extrac- flickr.com/photos/jadjadjad/3116787127 tos sin autorización previa, indicando la fuente.
    [Show full text]