El Web Archiving I L'arxivística

El Web Archiving i l’Arxivística Treballs de recerca del Màster d’Arxivística i Gestió de Documents Curs 2012-2013 Autor: Santiago Lopera Tutor: Joan Soler Títol: El web archiving i l’arxivística Autor: Santiago Lopera Resum: El present treball vol destacar el paper fonamental que la preservació digital ha de jugar per mantenir accessibles en el futur els documents del present, mitjançant l’estudi i anàlisi d’una de les seves branques més rellevants: l’arxivament de les pàgines web. Aquesta és una disciplina que te el seu origen en el camp de la biblioteconomia i les ciències de la informació i és aliena al món arxivístic del nostre país. La primera part del present treball ofereix un breu estat de la qüestió sobre l’arxivament de les pàgines web i, des d’una perspectiva arxivística, intentarà donar resposta a qüestions com en què consisteix l’arxivament de les pàgines web? Per a què serveix? Des de quan es practica? Quines organitzacions el practiquen? Com es captura i emmagatzema el web? En la segona part es proposa una reflexió sobre l’aplicació de l’arxivament web des de la disciplina arxivística, que pot donar un pas endavant en la seva evolució mitjançant l’assoliment d’aquest tipus de reptes. Paraules clau: Preservació digital, arxivament web, arxivística, Internet, Biblioteques Nacionals, documents electrònics, tecnologies de la informació i la comunicació. Title: Web archiving and records management science Author: Santiago Lopera Abstract: The following essay aims to highlight the essential role of digital preservation to keep the documents of today available for tomorrow by studying and analizing one of its most important branches: web archiving. This one is a discipline that has its roots in Library Science and Information Science, and it is completely alien to the world of the archives in our country. The first part of this essay offers a brief overview on web archiving and, from an archival science point of view, will try to answer questions like: What is web archiving? What is it used for? When did it begin? Which organizations are putting it into practice? How can we capture and store a website? In the second part, we will try to think about the implementation of web archiving from the perspective of the archival science, who can take a step forward in its evolution by the accomplishment of this sort of challenges. Keywords: Digital preservation, web archiving, records management, Internet, National Libraries, electronics records, information and communication technologies. 2 Sumari Sumari .......................................................................................................................... 3 Introducció .................................................................................................................... 4 Part I Web archiving...................................................................................................... 6 1. Què és el web archiving? .......................................................................................... 7 2. Quan es comença a arxivar el web? ......................................................................... 9 3. Per què arxivar el web? .......................................................................................... 10 4. Com s’arxiva el web? .............................................................................................. 11 4.1. Crawlers ........................................................................................................... 12 4.2. Models de captura............................................................................................ 12 4.3. Polítiques ......................................................................................................... 13 5. Entrebancs del Web Archiving ................................................................................ 14 5.1. Dificultats tècniques ......................................................................................... 14 5.2. Dificultats legals ............................................................................................... 18 5.3. Dificultats d’organització................................................................................... 18 5.4. Dificultats econòmiques ................................................................................... 19 6. Qui arxiva el web? .................................................................................................. 20 6.1. Biblioteques nacionals ..................................................................................... 20 6.2. Projectes supranacionals ................................................................................. 22 6.3. Universitats i organismes d’investigació ........................................................... 24 6.4. Empreses ......................................................................................................... 25 7. L’arxivament del web a Catalunya: el PADICAT ..................................................... 26 Part II El web archiving i l’Arxivística ........................................................................... 34 1. És el web un document d’arxiu? ............................................................................. 35 2. Per què els arxius de Catalunya no arxiven les webs? ........................................... 36 3. Incorporació de l’arxivament web a les tasques d’arxiu ........................................... 39 4. Escenaris possibles ................................................................................................ 41 Conclusions ................................................................................................................ 43 Glossari ...................................................................................................................... 46 Bibliografia i fonts ....................................................................................................... 47 Annexos...................................................................................................................... 51 3 Introducció La voluntat d’aquest treball és la de cridar l’atenció de la comunitat arxivística del país al voltant d’una de les branques de la preservació digital que més expansió es preveu que ha de tenir durant els pròxims anys, l’arxivament del web, i que fins ara és una pràctica inèdita als nostres arxius. Internet és un instrument que des de fa anys està experimentant una expansió que no té frenada, i no només és el mitjà per excel·lència a través del qual les persones intercanvien tot tipus de béns, d’informació, de dades, sinó que també és un sistema de producció de documents de primera magnitud. Aquests documents que viatgen pel ciberespai, de màquina a màquina, de servidor a servidor, de pàgina web a pàgina web, no acostumen a ser tractats arxivísticament, amb la consegüent pèrdua de contextualització que això comporta, i de garanties de fiabilitat, integritat, i autenticitat que la disciplina arxivística és capaç de garantir. No es pot dir, a juny de 2013, que la gestió dels documents electrònics sigui quelcom nou que s’acaba d’inventar, i malgrat això és una pràctica que no està plenament implantada als arxius de Catalunya. El tractament de les pàgines web, la seva captura, gestió i preservació és una faceta més de la gestió de documents electrònics que ha estat oblidada durant massa temps i potser ha arribat el moment de començar a pensar la manera com els arxivers i gestors documentals podem afrontar-la. Pensem, per exemple, en les seus electròniques que l’Administració desenvolupa per relacionar-se amb els ciutadans. Aquestes pàgines web contenen documents amb valor jurídic, generadors de drets i obligacions, i potser fóra bo aplicar l’arxivament del web a les seus electròniques per garantir una millor gestió de la seva informació. El treball es divideix en dues parts, en la primera s’intenta donar resposta de forma breu i fugint de tecnicismes, a qüestions com ara en què consisteix l’arxivament del web, quan es va començar a aplicar, de quina manera es duu a terme, o quines són les principals institucions que el practiquen avui dia. Intentem entendre també la peculiaritat de les pàgines web, i com la seva natura dinàmica i efímera dificulta el seu tractament des d’un punt de vista arxivístic. Aquests reptes requereixen noves respostes tecnològiques que han de ser desenvolupades sota els criteris de la gestió documental per poder garantir un tractament correcte de les unitats documentals que es creen, s’intercanvien o s’emmagatzemen a les pàgines web. 4 La primera part del treball es tanca amb un breu repàs als principals projectes d’arxivament web del món, realitzats per institucions líders que marquen la pauta del desenvolupament tecnològic i teòric, però que no ho fan sota criteris arxivístics ja que en la seva major part són biblioteques nacionals. Comentem també, i de forma destacada, el cas del PADICAT (Patrimoni Digital de Catalunya), de la Biblioteca Nacional de Catalunya, un projecte de referència internacional desenvolupat al país. La segona part del treball abandona el caràcter expositiu i intenta relacionar la pràctica de l’arxivament del web, creada i desenvolupada des de la biblioteconomia i les ciències de la informació, amb la disciplina arxivística. És, per tant, un apartat més arriscat en el qual l’autor intenta apropar-se al web archiving des d’una perspectiva arxivística, destacant la importància que la gestió documental comenci a veure les pàgines web com

El Web Archiving I L'arxivística

Cat (Curator Archiving Tool): Mejorando El

Catalan Policy and Experiences on Cooperative Repositories

Patrimoni Digital De Catalunya, a Year and a Half Experience

Diapositiva 1

El Projecte PADICAT (Patrimoni Digital De Catalunya) De La Biblioteca De Catalunya

Patrimonio Digital De Cataluña)

INTERNATIONAL CONFERENCE on WEB ARCHIVES and E-LEGAL DEPOSIT Documentary Heritage on the Internet

Web Archiving: International Case Studies and the Brazilian Case

Archiwizacja Webu W Europie – Narodowe Archiwa Sieci

III. DIGITAL PRESERVATION the IMPORTANCE of WEB ARCHIVES for HUMANITIES DANIEL GOMES and MIGUEL COSTA I. INTRODUCTION

Cat (Curator Archiving Tool): Improving Access To

Archivamiento Web Conceptos Básicos, Estrategias Y Mejores Prácticas Mini/Manual Archivamiento Web Conceptos Básicos, Estrategias Y Mejores Prácticas