Quanti di voi, navigando sul web, hanno spesso indossato il cappello da archivista? Sì, perché quella pagina web contiene informazioni troppo importanti perché vadano perse e salvarla come segnalibro è rischioso: cosa ci garantisce che la stessa pagina non venga rimossa o che non sia aggiornata, in peggio? Un sito può dipendere da JavaScript, API, contenuti caricati dinamicamente, immagini esterne, video, sessioni di autenticazione e risorse che smettono di esistere poche settimane dopo.
ArchiveBox è un progetto innovativo che prova ad affrontare il problema da una prospettiva molto più ampia, assomigliando sempre meno a una semplice “Wayback Machine installata in casa” e sempre più a una piattaforma personale per registrare una porzione del web nel tempo.
Con il rilascio dell’ultima versione di ArchiveBox (download), l’applicazione riceve un motore profondamente rinnovato, app per dispositivi mobili e desktop, più di 50 plugin e nuovi strumenti di automazione. Le novità più significative, però, riguardano ciò che ArchiveBox può acquisire e soprattutto ciò che può restituire successivamente alla creazione dell’archivio.
ArchiveBox non salva soltanto il codice HTML di una pagina
Il principio di ArchiveBox resta quello che ha sempre distinto il progetto: una stessa URL può essere conservata utilizzando più rappresentazioni indipendenti.
Una stessa pagina può quindi portare alla produzione di HTML, PDF, screenshot, testo dell’articolo, file MHTML, risorse multimediali, repository Git, metadati e formati pensati specificamente per l’archiviazione e il recupero dei dati raccolti. La nuova architettura a plugin rende molto semplice combinare gli strumenti disponibili e aggiungerne altri.
Un PDF può conservare bene l’aspetto visivo ma perdere il comportamento della pagina; un dump HTML potrebbe non includere le risorse generate lato client; uno screenshot mostra ciò che appariva sullo schermo ma non conserva collegamenti, struttura semantica e contenuti non visibili. Utilizzare più acquisizioni dello stesso documento riduce la dipendenza da un singolo formato.
ArchiveBox salva inoltre informazioni che normalmente non vengono associate a un archivio web: reindirizzamenti, intestazioni HTTP, DNS, certificati TLS, log della console, informazioni sull’attività del browser e accessibility tree.
Il risultato non è quindi soltanto una “copia della pagina”, ma una collezione di artefatti che descrivono ciò che il browser ha incontrato durante l’acquisizione.

La cronologia del browser può diventare un archivio
L’estensione per i browser web di ArchiveBox raccoglie alcune tra le novità più importanti.
ArchiveBox può importare bookmark e cronologia da Chrome, Brave, Edge, Firefox e, attraverso i relativi strumenti di esportazione, anche Safari. L’estensione può inoltre acquisire localmente screenshot e MHTML prima di inviare i risultati al server ArchiveBox ospitabile in proprio (self-hosting).
Un ricercatore potrebbe conservare automaticamente determinate URL visitate durante un’indagine; uno sviluppatore potrebbe archiviare documentazione tecnica e repository consultati durante un progetto; un’azienda potrebbe mantenere copie periodiche di pagine pubbliche o documenti web rilevanti.
Le allowlist e denylist permettono inoltre di decidere quali URL meritino di essere conservate: non è necessario (ed è anche controproducente) archiviare indistintamente tutto ciò che passa dal browser.

Archiviare anche ciò che c’è dietro un login
Il web contiene una quantità enorme di informazioni che un crawler tradizionale non può vedere. Dashboard, portali aziendali, documenti personali, applicazioni SaaS e numerosi social network mostrano contenuti soltanto dopo l’autenticazione: ArchiveBox introduce per questo le cosiddette Personas.
Una Persona associa un profilo browser, cookie, impostazioni e stato di autenticazione a un’identità utilizzabile durante l’attività di crawling ossia di scansione e recupero dei contenuti.
ArchiveBox può importare i profili da Chrome, Chromium, Brave ed Edge e riutilizzarne le sessioni durante l’acquisizione delle pagine. La funzione non aggira alcuna autenticazione: ArchiveBox utilizza semplicemente una sessione alla quale l’utente possiede già accesso.
C’è però una conseguenza di sicurezza evidente: sincronizzare i cookie significa affidare al server ArchiveBox credenziali di sessione potenzialmente molto potenti.
Un esempio pratico:
archivebox persona create --import=chrome personal
archivebox add --persona=personal 'https://example.com/private-page'
Persona può quindi contenere cookie, local storage, IndexedDB, service worker e altre informazioni associate al profilo Chromium. ArchiveBox crea una copia utilizzabile dal sistema di acquisizione senza modificare il profilo originale.

Il crawler può tornare automaticamente sulle stesse fonti
Grazie ad ArchiveBox, è possibile programmare importazioni periodiche di URL, feed RSS, bookmark e altre sorgenti senza dover costruire separatamente un sistema basato su cron o comunque su attività pianificate. Le esecuzioni possono essere controllate dall’interfaccia, con funzioni per sospendere, riprendere, interrompere o ritentare un crawl.
Il motore gestisce inoltre limiti relativi a profondità, numero di URL, durata e dimensione dell’acquisizione, in modo da impedire a un crawl ricorsivo di espandersi indefinitamente.
Il modello diventa particolarmente utile quando interessa conoscere l’evoluzione di una risorsa: è ad esempio possibile acquisire periodicamente una pagina di condizioni contrattuali, una documentazione software, una pagina istituzionale oppure un listino. ArchiveBox crea così una sequenza di snapshot consultabili nel tempo.
ArchiveBox può essere controllato anche dagli agenti AI
L’ultima versione del software introduce un altro elemento accattivante: un server MCP, Model Context Protocol. Il comando archivebox mcp espone le operazioni di ArchiveBox come strumenti che un client MCP può scoprire e invocare. Un agente compatibile può quindi aggiungere URL, interrogare l’archivio e lavorare sui record della collezione.
ArchiveBox comprende inoltre un’integrazione opzionale con OpenCode e un file SKILL.md destinato agli agenti di sviluppo. Gli esempi proposti dagli sviluppatori comprendono la scelta dei plugin più adatti, la configurazione di un crawl, la ricerca di materiale già acquisito e l’analisi di catture fallite.
Non è una soluzione che ha bisogno di un modello AI per funzionare: parliamo di funzionalità completamente opzionali e attivabili a discrezione dell’utente. MCP apre però scenari interessanti.
Si potrebbe chiedere a un agente AI di cercare nell’archivio tutte le pagine relative a un determinato prodotto e acquisire nuovamente quelle non aggiornate da 6 mesi; oppure verificare quali snapshot non possiedono screenshot, PDF o una particolare prova crittografica e programmare una nuova acquisizione.
In pratica l’interfaccia non è più necessariamente soltanto la GUI o la CLI (command-line interface): anche un software esterno può ragionare sulla collezione di ArchiveBox e avviare ogni genere di operazione.
Come provare ArchiveBox in pochi minuti
Il modo più semplice per capire ArchiveBox è installarlo e affidargli una pagina da conservare. Gli sviluppatori consigliano Docker Compose, perché permette di ottenere in un unico ambiente ArchiveBox e le dipendenze necessarie ai vari sistemi di acquisizione.
Su una macchina Linux o macOS con Docker e Docker Compose già installati si può creare una directory dedicata e recuperare il file di configurazione ufficiale:
mkdir -p ~/archivebox/data cd ~/archivebox curl -fsSL 'https://docker-compose.archivebox.io' > docker-compose.yml docker compose pull docker compose up -d --wait
La directory data contiene la raccolta e permette di conservarla anche eliminando o aggiornando il container. Al primo avvio ArchiveBox inizializza automaticamente l’archivio; l’interfaccia amministrativa locale è raggiungibile all’indirizzo:
admin.archivebox.localhost:5797
Da qui si completa la configurazione iniziale e si crea il primo account amministratore.
Salvare la prima pagina Web
Per aggiungere una URL non è nemmeno necessario aprire il browser: dalla directory che contiene docker-compose.yml basta eseguire:
docker compose run --rm archivebox add 'https://example.com'
Oppure, se il container ArchiveBox è già in esecuzione:
docker compose exec archivebox archivebox add 'https://example.com'
ArchiveBox prende in esame l’UL specificato e avvia i moduli extractor configurati. A seconda dei plugin disponibili può produrre più rappresentazioni della stessa risorsa: HTML, screenshot, PDF, testo estratto, MHTML, file multimediali e altri artefatti.
ArchiveBox accetta anche elenchi di indirizzi. Se urls.txt contiene un URL per riga, si può importare tutto con:
docker compose run --rm -T archivebox add < urls.txt
La stessa logica consente di alimentare ArchiveBox con feed RSS, esportazioni di bookmark, cronologia del browser e altre sorgenti contenenti collegamenti.
Chiedere ad ArchiveBox di controllare una pagina ogni giorno
Ancora più interessante è trasformare una normale acquisizione in un monitoraggio nel tempo. Supponiamo di voler conservare quotidianamente una pagina che contiene prezzi, documentazione, condizioni di servizio o informazioni destinate a cambiare.
ArchiveBox integra lo scheduler nel proprio database: non serve quindi configurare separatamente cron sul sistema host quando il server ArchiveBox rimane in esecuzione.
Un’attività quotidiana si crea, ad esempio, così:
docker compose run --rm archivebox \
schedule --every=daily 'https://example.com'
Per visualizzare le pianificazioni configurate:
docker compose run --rm archivebox schedule --show
Il server ArchiveBox controlla le pianificazioni e, quando arriva il momento previsto, inserisce un nuovo crawl nella coda di elaborazione. Ogni esecuzione produce quindi un nuovo stato della risorsa, rendendo possibile confrontare ciò che era disponibile in momenti differenti.
ArchiveBox si usa anche dal browser: la CLI non è obbligatoria
Gli esempi precedenti utilizzano la riga di comando perché permette di capire rapidamente cosa succede dietro le quinte e si presta molto bene all’automazione.
Nell’uso quotidiano, però, ArchiveBox può essere gestito anche attraverso una vera e propria interfaccia web interattiva utilizzabile per visualizzare, amministrare e aggiungere collegamenti all’archivio.
Una volta avviato il container con docker compose up -d, basta quindi aprire dalla barra degli indirizzi del browser admin.archivebox.localhost:5797/admin/. Se BASE_URL non è ancora configurato, ArchiveBox propone una procedura guidata per completare la prima configurazione.
Dalla GUI si possono aggiungere nuove URL senza impartire archivebox add, consultare gli snapshot già acquisiti, controllare i relativi metadati e gestire il contenuto dell’archivio.
Le attività inviate dalla Web UI non costituiscono inoltre un percorso separato: entrano nella stessa infrastruttura di elaborazione utilizzata da API e scheduler.
Anche l’estensione per browser si integra con questa modalità di lavoro: dopo aver effettuato il login nell’interfaccia amministrativa di ArchiveBox, l’estensione può riutilizzare la sessione per inviare direttamente al server le pagine che si stanno visitando, evitando di copiare manualmente le URL o aprire un terminale.
La CLI non è insomma obbligatoria: è solamente uno degli strumenti disponibili. Chi preferisse un utilizzo visuale può lavorare prevalentemente dal browser, mentre comandi, API e MCP diventano particolarmente utili quando si vogliono costruire procedure automatiche o integrare ArchiveBox con altri software.