Wanneer de scope is bepaald en duidelijk is wat je gaat archiveren, volgt onvermijdelijk de volgende stap: het daadwerkelijk verplaatsen van grote hoeveelheden data. Bulkmigratie klinkt overzichtelijk, maar in de praktijk is dit het punt waarop schaal, performance en betrouwbaarheid samenkomen — en waar aannames snel worden getest.
Tijdens deze archiefmigratie zijn er per applicatie drie vaste momenten waarop grote datavolumes in beweging komen. Eerst wordt de data gedownload naar een migratieserver. Vervolgens worden bestanden verplaatst — en waar nodig hernoemd — naar de gewenste folderstructuur. Tot slot wordt alles geüpload naar het webarchief. Elk van deze stappen lijkt op zichzelf beheersbaar, maar in combinatie bepalen ze het tempo én de foutgevoeligheid van het traject.
Voor het up- en downloaden van data is bewust gekozen voor standaard tooling, zoals FileZilla als sFTP-client en de CLI van S3 browser voor uploads naar cloudopslag. Deze tools zijn stabiel, voorspelbaar en doen precies wat nodig is. De echte complexiteit zat echter in de tussenstap: het verplaatsen en structureren van bestanden op schaal.
Niet alles bleek even voorspelbaar. Helaas liepen we tegen stabiliteitsproblemen en andere issues aan bij het verplaatsen en hernoemen van bestanden in de gewenste folderstructuur. Dit heeft ertoe geleid dat we hier voor een maatwerkoplossing hebben gekozen.
De maatwerkoplossing verdeelt het werk over meerdere CPU’s en maakt gebruik van threading, zodat bestanden parallel en gecontroleerd gekopieerd kunnen worden. De benodigde informatie wordt rechtstreeks uit de database gehaald, waardoor exact bekend is waar een bestand zich bevindt, waar het naartoe moet en welke naam het krijgt. Door uitgebreide logging is bovendien vastgelegd welke bestanden al verwerkt zijn, zodat een proces na onderbreking niet opnieuw hoeft te beginnen. Problemen met betrekking tot performance, throttling, bestandsnamen, padlengtes & platformafhankelijke limieten werden voorkomen door het gebruik van de maatwerkoplossing. Ook foutafhandeling vroeg meer aandacht dan vooraf ingeschat — juist omdat je bij dit soort volumes geen handmatige correcties wilt uitvoeren.
Tegelijkertijd waren er ook positieve verrassingen. De stabiliteit van de processen bij gebruik van de maatwerkoplosing was hoog en automatische controles gaven snel inzicht in voortgang en eventuele afwijkingen. Dat zorgde voor vertrouwen in het proces, zelfs wanneer de migratie langere tijd draaide.
Bulkmigratie draait daarmee niet alleen om snelheid, maar vooral om beheersbaarheid: weten wat er gebeurt, waar het gebeurt en wat de status is — op elk moment.
In de volgende post ga ik dieper in op metadata: hoe bestanden vindbaar en begrijpelijk blijven zodra ze zijn gemigreerd, en waarom dit minstens zo bepalend is voor de waarde van een archief als de migratie zelf.
