Confronto delle differenze fra file CSV
Confronta due file CSV e mostra a colpo d'occhio le righe aggiunte, quelle eliminate e le celle modificate. Potete indicare una colonna qualsiasi come chiave d'identificazione delle righe e vedere affiancati i valori prima e dopo la modifica. Il confronto funziona anche fra file con colonne diverse e l'elaborazione avviene interamente nel navigatore.
Consigli
- Come colonna chiave è scelta per impostazione predefinita la prima, ma se esiste una colonna che funge da identificativo o chiave primaria conviene indicare quella: le righe corrispondenti saranno riconosciute correttamente anche in presenza di riordinamenti, aggiunte ed eliminazioni.
- Se confrontate file privi di riga d'intestazione, togliete la spunta all'opzione corrispondente: le colonne saranno denominate automaticamente col1, col2 e così via.
- Nella sezione delle righe modificate, per le righe con la stessa chiave si confrontano i valori colonna per colonna e si elencano soltanto quelle differenti, nella forma «prima, dopo».
- Anche i file separati da tabulazioni si confrontano direttamente: basta scegliere la tabulazione come carattere separatore.
- Invece di caricare i file potete anche incollare senz'altro un intervallo copiato da Excel o da un foglio di calcolo.
Domande frequenti
A proposito — perché per i file CSV il confronto testuale non basta
Per esaminare le differenze fra due file CSV si è tradizionalmente ricorso al confronto a vista di due fogli affiancati in Excel oppure al comando di confronto di Git, che opera sul testo riga per riga. Ma poiché in un file CSV ogni riga contiene più valori separati da virgole, il confronto testuale per righe non rivela a colpo d'occhio quale colonna sia cambiata. Questo strumento individua le modifiche cella per cella proprio per colmare quella lacuna.
Nei sistemi gestionali capita di frequente di esportare in CSV le tabelle di una base di dati per confrontarle: è la cosiddetta riconciliazione dei dati. Quando si verifica che i dati coincidano prima e dopo una migrazione, o che l'esito di un'elaborazione mensile sia quello atteso, non è raro che le righe interessate siano migliaia o decine di migliaia. A quella scala diventa indispensabile un raffronto meccanico basato su una colonna chiave.
Gli algoritmi di confronto dei sistemi di controllo di versione come Git, per esempio il metodo di Myers, eccellono nel rilevare righe aggiunte ed eliminate, ma non sono necessariamente i più adatti a dati in cui, a parità di riga, cambia soltanto il valore di qualche colonna. Il metodo adottato qui — abbinare le righe per chiave e confrontarle poi cella per cella — è un approccio pensato appositamente per i dati in forma tabellare.