Che cos'è questo strumento?
Gli elenchi incollati — provenienti da fogli di calcolo, esportazioni di e-mail, file di log, dati estratti — presentano sistematicamente gli stessi cinque problemi: voci duplicate, righe vuote, spazi iniziali/finali non uniformi, doppi spazi dove dovrebbe essercene uno solo e assenza di un ordine specifico. Risolvere tutti e cinque questi problemi comporta solitamente il passaggio da uno strumento all’altro, ciascuno dedicato a un unico scopo.
Questo strumento esegue tutte e cinque le operazioni in un unico processo tramite caselle di selezione, nell'ordine effettivamente rilevante (elimina e comprime gli spazi prima della deduplicazione, in modo che "foo " e "foo" vengano correttamente riconosciuti come la stessa riga).
Perché usarlo?
- Cinque vere e proprie operazioni di pulizia in un unico passaggio, non solo deduplicazione.
- Casella di controllo: deseleziona qualsiasi passaggio che non desideri.
- Le operazioni vengono eseguite nell'ordine che produce risultati corretti (spazi bianchi normalizzati prima della deduplicazione).
- Indica esattamente quante righe sono state eliminate.
- Locale e privato: i messaggi non escono mai dal tuo browser.
Come si usa
- Incolla il testo o l'elenco nella casella di immissione.
- Seleziona le operazioni desiderate (per impostazione predefinita, sono tutte attive tranne l'ordinamento).
- Clicca su "Clean": il risultato apparirà qui sotto con il numero di righe rimosse.
- Copia il risultato pulito.
Esempio
Input
apple
banana
apple
banana
cherryRisultato
apple
banana
cherryGli spazi bianchi vengono prima normalizzati, quindi "apple " e "apple" vengono riconosciuti come duplicati e uniti — un errore comune negli strumenti più semplici.
Usi comuni
- Eliminazione dei duplicati da un elenco esportato da un foglio di calcolo o da un sistema CRM prima di reimportarlo.
- Pulizia di una lista di indirizzi e-mail ottenuta dall'unione di più fonti, con rimozione degli indirizzi duplicati.
- Pulizia dell'output del file di log — rimozione delle righe vuote e delle voci duplicate prima dell'analisi.
- Preparare un elenco di parole chiave o URL per gli strumenti SEO, con una voce per riga.
Perché la sequenza delle operazioni modifica il risultato
L'esecuzione di queste cinque operazioni nell'ordine sbagliato produce risultati leggermente errati; ecco perché questo strumento corregge la sequenza anziché consentire l'esecuzione dei passaggi in qualsiasi combinazione. L'esempio più chiaro: se la deduplicazione venisse eseguita prima della rimozione degli spazi bianchi, "apple" e "apple " (con uno spazio finale) verrebbero trattate come due righe diverse ed entrambe conservate, vanificando silenziosamente l'intero scopo della deduplicazione. Eseguire prima la rimozione degli spazi bianchi e il raggruppamento significa che ogni riga si trova nella sua forma finale e canonica prima che lo strumento verifichi la presenza di duplicati, in modo che le righe che sono sostanzialmente identiche — indipendentemente dagli spazi bianchi casuali derivanti da un copia-incolla — vengano correttamente riconosciute come tali. La stessa logica si applica alla rimozione delle righe vuote che avviene prima della deduplicazione: un accumulo di righe vuote provenienti da fonti diverse verrebbe altrimenti confrontato tra loro in modi irrilevanti per il contenuto effettivo.
Domande frequenti
In quale ordine vengono eseguite le operazioni?
Elimina gli spazi iniziali/finali → comprimi gli spazi → rimuovi le righe vuote → elimina i duplicati → ordina. L'ordine è importante: normalizzare gli spazi prima di eliminare i duplicati fa sì che le righe che differiscono solo per la presenza di spazi superflui vengano correttamente trattate come duplicati.
La deduplicazione distingue tra maiuscole e minuscole?
Sì — "Apple" e "apple" vengono considerati come righe diverse. In questo modo si evita di unire accidentalmente voci effettivamente diverse; se hai bisogno di una corrispondenza che non tenga conto delle maiuscole e minuscole, scrivi prima il testo in minuscolo.
Quale metodo di ordinamento viene utilizzato per il testo in cinese?
Ordine alfabetico basato sul pinyin, in modo che le voci in cinese siano ordinate come apparirebbero in una rubrica telefonica, anziché in base al codice dei caratteri grezzi.
Riuscirà a gestire un elenco molto lungo?
Sì — l'elaborazione avviene nel browser senza alcun limite di dimensione, se non quello della memoria del dispositivo, che è ben superiore alle dimensioni tipiche dei file esportati dai fogli di calcolo.
I miei dati vengono caricati da qualche parte?
No. Tutte e cinque le operazioni vengono eseguite come codice JavaScript locale nel browser. Non viene inviato nulla a un server, quindi è possibile utilizzarle in tutta sicurezza su elenchi di clienti esportati o altri dati sensibili.
È la stessa cosa di uno “strumento per rimuovere le righe duplicate”?
Sì — la rimozione delle righe duplicate è una delle cinque operazioni disponibili (insieme all'eliminazione degli spazi iniziali/finali, alla compressione degli spazi, alla rimozione delle righe vuote e all'ordinamento). Seleziona solo "Rimuovi duplicati" se è l'unica operazione di cui hai bisogno; le altre quattro sono facoltative.