CodeKitHub
Текстові інструменти

Очищення тексту онлайн

Останнє оновлення:

Більшість онлайн-інструментів для видалення дублікатів роблять лише одну справу. Цей поєднує п'ять операцій очищення, які насправді потрібні — видалення дублікатів, видалення порожніх рядків, обрізання пробілів, стиснення пробілів і сортування — в один прохід із прапорцями, тож безладні списки та вставлені дані виправляються одним кліком замість п'яти окремих інструментів.

Що це за інструмент?

Вставлені списки — з електронних таблиць, експортів пошти, файлів логів, зібраних даних — регулярно мають одні й ті самі п'ять проблем: повторювані записи, порожні рядки, непослідовні пробіли на початку чи в кінці, подвійні пробіли там, де має бути один, і жодного певного порядку. Виправлення всіх п'яти зазвичай означає перемикання між окремими вузькоспеціалізованими інструментами.

Цей інструмент виконує всі п'ять операцій за один раз із прапорцями, у порядку, що справді має значення (обрізання й стиснення пробілів перед видаленням дублікатів, щоб "foo " і "foo" коректно розпізнавалися як однаковий рядок).

Навіщо його використовувати?

  • П'ять реальних операцій очищення за один прохід, а не лише видалення дублікатів.
  • Керування прапорцями — вимикайте будь-який крок, який вам не потрібен.
  • Операції виконуються в порядку, що дає коректний результат (пробіли нормалізуються перед видаленням дублікатів).
  • Показує точну кількість видалених рядків.
  • Локально і приватно — текст ніколи не залишає ваш браузер.

Як користуватися

  1. Вставте свій текст або список у поле введення.
  2. Позначте потрібні операції (усі, крім сортування, увімкнені за замовчуванням).
  3. Натисніть "Очистити" — результат з'явиться нижче з кількістю видалених рядків.
  4. Скопіюйте очищений результат.

Приклад

Введення

apple 
banana

apple
  banana  
cherry

Результат

apple
banana
cherry

Пробіли спершу нормалізуються, тож "apple " і "apple" розпізнаються як дублікати й об'єднуються — це часто пропускають простіші інструменти.

Типові випадки використання

  • Видалення дублікатів у списку, експортованому з електронної таблиці чи CRM, перед повторним імпортом.
  • Очищення списку електронних адрес, зібраного з кількох джерел, з видаленням повторюваних адрес.
  • Впорядкування виводу файлу логів — видалення порожніх рядків і дублікатів перед аналізом.
  • Підготовка списку ключових слів чи URL для SEO-інструментів, по одному чистому запису на рядок.

Чому порядок операцій впливає на результат

Виконання цих п'яти операцій у неправильному порядку дає непомітно неправильні результати, тому цей інструмент фіксує послідовність замість того, щоб дозволяти виконувати кроки в будь-якій комбінації. Найяскравіший приклад: якби видалення дублікатів виконувалося перед обрізанням пробілів, "apple" і "apple " (з пробілом у кінці) вважалися б двома різними рядками й обидва залишилися б — непомітно зводячи нанівець увесь сенс видалення дублікатів. Виконання обрізання та стиснення пробілів першими означає, що кожен рядок перебуває у своїй остаточній, канонічній формі до того, як інструмент перевіряє дублікати, тож рядки, які по суті однакові — незалежно від випадкових пробілів, підхоплених при копіюванні-вставленні — коректно розпізнаються як такі. Та сама логіка стосується видалення порожніх рядків перед видаленням дублікатів: накопичення порожніх рядків з різних джерел інакше порівнювалося б одне з одним у спосіб, що не має значення для реального змісту.

Часті запитання

У якому порядку застосовуються операції?

Обрізання → стиснення пробілів → видалення порожніх рядків → видалення дублікатів → сортування. Цей порядок важливий: нормалізація пробілів перед видаленням дублікатів означає, що рядки, які відрізняються лише випадковими пробілами, коректно розпізнаються як дублікати.

Чи враховує видалення дублікатів регістр літер?

Так — "Apple" і "apple" вважаються різними рядками. Це запобігає випадковому об'єднанню справді різних записів; якщо потрібне зіставлення без урахування регістру, спочатку приведіть текст до нижнього регістру.

Як сортується китайський текст?

За алфавітним порядком на основі піньїнь, тож китайські записи сортуються так само, як у списку контактів телефону, а не за необробленим кодом символу.

Чи впорається інструмент з дуже великим списком?

Так — обробка відбувається у вашому браузері без обмежень розміру, окрім тих, що диктує пам'ять вашого пристрою, а це значно більше за типовий розмір експорту з електронної таблиці.

Чи завантажуються мої дані кудись?

Ні. Усі п'ять операцій виконуються як локальний JavaScript у вашому браузері. Нічого не надсилається на сервер, тож це безпечно використовувати для експортованих клієнтських списків чи інших чутливих даних.

Це те саме, що "видалення повторюваних рядків"?

Так — видалення повторюваних рядків є однією з п'яти операцій тут (поряд з обрізанням, стисненням пробілів, видаленням порожніх рядків і сортуванням). Позначте лише "Видалити дублікати", якщо це все, що вам потрібно; решта чотирьох — необов'язкові.

Схожі інструменти