CodeKitHub
Besedilna orodja

Odstranjevanje ločil in posebnih znakov

Nazadnje posodobljeno:

Prilepite besedilo, izberite samo ločila ali vse posebne znake, in orodje jih odstrani z enim klikom — pri čemer ohrani črke, številke in (izbirno) presledke nedotaknjene. Deluje popolnoma v vašem brskalniku.

Kaj je to orodje?

To orodje odstrani neželene znake iz besedila v dveh izbirnih načinih. "Samo ločila" cilja na pogosta ločila — pike, vejice, klicaje, narekovaje, oklepaje in podobne simbole — pri čemer pusti črke, številke in druge znake nedotaknjene. "Vsi posebni znaki" je širše: odstrani vse, kar ni črka, številka ali presledek, z uporabo ujemanja, ki upošteva Unicode, tako da se naglašene črke in nelatinične pisave (kitajska, cirilica, arabska itd.) pravilno ohranijo kot črke, namesto da bi bile odstranjene.

Potrditveno polje "ohrani presledke" določa, ali odstranjeni znaki pustijo vrzel (presledki ohranjeni) ali se preostale besede združijo z normaliziranim enojnim presledkom.

Zakaj ga uporabiti?

  • Dva jasna načina — samo ločila ali vsi posebni znaki — namesto enega fiksnega vedenja.
  • Upošteva Unicode: pravilno ohranja naglašene in nelatinične črke kot črke, ne kot posebne znake.
  • Možnost ohranitve ali združitve presledkov, ki ostanejo po odstranjenih znakih.
  • Lokalna obdelava — besedilo nikoli ne zapusti vašega brskalnika.
  • Brez registracije, brez omejitev, brezplačna uporaba.

Kako ga uporabljati

  1. Prilepite besedilo v vnosno polje.
  2. Izberite "Odstrani samo ločila" ali "Odstrani vse posebne znake".
  3. Preklopite "Ohrani presledke" glede na to, ali želite pustiti vrzeli.
  4. Kliknite Odstrani in kopirajte rezultat.

Primer

Vnos

Hello, World! (test)

Rezultat

Hello World test

Način samo ločil odstrani vejico, klicaj in oklepaje, besede pa ostanejo ločene z izvirnimi presledki.

Pogoste uporabe

  • Čiščenje besedila pred vnosom v števec pogostosti besed ali iskalni indeks.
  • Odstranjevanje artefaktov oblikovanja iz besedila, kopiranega iz PDF-ja ali skeniranega dokumenta.
  • Priprava besedila za tokenizacijo v skriptu za učenje jezikov ali NLP.
  • Odstranjevanje narekovajev in ločil s seznama pred odstranjevanjem podvojenih vnosov.

Pogosta vprašanja

Kaj šteje kot "ločilo" v primerjavi z "vsemi posebnimi znaki"?

Samo ločila odstrani znake, kot so . , ! ? ; : ' " ( ) [ ] { } in podobne simbole, ki se uporabljajo za strukturiranje stavkov. Vsi posebni znaki je širša možnost — odstrani tudi simbole, kot so @ # $ % ^ & *, ki niso strogo ločila, a tudi niso črke ali številke.

Ali bo to odstranilo kitajske, arabske ali naglašene črke?

Ne. Oba načina uporabljata ujemanje znakov, ki upošteva Unicode, zato se črke iz katere koli pisave — plus latinične črke z naglasi, kot sta é ali ü — pravilno prepoznajo kot črke in ohranijo, namesto da bi jih obravnavali kot posebne znake.

Kaj se zgodi s presledki, ko odstranim ločila?

Če je označeno "Ohrani presledke", se izvirni presledki med besedami ohranijo (združijo se le nenamerni dvojni presledki). Če ni označeno, se vsi presledki normalizirajo na enojne presledke in obrežejo.

Ali to deluje na številkah?

Številke se nikoli ne odstranijo z nobenim od načinov — odstranijo se samo ločila ali nealfanumerični simboli, številke se vedno ohranijo.

Ali se moje besedilo kam naloži?

Ne. Obdelava poteka lokalno v JavaScriptu v vašem brskalniku; nič se ne pošlje na strežnik.

Sorodna orodja