이 도구는 무엇인가요?
언어 모델은 텍스트를 글자 하나하나 또는 단어 하나하나로 처리하지 않고 "토큰" 단위로 쪼갭니다. 토큰은 보통 몇 글자 정도의 덩어리입니다(영어 기준으로 대략 4글자 또는 0.75단어당 1토큰이지만, 언어와 내용에 따라 크게 달라집니다). 토큰 수는 API 비용과 프롬프트가 모델의 컨텍스트 창(context window)에 들어가는지 여부를 직접 결정합니다.
이 도구는 "글자 수를 4로 나누는" 식의 대략적인 근사가 아니라, 실제 토크나이저 인코딩인 o200k_base(GPT-4o 및 GPT-4o mini에 사용)와 cl100k_base(GPT-4 및 GPT-3.5에 사용)를 그대로 사용합니다. 그래서 여기서 보는 숫자가 실제 과금되거나 제한받는 토큰 수와 일치합니다.
왜 사용해야 할까요?
- 실제 토크나이저 인코딩(o200k_base, cl100k_base) 사용 — 글자 수 기반 추측이 아닙니다.
- 모델을 즉시 전환해서 같은 텍스트가 모델마다 어떻게 다르게 토큰화되는지 비교할 수 있습니다.
- 빠른 참고용으로 글자 수와 단어 수도 함께 표시됩니다.
- 입력하거나 붙여넣는 즉시 실시간으로 갱신됩니다 — 클릭할 버튼이 없습니다.
- 100% 로컬 처리 — 프롬프트나 문서가 서버로 업로드되지 않으므로, 독점 정보나 민감한 텍스트를 다룰 때도 안심할 수 있습니다.
사용 방법
- 텍스트, 프롬프트, 코드를 상자에 붙여넣거나 직접 입력합니다.
- 대상 모델을 선택합니다(GPT-4o / GPT-4o mini, 또는 GPT-4 / GPT-3.5).
- 토큰 수가 즉시 갱신됩니다 — 모델을 바꿔가며 비교해 보세요.
- 토큰 기준이 아닌 다른 제한을 확인할 때는 함께 표시되는 글자 수/단어 수를 참고하세요.
예시
입력
"Hello, world!" (GPT-4o 인코딩 기준)결과
4토큰, 13글자, 2단어짧고 흔한 문구는 단어나 문장부호마다 1토큰으로 처리되는 경우가 많지만, 대소문자·띄어쓰기·언어에 따라 달라집니다.
어떤 토크나이저를 확인해야 할까요?
두 인코딩은 서로 바꿔 쓸 수 없습니다 — 같은 텍스트라도 인코딩에 따라 토큰 수가 눈에 띄게 다르게 나오므로, 실제로 호출하려는 모델에 맞는 쪽을 선택해야 합니다.
| 모델 계열 | 토크나이저 | 언제 사용하나요 |
|---|---|---|
| GPT-4o, GPT-4o mini, GPT-4.1, o1/o3 추론 모델 | o200k_base | 현재 출시된 OpenAI 모델 대부분 — GPT-4o 이후 OpenAI가 내놓은 신규 모델들이 공통으로 쓰는 토크나이저입니다. |
| GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002 | cl100k_base | 구형/레거시 OpenAI 모델, 또는 비용 절감을 위해 여전히 GPT-3.5·GPT-4(비-GPT-4o)를 호출하는 경우. |
| Claude, Gemini, Llama 등 OpenAI 외 모델 | 해당 없음 — 이 도구에서 다루지 않음 | 이들 제공사는 자체 토크나이저(tiktoken 기반이 아님)를 사용하므로, 여기서 나온 숫자는 실제 과금 기준과 일치하지 않습니다. |
실무 팁
- 요청을 보내기 전에 API 비용 예상하기: 글자 수로 대충 추정하는 대신, 토큰 수에 모델별 토큰당 단가를 곱해 빠르게 비용을 추정할 수 있습니다.
- 긴 문서가 모델의 컨텍스트 창에 들어가는지 확인하기: 실제 API 호출이 중간에 실패하는 것을 시행착오로 겪는 것보다, 전체 문서를 여기 먼저 붙여넣어 확인하는 편이 훨씬 빠릅니다.
- 프롬프트 엔지니어링 버전 비교하기: 비용 절감을 위해 시스템 프롬프트를 줄이는 중이라면, "짧아 보인다"는 느낌 대신 각 버전을 여기 붙여넣어 실제로 얼마나 토큰이 줄었는지 직접 확인하세요.
- 비영어 텍스트 확인하기: 중국어, 일본어, 한국어 등 비라틴 문자는 글자당 토큰 수가 영어보다 훨씬 높은 경우가 많습니다. "글자 수 ÷ 4" 규칙이 그대로 적용된다고 가정하지 말고 직접 확인하세요.
자주 묻는 질문
같은 텍스트인데 모델마다 토큰 수가 다르게 나오는 이유는 뭔가요?
GPT-4o와 GPT-4o mini는 GPT-4·GPT-3.5(cl100k_base)보다 더 최신 토크나이저인 o200k_base를 사용합니다. 두 인코딩은 텍스트를 서로 다른 어휘 단위로 쪼개기 때문에, 완전히 같은 입력이라도 어떤 모델을 기준으로 하느냐에 따라 토큰 수가 달라집니다.
토큰 1개가 정말 글자 4개 정도인가요?
영어 산문 기준으로 대략적인 평균값일 뿐이고 실제로는 차이가 큽니다. 흔한 영단어는 대개 1토큰으로 처리되지만, 드문 단어나 코드, 특히 비라틴 문자(중국어, 일본어, 한국어, 아랍어 등)는 글자당 훨씬 더 많은 토큰을 소비할 수 있습니다. 비용이나 한도가 걸린 작업이라면 "글자 수 ÷ 4" 어림값에 의존하지 말고 항상 정확한 토큰 수를 확인하세요.
이 도구가 토큰 수를 계산할 때 OpenAI API를 호출하나요?
아니요. 같은 토크나이저 인코딩(o200k_base, cl100k_base)을 자바스크립트로 구현한 버전을 사용하며, 모든 계산이 브라우저 안에서만 이루어집니다. API 키도 필요 없고 네트워크 요청도 발생하지 않으며, 입력한 텍스트는 어디로도 전송되지 않습니다.
토큰 수가 왜 중요한가요?
이유는 두 가지입니다. 첫째, API 요금은 토큰(입력·출력 모두) 단위로 과금됩니다. 둘째, 모든 모델은 토큰 단위로 측정되는 최대 컨텍스트 창을 가지고 있어서, 프롬프트와 예상 응답을 합친 길이가 이 한도를 넘으면 요청이 실패하거나 잘려나갑니다. 미리 토큰 수를 확인하면 이 두 가지 문제를 모두 피할 수 있습니다.
Claude나 Gemini 같은 OpenAI 이외의 모델에도 쓸 수 있나요?
여기 표시되는 토큰 수는 OpenAI 전용 토크나이저(o200k_base, cl100k_base) 기준입니다. 다른 회사들은 각자 다른 토크나이저를 쓰기 때문에 같은 텍스트라도 실질적으로 다른 토큰 수가 나올 수 있으며, 이 도구는 그런 경우까지 다루지는 않습니다.
단어당 토큰 수는 대략 얼마나 되나요?
일반적인 영어 산문 기준으로 토큰당 약 0.75단어 정도입니다. 즉 1,000단어짜리 글은 대략 1,300토큰 정도가 됩니다. 코드는 들여쓰기와 기호 때문에 보통 토큰 효율이 더 떨어지고, 비라틴 문자는 그보다 더 많이 소비합니다 — 중국어 텍스트는 글자당 1토큰 이상을 쓰는 경우가 흔합니다. API 비용을 예산으로 잡고 있다면 단어 수로 추정하지 말고 실제 텍스트를 여기서 직접 측정해 보세요.