바이트 계산기
한글 3바이트(UTF-8)와 2바이트(EUC-KR)를 나란히 세요.
글은 이 기기 밖으로 나가지 않아요
쓰임에 맞춰 세기
바이트는 이렇게 세요
- UTF-8
- 영문과 숫자는 1바이트, 한글과 한자는 3바이트예요. 이모지는 조각마다 3~4바이트라서 😀는 4바이트, 👨👩👧는 18바이트예요.
- EUC-KR
- 영문과 숫자는 1바이트, 한글과 한자는 2바이트예요. 윈도우의 확장 완성형(CP949) 표를 기준으로 해서 한글 11,172자를 모두 2바이트로 세요.
- 못 담는 글자
- 이모지처럼 EUC-KR 표에 없는 글자는 바이트에 넣지 않고, 몇 개인지와 어떤 글자인지 알려 줘요.
- UTF-16
- 대부분의 글자는 2바이트, 이모지 같은 보충 글자는 4바이트예요. 맨 앞의 BOM은 세지 않아요.
- 줄바꿈
- 0, 1, 2 가운데 골라요. 엔터를 2바이트(CR+LF)로 세는 곳에 맞출 때는 2로 바꿔요. UTF-16에서는 그 두 배예요.
광고
자주 묻는 질문
한글은 왜 어디서는 2바이트이고 어디서는 3바이트인가요?
글자를 숫자로 적는 방식(인코딩)이 달라서예요. EUC-KR은 한글 한 자를 2바이트로, UTF-8은 3바이트로 적어요. 바이트로 제한하는 곳은 어느 방식이냐에 따라 쓸 수 있는 글자 수가 달라져요.
이모지는 몇 바이트인가요?
UTF-8로 😀는 4바이트, 👍🏽는 8바이트, 👨👩👧는 18바이트예요. EUC-KR에는 이모지가 없어서 바이트로 셀 수 없고, 이 계산기는 그런 글자를 따로 알려 줘요.
띄어쓰기와 줄바꿈은 몇 바이트인가요?
띄어쓰기는 UTF-8과 EUC-KR 모두 1바이트예요. 줄바꿈은 1바이트(LF)로 세는 곳과 2바이트(CR+LF)로 세는 곳이 있어서 고를 수 있게 했어요.
더 읽을 글
- 같은 글인데 글자 수가 다르게 나오는 이유같은 글을 넣어도 도구마다 글자 수가 다른 건 공백, 줄바꿈, 이모지, 바이트를 세는 기준이 달라서예요. 한 글을 일곱 가지 기준으로 세어 본 표로 확인해요.
- 이모지 하나는 몇 글자일까👨👩👧 하나가 세는 방식에 따라 1, 5, 8, 18이 되는 이유를 조각으로 뜯어 보고, 자주 쓰는 이모지와 한글 자모를 네 가지 방식으로 센 표를 실었어요.
- 한글은 왜 2바이트이기도 하고 3바이트이기도 할까한글 한 자는 EUC-KR에서 2바이트, UTF-8에서 3바이트예요. 인코딩마다 글자별 바이트 수를 표로 비교하고, 바이트 제한을 글자 수로 바꾸는 법을 적었어요.
광고