칸칸

가이드

같은 글인데 글자 수가 다르게 나오는 이유

고친 날 · Lumen Lab

세는 기준이 달라서예요. 띄어쓰기를 넣느냐 빼느냐, 엔터 한 번을 0자, 1자, 2자 가운데 무엇으로 보느냐, 글자로 세느냐 바이트로 세느냐에 따라 같은 글이 전혀 다른 숫자가 돼요.

한 글을 일곱 가지로 세어 보면

아래 두 줄짜리 글을 이 사이트의 글자수 세기에 넣고 기준만 바꿔 가며 세었어요.

안녕하세요. 저는 지원자입니다.
잘 부탁드립니다 🙂

세는 기준결과
공백 포함, 줄바꿈 0자27자
공백 포함, 줄바꿈 1자28자
공백 포함, 줄바꿈 2자29자
공백 제외23자
UTF-8 바이트, 줄바꿈 1바이트71바이트
UTF-8 바이트, 줄바꿈 2바이트72바이트
EUC-KR 바이트, 줄바꿈 2바이트48바이트(🙂는 못 담음)

같은 글인데 23부터 72까지 나와요. 어느 숫자도 틀린 게 아니고, 묻는 것이 다를 뿐이에요.

공백: 넣느냐 빼느냐

'공백 포함'은 띄어쓰기와 줄바꿈까지 센 수이고, '공백 제외'는 글자만 센 수예요. 위 글은 띄어쓰기가 4번, 줄바꿈이 1번이라 둘의 차이가 5자예요. 글이 길어질수록 이 차이는 커져요.

줄바꿈: 0자, 1자, 2자

줄바꿈은 컴퓨터가 저장하는 방식에 따라 한 글자(LF)이기도 하고 두 글자(CR과 LF)이기도 해요. 그래서 엔터 한 번을 1자로 세는 곳과 2자로 세는 곳이 있고, 아예 세지 않는 곳도 있어요.

문단을 빈 줄로 띄어 쓰면 차이가 금방 커져요. 한 글자짜리 문단 다섯 개를 빈 줄로 띄우면 줄바꿈이 8번 들어가서, 0자 기준으로는 5자, 1자 기준으로는 13자, 2자 기준으로는 21자가 돼요.

광고

이모지와 결합 글자

👨‍👩‍👧은 눈으로 보면 한 글자지만 안쪽은 다섯 조각이에요. 사람이 보는 대로 세면 1, 조각(코드 포인트)으로 세면 5, 프로그램이 흔히 쓰는 UTF-16 단위로 세면 8이에요. 이모지가 들어간 글에서 숫자가 몇 자씩 어긋난다면 이 차이일 수 있어요. 자세한 숫자는 이모지 하나는 몇 글자일까에 있어요.

바이트로 세는 곳

글자 수가 아니라 바이트로 제한하는 곳도 있어요. 한글 한 자는 UTF-8에서 3바이트, EUC-KR에서 2바이트라서, 한글 500자는 UTF-8로 1,500바이트이고 EUC-KR로 1,000바이트예요. 어느 방식인지 모르면 숫자가 1.5배까지 달라져요. 이유는 한글은 왜 2바이트이기도 하고 3바이트이기도 할까에 적었어요.

숫자를 맞춰 보는 순서

  1. 글을 낼 곳의 안내문에 '공백 포함', '공백 제외', '바이트' 가운데 무엇이 적혀 있는지 먼저 봐요.
  2. 몇 자만 다르면 줄바꿈부터 바꿔 봐요. 차이가 줄바꿈 횟수와 같거나 그 두 배라면 줄바꿈 기준이 다른 거예요.
  3. 그래도 다르면 글에 이모지나 특수문자가 있는지 봐요.
  4. 바이트 제한이라면 한글이 2바이트인지 3바이트인지 확인해요. 한글 한 자만 넣어 보면 알 수 있어요.

내 글을 여러 기준으로 한꺼번에 세어 볼 수 있어요.

글자수 세기 열기

더 읽을 글

광고