블로그로 돌아가기

중국어 한자, 정말 몇 개를 알아야 할까요?

글 Andreu Puy · 2026년 10월 1일 · 읽는 데 10분

이 질문을 어디서 하든 같은 답이 돌아와요. 2,000자에서 3,000자요. 이 숫자가 계속 반복되는 건, 한 가지에 대해서는 대체로 맞고 다른 한 가지에 대해서는 조용히 틀리기 때문이에요. 거의 완전한 한자 커버리지, 즉 페이지의 거의 모든 한자가 한 번쯤 본 한자가 되는 지점에 드는 비용에는 가까워요. 하지만 대부분이 실제로 묻는 질문, 그러니까 중국어가 조금이라도 읽히기 시작하려면 몇 자가 필요하냐는 질문에는 형편없는 답이에요.

숫자 하나로는 답할 수 없어요. 한자의 빈도는 엄청나게 한쪽으로 쏠려 있거든요. 그래서 전해 내려오는 이야기를 되풀이하는 대신 직접 세어 봤어요. 아래는 구어와 문어를 아우르는 실제 중국어 330억 자로 만든 커버리지 곡선이에요. 가장 흔한 한자 100자, 500자, 1,000자, 3,000자가 평범한 페이지의 얼마를 실제로 차지하는지 보여 줘요.

짧게 정리하면

이 숫자의 출처: 저희는 중국어 사전이자 학습 앱인 Hanzio를 만들고 있어서, 어차피 중국어 전체의 빈도 데이터를 갖고 있어요. 아래 숫자는 발표된 추정치가 아니라 그 데이터, 즉 Hanzio의 사용 빈도 점수를 만드는 바로 그 데이터에서 나왔어요. 전체 방법은 어떻게 셌는지에 있고, 이 숫자가 여러분에게는 틀릴 수 있는 부분도 함께 적었어요.

한자는 몇 자가 필요할까요?

한자 약 1,000자면 일상적인 중국어 글에 나오는 한자의 약 90%를 차지해요. 500자면 약 75%예요. 98%에 도달하려면 약 2,300자, 99%에는 약 2,900자가 들어요. 앞으로 읽게 될 모든 글의 절반은 단 170자가 떠받치고 있어요.

아는 한자 수실제 글에서 차지하는 비율100자당 모르는 한자
10040%60
25059%41
50075%25
1,00089%11
1,50094%6
2,00097%3
2,50098%2
3,00099%1

가운데 열보다 마지막 열을 먼저 읽어 보세요. 같은 정보인데, 기분 좋게 받아들이기는 훨씬 어려워요.

이 숫자가 뜻하지 않는 것

커버리지 비율은 유혹적이고, 중국어 앱을 파는 사람들을 포함해 늘 과장돼요. 흥미로운 부분으로 가기 전에 두 가지를 짚어야 해요.

커버리지는 이해가 아니에요

1,000자를 알면 페이지에 나오는 한자의 약 89%를 알아요. 뜻의 89%가 아니에요. 100자마다 모르는 한자가 11개, 대략 한 줄에 하나꼴이고, 고르게 흩어져 있지도 않아요. 정보를 담은 바로 그 자리에 몰려 있어요. 이름, 전문 용어, 문장이 걸려 있는 바로 그 동사요.

2,000자가 드는 97%도 100자당 모르는 한자가 세 개예요. 소설 한 페이지에는 한자가 몇백 자 들어 있으니, 페이지마다 구멍이 몇 개씩이에요. 사전을 끼고 하는 읽기로는 할 만해요. 편한 읽기는 아니에요. 네 자리 수의 한자만 알면 중국어가 읽힌다고 말하는 사람은 진짜 곡선을 반올림해서 구호로 만든 거예요.

(제2언어 읽기 연구에는 도움 없이 이해하려면 약 98%의 커버리지가 필요하다는 잘 알려진 결과가 있어요. 알아 둘 만하지만, 이건 한자가 아니라 단어 커버리지에 관한 것이라 위의 표에 그대로 옮길 수는 없어요. 증거가 아니라 비유로 언급하는 거예요.)

한자를 아는 것과 단어를 아는 건 달라요

중국어 단어는 대부분 한자 두 개 이상으로 이루어지고, 그 조합은 부분만 보고 예측하기 어려운 경우가 많아요. 意와 思는 둘 다 흔하고 각각은 평범하지만, 意思는 ‘뜻, 의미’예요. 电은 전기, 脑는 뇌인데, 电脑는 컴퓨터예요. 한자음으로 ‘전뇌’라고 읽을 수는 있어도, 한국어에서 컴퓨터를 그렇게 부르지는 않아요. 문장의 모든 한자를 알아도 그 문장은 모를 수 있어요.

그러니 한자는 먼저 공략하기 좋은 단위이지, 어휘를 대신하지는 않아요. 다만 처음에는 하나당 효율이 훨씬 높아요. 같은 89% 커버리지에 단어로 도달하려면 약 11,800개가 필요해요. (두 숫자는 단위가 달라요. 한자 토큰의 89%와 단어 토큰의 89%예요. 그러니 ‘약 12배’는 정확한 비율이 아니라 차이의 모양으로 보세요.)

커버리지 곡선

전체 곡선이에요. 가로축은 가장 흔한 것부터 센 아는 한자의 수이고, 세로축은 그 한자들이 평범한 페이지에 나오는 한자 중 차지하는 비율이에요. 이해가 아니라 커버리지예요. 위를 참고하세요.

가장 흔한 한자가 실제 글에서 차지하는 비율

곡선은 처음에 아주 가파르게 올라가서 약 500자에서 75%를, 약 1,090자에서 90%를 지난 뒤 평평해져요. 2,000자를 넘으면 거의 수평이 되고, 100%에는 끝내 닿지 않아요. 정확한 숫자는 위의 표에 있어요.
음영 부분은 처음 1,000자예요. 출처: Hanzio 빈도 데이터, 한자 330억 자. hanzio.app

중요한 특징은 두 가지예요. 곡선은 왼쪽 끝에서 거의 수직이고, 오른쪽에서는 거의 수평이에요. 중국어 한자 학습에 대해 쓸모 있는 거의 모든 것이 이 두 사실에서 나와요.

처음 500자가 대부분의 일을 해요

처음 3,000자를 500자씩 나누고, 각 묶음이 무엇을 주는지 물어보세요.

500자 묶음마다 더해지는 실제 글의 비율 (퍼센트포인트)
1~500 +74.6
501~1,000 +14.1
1,001~1,500 +5.6
1,501~2,000 +2.7
2,001~2,500 +1.4
2,501~3,000 +0.7

첫 번째 묶음은 나머지 다섯 개를 다 합친 것보다 몇 배나 더 값져요. 그리고 그 안에서도 더 몰려 있어요. 가장 흔한 한자 서른 개만으로 실제 글 전체의 약 23%를 차지해요. 서른 개요. 바로 이것들이에요:

的我是了不在你有一人这个们大来他要上中为到会和好就国么以时生

이 목록에 놀라운 건 하나도 없어요. 대부분 문법, 대명사, 모든 문장에 필요한 몇 안 되는 동사인데, 바로 그게 요점이에요. 중국어에서 가장 무거운 짐을 지는 한자는 구조적이고 피할 수 없는 것들이라, 누가 계획하든 말든 첫날부터 만나게 돼요.

마지막 천 자로 얻는 건 거의 없어요

이제 같은 표를 아래에서부터 읽어 보세요. 2,001번째부터 3,000번째까지의 한자, 즉 대부분의 학습자에게 1년 넘게 꾸준히 공부해야 하는 천 자가 다 합쳐서 약 2퍼센트포인트를 더해요. 위의 서른 자는 그 열 배가 넘는 값어치가 있어요.

그렇다고 2,000자에서 멈추라는 말은 아니에요. 그 마지막 한자들이 한두 줄마다 사전을 찾던 상태에서 문단에 한 번 찾는 상태로 데려가 줘요. 97%와 99%의 차이는 100자당 모르는 한자 세 개와 한 개의 차이예요. 끊김이 줄어드는 거지, 없어지는 건 아니에요. 그 한자들이 만드는 어휘는 별개의 일이고, 페이지를 실제로 이해하느냐를 결정하는 건 그쪽이에요.

이건 순서에 관한, 그리고 무엇을 기대할지에 관한 이야기예요. 초반 구간은 성과가 빨리 나와서 실력이 극적으로 느는 것처럼 느껴져요. 후반 구간은 그렇지 않고, 학습자들은 그 둔화를 분포의 모양이 아니라 자기 실패로 읽곤 해요. 그건 분포의 모양이에요.

무엇을 읽느냐에 따라 조금 달라요

위의 곡선은 여러 문체를 섞은 것이라, 특정한 독자가 아니라 일반적인 독자를 설명해요. 문체별로 나누면 숫자가 달라지지만, 생각보다 덜 달라지고, 늘 예상하는 방향으로 움직이지도 않아요.

대화체가 단연 쉬워요. 90% 커버리지에 약 810자에서 도달하는데, 섞은 곡선은 1,090자예요. 그 격차는 99%에 이르면 약 540자로 벌어져요. 구어가 단순히 표본이 작아서 그런 것도 아니에요. 대부분의 문어 자료보다 더 많은 종류의 한자를 쓰면서도, 글의 더 많은 부분을 가장 흔한 몇백 자에 몰아넣어요. 말하는 사람의 어휘가 적은 게 아니라, 어휘의 맨 위쪽에 훨씬 더 기대는 거예요. 문어 자료도 서로 다르지만 그 폭은 더 좁아요. 90% 커버리지에서 가장 쉬운 것과 가장 어려운 것의 차이가 대략 150~200자이고, 정형화된 글일수록 곡선이 일찍 도달해요.

그 효과의 크기는 위 숫자에서 위아래로 몇백 자 정도예요. 1,000자를 3,000자로 바꿔 놓지는 않아요. 산문을 많이 읽는다면 곡선이 조금 뒤처질 거라고 예상하고, 대화 위주라면 조금 앞설 거예요.

‘2,000~3,000자’는 어디서 왔을까요

전해 내려오는 이 숫자는 지어낸 것도 아니고, 사실 틀린 것도 아니에요. 다른 질문에 대한 답일 뿐이에요.

중국의 통용규범한자표는 1급에 3,500자를 싣고 일상생활의 필요를 충족한다고 설명하며, 전체는 8,105자예요. 교육받은 성인 원어민은 보통 6,000자 안팎으로 추정돼요. 이건 목록의 크기예요. 표준에 담긴 한자의 수, 또는 한 사람이 평생 쌓은 한자의 수요.

실제 글의 커버리지는 다른 척도이고, 그 척도로 보면 2,000~3,000자는 97~99% 구간에 떨어져요. 그러니 이 숫자는 거의 완전한 한자 커버리지에 드는 비용을 조용히 설명하고 있는 거예요. 그런데 초보자에게는 입장료처럼 인용되고, 잘못된 건 그것뿐이에요. 가치의 대부분이 여정의 첫 5분의 1에서 온다는 걸 아무도 말해 주지 않아요.

무엇을 공부할지에 주는 의미

세 가지가 따라 나오고, 어느 것도 복잡하지 않아요.

처음 천 자는 교과서 순서보다 빈도 순서가 나아요. 곡선이 가파른 동안에는 잘 정리된 목록과 엉망인 목록의 차이가 어마어마해요. 몇백 자 분량의 헛수고예요. 1,500자를 넘으면 곡선이 충분히 평평해져서 순서는 별로 중요하지 않게 되고, 그때부터는 무엇을 읽느냐가 무엇을 배울지를 이끌어야 해요.

한국어 화자에게는 여기에 하나가 더해져요. 학교에서 한문 교육용 기초 한자 1,800자를 배웠다면 이 목록의 꽤 많은 한자를 이미 본 적이 있을 거예요. 하지만 그 1,800자는 중국어 빈도가 아니라 한국어 한자어를 기준으로 고른 것이고, 모양은 번체자, 읽는 법은 한국 한자음이에요. 이미 아는 한자라도 간체자 모양과 중국어 발음은 다시 익혀야 하고, 这, 们, 么처럼 중국어 문장을 떠받치는 글자들은 한국어 한자어에서는 거의 볼 일이 없어요. 그러니 학교에서 배운 순서가 아니라 중국어 빈도로 순서를 다시 짜는 게 좋아요.

한자는 목록이 아니라 단어 안에서 배우세요. 한자가 효율적이라는 주장은 사실이지만, 따로 떼어 배운 한자는 뜻풀이가 붙은 모양일 뿐이에요. 电脑나 意思 안에서 배우면, 실제로 필요했던 것, 즉 쓸 수 있는 단어가 함께 따라와요.

정체기를 예상하고, 거기 닿으면 전략을 바꾸세요. 반복 훈련은 가파른 구간에서는 아주 효율적이고 평평한 구간에서는 아주 비효율적이에요. 1,500자에서 2,000자 사이 어딘가에서, 조금 어려운 글을 많이 읽는 게 플래시카드를 아무리 성실하게 하는 것보다 나아지기 시작해요. 남은 한자들은 충분히 드물어서, 문맥 속에서 만나야만 제대로 익혀지거든요.

어떻게 셌는지

이 페이지의 숫자는 Hanzio의 자체 빈도 데이터에서 나왔어요. 구어와 문어를 모두 아우르는 대규모 중국어 말뭉치로 자체 구축한 독점 데이터이고, 어느 한 문체가 지배하지 않도록 가중치를 뒀어요.

모두 합쳐 한자 330억 자, 서로 다른 한자 19,361자예요. 각 말뭉치는 따로 세고 가중치를 적용하기 전에 자기 전체 수로 정규화해서, 큰 말뭉치가 작은 말뭉치를 묻어 버리지 못하게 했어요. 한자는 여러 글자로 된 단어 안에 있는 것까지 포함해 실제 글에 나오는 그대로 셌어요. 그래서 합계는 단어 수가 아니라 한자 수예요. 이 페이지의 모든 퍼센트는 사전에서 차지하는 비율이 아니라, 한자 토큰, 즉 실제로 만나는 한자에서 차지하는 비율이에요.

분명히 밝혀 둘 한계가 세 가지 있어요. 간체자만 다뤄요. 번체자는 재지 않았으니, 이 숫자를 번체자에 인용하면 안 돼요. 섞은 곡선은 모델이지, 여러분의 읽기를 잰 게 아니에요. 구어와 문어에 그 비율대로 주의를 나누는 독자를 설명하는데, 정확히 그렇게 읽는 사람은 없어요. 말뭉치에서 가장 드문 항목은 빠져 있어요. 그래서 커버리지 숫자가 아주 조금 올라가요. 효과는 작지만 비관적인 쪽이 아니라 낙관적인 쪽으로 기울어 있고, 어느 쪽으로 기우는지는 알아 두셔야 해요.

Hanzio는 모든 사전 항목에 사용 빈도 숫자를 보여 줘요. 홀로 쓰이는 단어로서, 더 긴 단어 안의 한자로서, 그리고 다른 한자의 구성 요소로서요. 이건 여기서 쓴 순위가 아니라 0~100 점수이고, 이 페이지가 합친 단어로서의 쓰임과 한자로서의 쓰임을 따로 나눠요. 그래서 여기서 쓴 순위와 똑같지는 않고, 대체로 비슷하게 움직여요. 不는 이 페이지의 곡선에서는 다섯 번째지만, 한자로서의 쓰임에서는 첫 번째이고, 홀로 쓰이는 단어로서는 그 묶음에서 마지막이에요. 같은 데이터, 다른 질문이에요.

자주 묻는 질문

한자 2,000자면 중국 신문을 읽을 수 있나요?

2,000자를 알면 실제 글에 나오는 한자의 약 97%를 아는 셈이에요. 거의 다 된 것처럼 들리지만, 34자에 하나꼴로 모르는 한자가 나온다는 뜻이고, 문단마다 몇 개씩이에요. 사전을 옆에 두면 뉴스 기사를 따라갈 수 있고 문맥으로 꽤 많이 짐작할 수 있어요. 하지만 막힘 없이 편하게 읽으려면 한자만으로는 부족하고, 그 한자들이 만드는 어휘가 필요해요. 3,000자는 일의 전부가 아니라 한자 쪽 절반으로 보세요.

일상적인 중국어의 90%를 보려면 한자가 몇 개 필요한가요?

약 1,090자예요. 곡선은 처음엔 가파르고 끝으로 갈수록 평평해요. 500자로 이미 실제 글의 75%를, 1,000자로 89%를 차지하지만, 그다음 500자마다 더해지는 양은 앞의 500자보다 적어요. 90%에서 95%로 가는 데 대략 500자가 더 들어요.

중국어 단어는 몇 개나 알아야 하나요?

한자보다 훨씬 많이요. 한자 1,000자가 주는 것과 같은 89% 커버리지에 단어로 도달하려면 약 11,800개가 필요해요. 한자를 일찍 배우는 게 실용적인 이유가 이거예요. 더 작고 더 많이 재사용되는 단위니까요. 하지만 단어 대신 한자만 배우라는 뜻은 아니에요. 한자 두 개를 안다고 그 조합의 뜻까지 알게 되지는 않아요.

원어민은 한자를 몇 개나 아나요?

교육받은 성인 원어민은 보통 6,000자 안팎으로 추정되고, 중국의 학교 교육은 대략 3,500자를 목표로 해요. 국가 표준 한자표 전체는 8,105자예요. 이건 표준에 담긴 한자의 수를 센 목록이고, 한자 몇 개가 실제 글의 얼마를 차지하느냐와는 다른 질문이에요.

이 숫자는 번체자에도 해당하나요?

아니요. 여기 나온 건 모두 간체자로 센 것이라, 중국 본토 자료를 설명하는 숫자예요. 처음엔 아주 가파르고 끝은 아주 평평한 곡선의 모양은 번체자에서도 마찬가지지만, 번체자 숫자는 재지 않았기 때문에 인용하지 않을게요.

어떤 한자부터 배워야 하나요?

가장 흔한 한자부터요. 그리고 순서는 나중보다 처음에 훨씬 중요해요. 가장 흔한 한자 서른 개만으로 읽는 글 전체의 약 23%를 차지해요. 빈도순으로 정리된 목록이라면 어떤 것이든 괜찮아요. Hanzio는 모든 사전 항목에 사용 빈도 점수를 보여 줘서, 공부하기 전에 그 한자가 얼마나 흔한지 볼 수 있어요.

이 숫자에 이름이나 드문 한자도 포함되나요?

대부분은요. 숫자는 가공하지 않은 글로 만든 저희 자체 빈도 목록에서 나왔기 때문에, 사람 이름, 지명, 브랜드 이름이 모두 들어 있어요. 일부러 그렇게 했어요. 실제로 페이지에서 만나는 것의 일부니까요. 다만 목록에서 가장 드문 항목은 빠져 있어서, 실제 꼬리는 이 숫자보다 조금 더 길어요. 커버리지의 마지막 1%는 한 번쯤 만날 수천 개의 한자에 흩어져 있고, 저희가 센 것보다 조금 더 많아요.

한자를 손으로 쓸 줄 알아야 하나요?

읽기만 할 거라면 아니에요. 한자를 알아보는 것과 기억에서 꺼내 쓰는 건 다른 능력이고, 이 페이지의 모든 숫자는 알아보는 것에 관한 거예요. 손으로 써 보면 비슷하게 생긴 한자를 구별하는 데 도움이 되는 학습자가 많고, 대부분 그렇게 해서야 未와 末가 같은 모양이 아니라는 걸 알아채지만, 그건 별개의 목표예요.

남는 게 많은 순서대로 배우세요

곡선이 알려 주는 건 흔한 한자부터 배우라는 거예요. Hanzio는 모든 사전 항목에 0~100 사용 빈도 점수를 붙여서, 단어를 찾을 때 지금 시간을 들일 만큼 흔한지, 나중으로 미뤄도 되는지 한눈에 볼 수 있어요. 사전은 무료예요.