AI가 한국어 잘한다고요? 진짜인지 직접 테스트해봤어요.
솔직히 AI 성능 비교 글은 대부분 영어를 기준으로 작성돼요. “GPT-4가 더 낫다”, “Claude가 글솜씨가 뛰어나다"는 평가도 대부분 영어 테스트 결과죠. 하지만 한국어는 사정이 완전히 달라요. 존댓말과 반말을 정확히 구분해야 하고, 조사 하나 틀리면 금방 티가 나며, 번역체만 섞여도 “아, AI가 쓴 글이구나” 바로 들키거든요.
그래서 ChatGPT(GPT-5.3)와 Claude(Sonnet 4.6)에게 똑같은 한국어 작업 5가지를 맡겨보고, 어디서 차이가 나는지 꼼꼼하게 비교해 봤어요. 영어 벤치마크 점수는 빼고, 한국어로 실제 작업을 할 때의 실전 성능만 집중적으로 살펴봤습니다.
테스트 1: 한국어 글쓰기 자연스러움
가장 먼저 같은 주제로 블로그 글을 써보라고 요청했어요. 주제는 ‘재택근무 장단점’이었고, 프롬프트에 “해요체로 자연스럽게 써줘"라고 명시했죠.
ChatGPT 결과
구성은 깔끔했어요. 서론, 본론, 결론을 딱딱 맞춰서 구성해 놓았거든요. 하지만 문장을 읽어보면 묘하게 어색한 부분이 있어요. “재택근무에 대하여 많은 분들이 고민하고 계십니다"처럼 시작하는 식이죠. “~에 대하여”, “~하고 계십니다” 같은 표현이 계속 튀어나와요.
한국인이 블로그를 이렇게 쓰진 않잖아요. 네이버 블로그나 브런치에서 “요즘 재택근무하는 분 많죠?“로 시작하는 건 commonplace하고, “재택근무에 대하여"로 시작하는 건 거의 없거든요.
Claude 결과
Claude는 분위기가 좀 달랐어요. “요즘 재택 3년 차인데요, 좋은 점만 있을 줄 알았는데 완전 착각이었어요"로 시작하더라고요. 번역체 느낌이 확실히 덜하고 문장 흐름도 매끄러웠어요. 특히 “~거든요”, “~잖아요” 같은 구어체 어미를 적절히 섞어서 읽기 편한 글이 나왔습니다.
비교 정리
| 평가 기준 | ChatGPT (GPT-5.3) | Claude (Sonnet 4.6) |
|---|---|---|
| 번역체 빈도 | 자주 나옴 (~에 대하여, ~하고 계십니다) | 거의 없음 |
| 문장 자연스러움 | 중간 (구조적이지만 딱딱) | 높음 (대화하듯 자연스러움) |
| 한국어 표현 다양성 | 보통 (비슷한 어미 반복) | 좋음 (~거든요, ~잖아요, ~네요 혼합) |
| 전체 인상 | “AI가 쓴 글 같다” | “사람이 쓴 것 같다” |
결론: 자연스러운 한국어 글쓰기는 Claude가 한 수 위예요.
테스트 2: 존댓말 & 반말 구분
한국어 AI의 관문이자 핵심이죠. 해요체, 합니다체, 반말을 정확히 구분하는지 테스트해 봤어요. 시나리오 세 가지를 준비해서 요청했어요.
- 비즈니스 이메일 → 합니다체로 써줘
- 블로그 글 → 해요체로 써줘
- 카카오톡 답장 → 반말로 써줘
ChatGPT 결과
합니다체는 잘 처리했어요. 비즈니스 이메일에서 “~드리겠습니다”, “~부탁드립니다” 같은 표현이 자연스럽게 나왔거든요. 하지만 해요체로 바꿔달라고 하면 살짝 어색해졌어요. 합니다체와 해요체가 섞이는 경우가 있었죠. “이 부분 참고하시면 좋을 것 같습니다"처럼요. 해요체라면 “참고하면 좋을 것 같아요"가 맞잖아요.
반말은 좀 부자연스러웠어요. “나는 그것이 좋다고 생각해"처럼 딱딱하게 나오는 경우가 있었는데, 실제 카카오톡에서는 이렇게 말하지 않거든요. “그거 좋은 것 같은데?” 정도가 훨씬 자연스럽죠.
Claude 결과
세 가지 존댓말 수준의 전환이 꽤 매끄러웠어요. 합니다체 이메일도 잘 쓰고, 해요체 블로그도 자연스러우며, 반말도 “ㅋㅋ 그거 완전 좋던데?“처럼 실제 카톡 대화 느낌이 났습니다. 다만 가끔 반말 문장 속에 격식 있는 표현이 섞이기도 했어요.
비교 정리
| 구분 | ChatGPT | Claude |
|---|---|---|
| 합니다체 (비즈니스) | 잘함 | 잘함 |
| 해요체 (블로그) | 합니다체 섞임 | 자연스러움 |
| 반말 (카톡) | 부자연스러움 | 비교적 자연스러움 |
결론: 존댓말 구분은 Claude가 약간 더 정확해요. 특히 해요체 유지력이 좋더라고요.
테스트 3: 한국 문화 이해도
이번에는 한국 문화의 뉘앙스와 맥락을 얼마나 잘 이해하는지 확인해 봤어요. 세 가지 질문을 던져봤습니다.
질문 1: “눈치가 빠르다"를 외국인한테 설명해줘
ChatGPT는 교과서적인 정의를 내렸어요. “눈치는 한국 사회에서 중요한 사회적 감각으로…” 같은 식이죠. 틀린 말은 아니지만, 뭔가 딱딱하고 백과사전 같은 느낌이 강했어요.
Claude는 구체적인 예시를 들어 설명했어요. “회의 중에 팀장님 표정 살짝 굳은 거 보고 바로 주제 바꾸는 사람, 있잖아요? 그게 눈치예요.“처럼 실제 한국 직장 상황을 들어 설명하니까 훨씬 이해하기 쉬웠습니다.
질문 2: 한국식 비즈니스 회식 에티켓 알려줘
둘 다 기본적인 에티켓은 잘 알고 있었어요. 상사에게 두 손으로 잔을 받는다든가, 옆으로 돌아서 마신다든가 하는 부분들이죠. 하지만 Claude는 “요즘 MZ세대는 회식 문화를 많이 바꿨다"면서 최근 트렌드까지 함께 짚어줬어요. 술을 마시지 않는 동료를 배려한다든가, 2차를 무리하게 권하지 않는 모습처럼요.
질문 3: 한국 속담 “가는 말이 고와야 오는 말이 곱다"를 상황에 맞게 써봐
ChatGPT는 속담의 뜻을 설명한 뒤 일반적인 예시를 들어줬어요. Claude는 “직장에서 후배에게 피드백을 줄 때"처럼 구체적인 상황에 속담을 자연스럽게 녹여냈습니다. 대화 흐름에 쏙 들어가는 방식이라 바로 활용하기 좋았어요.
결론: 한국 문화 이해도는 Claude가 조금 더 깊었어요. 특히 현대 한국 사회의 맥락을 잘 반영하더라고요.
테스트 4: 한국어 데이터 & 팩트
한국 관련 factual information을 얼마나 정확하게 제공하는지 테스트해 봤어요.
질문들:
- 2025년 한국 최저임금 얼마야?
- 한국 4대 보험 종류 알려줘
- 최근 부동산 대출 규제 뭐가 바뀌었어?
솔직히 말하면, 둘 다 명확한 한계가 있었어요.
ChatGPT는 최저임금(9,860원)과 4대 보험(국민연금, 건강보험, 고용보험, 산재보험)은 정확하게 맞춰줬습니다. 하지만 부동산 대출 규제 답변은 정보가 좀 섞여 나왔어요. 2024년 기준 정보가 그대로 반영된 걸 봐선 시차가 있는 듯합니다.
Claude도 비슷한 수준이었어요. 기본적인 팩트는 잘 알고 있었지만, 최신 정책 변경 사항은 정확히 반영하지 못했어요. 특히 DSR 규제 관련 세부 사항에서 오류가 있었죠.
결론: 한국 팩트 체크는 둘 다 약해요. 기본 정보는 괜찮은데, 최신 법률이나 정책은 반드시 직접 확인해야 해요. 팩트 체크용으로는 솔직히 Perplexity 쓰는 게 나아요.
테스트 5: 한국어 코딩 주석 & 기술 문서
개발자분들에게 꼭 필요한 부분이에요. 코드에 한국어 주석을 달고, 기술 문서를 한국어로 작성하는 테스트를 진행했어요.
코드 주석 비교
Python 코드를 주고 “한국어로 주석 달아줘"라고 요청했어요.
ChatGPT:
# 사용자의 입력값을 검증하는 함수입니다
def validate_input(data):
# 데이터가 비어있는지 확인합니다
if not data:
return False
Claude:
# 사용자 입력값 검증
def validate_input(data):
# 빈 데이터 체크
if not data:
return False
차이가 명확하죠? ChatGPT는 “~하는 함수입니다”, “~확인합니다"처럼 딱딱한 문어체 스타일이에요. Claude는 “입력값 검증”, “빈 데이터 체크"처럼 실제 한국 개발자들이 많이 쓰는 간결한 스타일에 더 가까워요.
한국 개발자 커뮤니티를 보면 주석을 주로 명사형으로 짧게 처리하잖아요. “유저 인증 처리”, “에러 핸들링” 같은 식으로요. Claude가 이런 실전 스타일을 훨씬 잘 따랐습니다.
기술 문서 비교
API 문서를 한국어로 작성해 달라고 했을 때도 비슷한 차이가 나타났어요. ChatGPT는 “이 엔드포인트는 사용자의 프로필 정보를 반환합니다"처럼 번역체 느낌이 남았고, Claude는 “유저 프로필 조회 API"처럼 훨씬 자연스러웠습니다.
결론: 코딩 관련 한국어 작업은 Claude가 더 자연스러워요.
총평: 작업별 추천 AI
5가지 테스트 결과를 종합해 보면 이렇습니다.
| 작업 | 추천 | 이유 |
|---|---|---|
| 블로그 글쓰기 | Claude 우세 | 번역체 적고 해요체 유지력 좋음 |
| 비즈니스 이메일 | 비슷 | 둘 다 합니다체 잘 씀 |
| 번역 (영→한) | ChatGPT 약간 우세 | GPT-5.3 다국어 처리 안정적 |
| 코딩 주석 | Claude 우세 | 한국 개발자 스타일에 가까움 |
| 한국 문화 관련 | Claude 약간 우세 | 현대 한국 맥락 이해도 높음 |
| 팩트 체크 | 둘 다 약함 | Perplexity 쓰세요 |
| 카카오톡 반말 | Claude 약간 우세 | 실제 대화체에 가까움 |
| 긴 문서 작성 | Claude 우세 | 톤 일관성, 구조화 능력 |
솔직히 말해, 완벽한 AI는 없어요. 한국어 작업이라고 특정 모델 하나만 고집할 필요도 없죠. 저는 글쓰기와 코딩은 Claude를, 번역 작업은 ChatGPT를, 팩트 체크는 Perplexity를요. 각자의 작업 성향에 맞는 AI를 골라 쓰는 게 가장 효율적인 방법이에요.
꿀팁: 한국어 결과 더 좋게 만드는 법
사용하는 AI가 무엇이든, 프롬프트를 어떻게 작성하느냐에 따라 결과 퀄리티가 완전히 달라져요. 한국어 작업할 때 꼭 기억하면 좋은 팁 4가지를 정리해 봤습니다.
1. 존댓말 수준 명시하기
그냥 “한국어로 써줘"라고 요청하면 AI가 알아서 합쇼체로 변환해 버려요. 그래서 결과가 딱딱하게 나오곤 하죠. 프롬프트에 이렇게 한 줄만 추가해 보세요.
“해요체로 써줘. 블로그 글 느낌으로 친근하게.”
이 작은 지시만 추가해도 결과가 확 달라집니다.
2. “번역체 쓰지 마"라고 명확히 지시하기
AI가 한국어를 쓸 때 가장 흔히 범하는 실수가 번역체죠. 프롬프트에 명확하게 적어두세요.
“번역체 쓰지 마. ‘~에 대하여’, ‘~하는 것이 중요합니다’ 같은 표현 쓰지 말고, 한국어 블로그에서 실제로 쓰는 자연스러운 표현 써줘.”
3. 원하는 스타일 예시 주기 (Few-shot)
기대하는 결과의 예시 1~2개를 프롬프트에 함께 넣으면 훨씬 퀄리티 높은 답을 받을 수 있어요.
“이런 스타일로 써줘: ‘요즘 재택근무하는 분 많죠? 저도 3년째인데, 처음엔 좋기만 했거든요. 근데 1년 지나니까 슬슬 현실이 보이더라고요.’”
4. 전문 프롬프트 활용하기
매번 이렇게 지시문을 작성하기가 귀찮잖아요. FindSkill에서 무료로 제공하는 한국어 최적화 프롬프트를 활용하면 훨씬 수월해요.
- 고임팩트 카피라이팅 스킬 — 한국어 카피라이팅에 딱 맞아요. 번역체 없이 임팩트 있는 문장을 빠르게 만들어줘요.
- 비즈니스 이메일 작성기 — 합니다체 비즈니스 이메일이 필요할 때 활용하세요. 한국 비즈니스 문화를 반영한 프롬프트예요.
- SEO 콘텐츠 옵티마이저 — 블로그 글 작성은 물론 SEO 최적화까지 한 번에 해결해줘요.
전문 프롬프트를 복사해서 붙여넣기만 해도 AI 결과 퀄리티가 확 올라가요. FindSkill 홈페이지에서 더 많은 무료 스킬을 둘러보세요.
마무리
한국어 AI 비교를 해 보니 생각보다 차이가 크죠?
핵심만 정리하면 이렇습니다. 자연스러운 한국어 글쓰기가 중요하면 Claude, 번역이나 다국어 작업이 많으면 ChatGPT, 팩트 체크는 Perplexity가 각각 제격이에요. 특정 AI에 올인하기보다, 작업 성향에 맞춰 알맞은 모델을 고르는 게 2026년을 살아가는 현명한 방법입니다.
그리고 어떤 AI를 쓰든 결국 프롬프트가 핵심이에요. “한국어로 써줘"만 입력하면 둘 다 어색한 결과가 나오고, 명확하게 지시하면 둘 다 충분히 쓸 만해요. 위에 정리한 팁을 참고해 프롬프트 퀄리티를 한 단계 높여 보세요.
혹시 직접 테스트해 보신 경험이 있으신가요? “나는 ChatGPT가 더 낫던데?” 혹은 “Claude가 진짜 한국어가 잘하더라” — 솔직한 의견은 댓글로 남겨주세요. 한국어 AI 비교 시리즈는 꾸준히 업데이트할 예정입니다.