짧게 결론부터 말씀드릴게요. 아마도 이 글을 찾아보신 이유도 바로 이 질문일 테니까요. 대부분의 경우, 특정 텍스트가 AI로 작성된 것인지 확실히 알 수 있는 방법은 없습니다. 게다가 AI 탐지 도구라 불리는 것들은 자주 오류를 내며, 오히려 정직하게 글을 쓴 사람의 삶을 불편하게 만들기도 합니다. ‘92% AI’라는 수치는 절대적인 증거가 될 수 없습니다. 이는 기계가 내린 추정에 불과하며, 특히 영어나 한국어가 모국어가 아닌 사람이 글을 쓸 때 오히려 더 강하게 거짓 경고를 띄웁니다.
한국은 시험과 입학 경쟁 문화가 깊게 자리 잡은 곳이다 보니, AI 탐지 도구가 대학 캠퍼스로 빠르게 퍼지고 있는 실정입니다. 전 세계적으로 동일한 시나리오가 반복됩니다. 자신이 직접 쓴 과제나 작품을 부정행위로 지목당하는 학생들. 그렇다면 실제로 어떻게 확인해야 할지, 도구들은 정말로 무엇을 하는지, 그리고 만약 도구에서 내게 잘못 찍혔다면 어떻게 대응해야 하는지 정리해 드립니다.
30초 만에 확인하는 팁
확실한 정답을 얻기는 어렵습니다. 하지만 합리적인 추측은 세울 수 있죠.
- 도구에 한 번 돌려보세요. 다만 나온 수치는 ‘결정’이 아닌 ‘단서’로만 여기세요. 퍼센트 수치는 극단적이면서도 문서 전체에서 일관되게 나올 때만 의미가 있습니다. 전체 분량에서 “97% AI”가 나온다면 조사가 필요하지만, “40% AI”는 사실상 무의미합니다.
- 소리 내어 읽어보세요. AI 글은 매끄럽고 균형 잡혀 있으며, 약간은 공허합니다. 문단 길이가 일정하고, 모든 주장이 정중하게 양쪽을 다 감싸며, 날카로운 의견이나 거친 흔적이 없습니다. 반면 인간의 글은 리듬이 있죠. 길고 짧은 문장이 교차하고, 나만의 독특한 표현이 한두 번 튀어나옵니다.
- 구체성이 빠져 있는 곳을 찾아보세요. 이것이 가장 확실한 신호입니다. AI는 “다양하고 맛있는 식당 옵션을 제공합니다” 같은 표현은 잘 쓰지만, “카운터 옆 아저씨가 마지막 빵을 팔아주지 않았습니다” 같은 구체적인 상황은 잘 표현하지 못합니다. 기대되는 디테일 대신 모호함이 느껴진다면, 그건 강력한 단서입니다.
- 거기서 멈추고 유보적으로 생각하세요. 이제 얻은 건 ‘추측’이지 ‘사실’이 아닙니다. 성적, 취업, 혹은 부정행위 지목처럼 실제 스테이크스가 걸린 상황에서는 추측이 대화가 시작되는 지점이어야 하지, 결론이 되어서는 안 됩니다.
리스트에 포함되지 말아야 할 것 하나: “도구 수치를 맹신하지 마세요.” 그 이유를 알아봅시다.
AI 탐지 도구가 오류를 내는 이유
탐지 도구가 완전히 쓸모없는 건 아닙니다. 다만, 과대광고가 문제일 뿐이죠. 이들은 확률 기반 분류기일 뿐, 거짓말 탐지기도, 어떤 증명 표준에 맞춰 보정된 것도 아닙니다. 실제 환경에서 도구를 무력하게 만드는 요인이 세 가지 있습니다.
첫 번째, 텍스트가 조금만 수정되어도 성능이 급감합니다. 손대지 않은 순수 AI 출력물에는 상위 도구들이 꽤 잘 작동하죠. 하지만 인간이 한 줄만 고치거나 ‘휴마나이저(Humanizer)’를 거치면 정확도가 폭락합니다. 2,000개의 샘플을 분석한 한 연구에서 Turnitin은 순수 AI 글은 98%나 잡아냈으나, 가볍게 수정된 AI 글은 단 12%만 적발했습니다. 아무도 수정하지 않은 원본 그대로를 제출하지 않는다는 점을 고려하면, 실제로 중요한 수치는 바로 그 낮은 12%입니다.
두 번째, 진짜 인간을 잘못 지목한다는 점입니다. 독립적인 벤치마크에 따르면, 깔끔한 시험 지문에서는 거짓 양성률이 몇 퍼센트대에 머물지만, 실제 교실 환경에서는 훨씬 높아집니다. 밴더빌트대와 노스웨스턴대를 포함한 여러 주요 대학은 무고한 학생들을 부당하게 적발한다는 이유로 Turnitin의 AI 탐지 기능을 폐기했습니다. 이는 버그가 아니라, 해당 도구가 작동하는 방식의 본질적인 한계입니다.
세 번째, 비영어권 화자에게 불리하게 작용한다는 편향성입니다. 이 부분은 점수를 증거로 삼는 것을 즉시 멈춰야 하는 대목입니다. 스탠퍼드 대학의 연구에 따르면, 영어가 모국어가 아닌 학생의 에세이 중 61% 이상이 AI 글로 잘못 분류되었습니다. 이러한 도구가 포착하는 특징인 ‘깔끔하고 단순하며 구조화된 문장’은, 신중하게 언어를 학습한 제2언어 화자가 정확히 만들어내는 스타일입니다. 도구는 AI를 찾는 게 아니라, ‘캐주얼한 모국어 화자처럼 쓰지 않는 글’을 찾아내서 부정행위로 오인하는 것입니다.
이것이 당신에게 의미하는 바
만약 부정확하게 적발된 학생이라면: 도구는 증거가 아니며, 그렇게 주장해도 됩니다. 자신의 작성 과정을 꼼꼼히 보관하세요. 구글 독스나 워드의 수정 이력, 초안, 노트, 자료 조사 기록이 바로 인간이 직접 썼다는 증거이며, 어떤 AI 수치가 낱개보다 훨씬 신뢰할 만합니다. 만약 지목이 들어왔다면 차분하게 해당 지목의 근거가 무엇인지 물어보세요. 근거가 오직 도구 점수뿐이라면, 해당 기능을 폐기했던 대학 사례와 비모어 화자 편향 연구 결과를 제시하며, 초안 이력에 대한 인간 검토를 요청하세요.
교사이거나 편집자라면: 도구를 더 깊이 살펴봐야 할 ‘계기’로만 사용하세요. 결정적인 ‘판결’로 삼아서는 안 됩니다. 경보가 켜졌다는 건 “이 글을 주의 깊게 읽어봐야 한다”는 뜻이지, “처벌해야 한다”는 뜻이 아닙니다. 방어적인 조치는 글에 대한 대화입니다. 작성자에게 자신의 주장을 설명하게 하고, 초안을 함께 살펴보되, 검증할 수 없는 수치에 기반한 추궁은 피하세요.
채용 담당자나 독자라면: 기대치를 낮추세요. AI 글의 공허함을 감으로 파악할 순 있지만, 그것을 증명하거나 수치화하는 건 불가능합니다. 남의 작업에 대한 추측만으로 행동을 옮기면, 공정성을 잃는 지름길입니다. 글의 품질과 진실성으로 평가하세요.
글을 쓰는 당신이라면: 추측으로 적발될까 봐 걱정된다면, 초안과 수정 이력을 보관하는 습관을 들이세요. 이것이 질문을 해결해 주는 유일한 방법입니다. 또한, “AI처럼 들리지 않게” 하려고 글에서 개성이나 맛을 빼지 마세요. 구체적인 디테일과 당신의 목소리가 가장 인간적인 부분입니다.
이것만으로는 해결되지 않는 것들
- 도구가 확실한 답을 주지 않습니다. 만약 어떤 판매자, 교수, 관리자가 “이 도구는 절대적이다”라고 말한다면, 그들은 틀린 것이며, 그에 대한 연구 결과가 존재한다는 사실을 아셔야 합니다.
- 수동으로 찾는 특징들도 점점 힘을 잃고 있습니다. 강조용 쌍대시(—), 특정 즐겨 쓰는 단어, 3개 원칙(rule of three) 같은 것들은 작년에 유행하던 AI 감지 포인트였습니다. 인간들도 그런 식으로 쓰곤 하고, AI도 이제 그 패턴을 피하도록 학습 중입니다. 쉼표 하나 때문에 사람을 지목하지 마세요.
- 이는 무한한 무장 경쟁입니다. 탐지 기술이 발전할수록 생성 모델과 휴마나이저 도구도 그만큼 정교해집니다. 미래에도 변함없이 통할 “AI 테스트”라는 건 존재하지 않습니다.
- 과정(Process)만이 진짜 해법입니다. 누가 썼는지 오래가게 확인하는 방법은 완성된 텍스트를 스캔하는 게 아니라, 어떻게 만들어졌는지 살펴보는 것입니다. 초안, 수정 이력, 그리고 작업을 둘러싼 대화가 바로 그 답입니다.
결론
“이 글이 AI로 작성된 걸까?”라는 질문은 깔끔한 예/아니오로 답할 수 있을 것 같지만, 현실은 그렇지 않습니다. 30초 만에 합리적인 추측은 세울 수 있습니다. 도구를 돌려보고 그 수치를 의심하며, 글의 공허함을 읽고, 빠진 구체성을 찾아보는 거죠. 하지만 그건 단지 추측일 뿐입니다. 더 많은 것을 약속하는 도구들은 오히려 진실을 말하는 사람, 특히 신중한 이들과 비모어 화자들에게 큰 상처를 줍니다. 실제 위험이 따르는 상황에서는 더 정교한 스캔이 답이 아닙니다. 답은 초안 이력과, 작업을 둘러싼 인간적인 대화에 있습니다.
이런 도구들이 실제로 어떻게 판단하는지, 그리고 평범하고 딱딱한 글로 변하지 않으면서도 AI를 업무에 활용하는 법이 궁금하다면? 먼저 ChatGPT 업무활용을 시작해 보세요. 그다음 콘텐츠 제작과 프롬프트 엔지니어링으로, 내 목소리를 가장 앞세우면서 AI와 함께 글을 쓰는 방법을 익히시길 권합니다.
출처