← 전체 글

AI 모델은 왜 환각을 일으키는가 — 그리고 실제 출처에 그라운딩하면 해결될까?

두 개의 패널: 점선이 허공으로 이어지는 접지되지 않은 주장과 펼쳐진 책으로 이어지는 접지된 주장. 캡션: 그라운딩은 주장을 옳게 만드는 것이 아니라, 검증 가능하게 만든다.

짧은 답변: 아닙니다. 그라운딩은 환각을 완전히 해결하지 못합니다. 다만 환각을 상당히 줄여 주며 오류의 종류를 바꿉니다. 없는 출처를 지어내는 대신 실제 출처를 잘못 읽는 방식으로요. 남은 것은 검증할 수 있으며, 중요한 것은 바로 이 지점입니다. 검색 자체만으로는 모델이 추측하려는 유인을 없애지 못합니다.

우리는 성경 본문, 형태론 정보, 사전 항목을 AI에 도구 결과로 전달하는 연구용 엔진을 만듭니다. 따라서 그라운딩이 환각을 해결한다는 주장에 당연히 깊은 관심을 두고 있습니다. 이 글은 그 주장의 솔직한 이면과, 이에 반하는 연구 결과까지 함께 다룹니다.

무엇을 환각이라고 보는가?

환각(hallucination) 이란 사실과 똑같은 자신감으로 진술되는 그럴듯한 거짓말입니다. 조작된 인용문, 존재하지 않는 구절, 부여된 적 없는 스트롱스 코드 같은 것들입니다. 이는 일반적인 의미의 버그가 아닙니다. 모델은 단어 철자를 틀리거나 횡설수설하는 경우가 드뭅니다. 대신 구체적이고 정연하지만 틀린 사실을 만들어 냅니다. 그 구체성이 바로 결정적 단서이며, 이러한 동작이 어디서 기인하는지 보여줍니다.

모델은 왜 그런 행동을 하는가?

지금까지 발표된 가장 유용한 답변은 환각이 미지의 신비가 아니라 유인(incentive) 의 문제라는 것입니다. OpenAI의 Kalai, Nachum, Vempala, Zhang은 2026년 Nature에 게재된 Why Language Models Hallucinate 논문에서 이를 명확히 밝혔습니다. 업계 전체가 최적화 기준으로 삼는 벤치마크는 정확도를 점수화하는데, "모르겠습니다"라고 답하면 0점을 주고 우연히 맞힌 추측에는 만점을 줍니다. 이러한 점수 체계에서 훈련되고 선택된 모델은 허풍을 떠는 법을 학습합니다.

SimpleQA 평가에 대한 저자들의 예시가 이를 가장 명확하게 보여줍니다. 한 모델은 거의 모든 질문에 답했고 4분의 3 이상 틀렸습니다. 다른 모델은 절반가량의 답변을 기권하여 오류를 훨씬 적게 범했지만, 기권에는 아무 점수도 주어지지 않았기 때문에 정확도 점수는 오히려 더 낮게 나왔습니다. 점수표가 찍기를 보상한다면, 모델은 찍기를 택합니다.

이는 사람들이 해결책으로 검색을 떠올릴 때 간과하는 결과를 낳습니다. 해당 논문의 저자들은 웹 검색과 모델 스케일링으로도 정확도를 100%까지 끌어올릴 수 없다고 명시합니다. 어떤 질문에는 찾을 수 있는 답 자체가 없기 때문입니다. 검색 도구를 추가하더라도 추측하려는 유인은 사라지지 않습니다.

실제로 얼마나 자주 일어나는가?

정의를 읽기 전까지는 주요 수치들이 믿기 어려울 정도로 자주 발생합니다. 세 가지 벤치마크는 각기 다른 것을 측정하며, 정의 없이 수치만 인용하는 데서 혼란이 시작됩니다.

Benchmark What it measures Headline finding
AA-Omniscience (Artificial Analysis) 모델이 틀리거나 건너뛴 질문 중, 답변을 거부하지 않고 추측한 비율 — 즉 과신율 42개 주제에 걸친 6,000개 질문. 2025년 11월 출시 당시 36개 모델 중 33개가 어려운 질문에서 정답을 맞히기보다 환각을 일으킬 가능성이 더 높았으며, 지수에서 0점을 넘긴 모델은 3개에 불과함
Vectara HHEM 제공된 문서를 요약할 때의 충실도 — 검색 파이프라인의 직접적인 대리 지표에 가장 가까움 이전의 더 짧은 데이터셋보다 최신 7,700개 기사 세트(법률, 의학, 금융, 교육, 기술)에서 환각률이 더 높게 나타남. 거부는 충실도가 아닌 답변율로 별도 채점됨 — 그렇지 않으면 모든 것을 거부하는 모델이 완벽해 보이기 때문
Stanford RegLab legal study 상용 검색 접지 법률 도구가 거짓이거나 근거 없는 인용을 생성하는지 여부 도구들은 17%가 넘는 쿼리에서 환각을 일으킴 — 벤더들의 "거의 0%"라는 주장과 대조적임

2026년에 가장 많이 인용된 수치는 또 다른 네 번째 측정치이며, 대부분 잘못 인용되고 있습니다. Stanford HAI's 2026 AI Index26개 최상위 모델 전반에서 22%에서 94%에 이르는 환각률을 보고합니다. 이는 앞선 세 가지 벤치마크가 아니라, 모델이 지식과 신념을 구분할 수 있는지 탐색하는 벤치마크 결과입니다. 그 이면의 세부 사항이야말로 주목해야 할 부분입니다. 거짓된 진술이 다른 사람이 믿는 내용으로 모델에 제시되면 모델은 이를 잘 처리합니다. 그러나 똑같은 진술이 사용자가 믿는 내용으로 제시되면 성능이 급락합니다. GPT-4o의 정확도는 98.2%에서 64.4%로 떨어졌고, DeepSeek R1은 90% 이상에서 14.4%로 폭락했습니다.

이는 앞선 세 가지와는 다른 유형의 실패이며, 독자가 거의 항상 전제를 가지고 접근하는 성경 연구에서 가장 뼈아픈 문제입니다. AI 비서에게 헬라어 단어의 의미를 확인해 달라고 요청하면, 사용자가 기대한다고 넌지시 드러낸 바에 맞춰 왜곡된 답변을 받게 될 수 있습니다.

그렇다면 그라운딩은 도움이 되는가, 되지 않는가?

둘 다 해당되며, 그 차이를 구별하는 것이 핵심입니다.

Stanford RegLab 연구는 대개 검색 증강 생성(RAG)의 허상을 폭로한 사례로 인용되며, 마케팅 주장 측면에서는 실제로 그렇습니다. 하지만 이 연구가 실제로 측정한 내용을 살펴보십시오. 검색으로 그라운딩된 법률 도구들은 동일한 쿼리에서 범용 GPT-4보다 환각을 일으켰습니다. 그라운딩은 효과가 있었습니다. 단지 이를 판매하는 이들이 말한 것만큼 완벽하게 작동하지 않았을 뿐입니다.

검색이 실패하는 지점은 명확하며 알아둘 가치가 있습니다:

  • 관련성은 있으나 불충분함. 검색된 구절이 주제에는 부합하지만 정답을 담고 있지 않은 경우입니다. 모델은 그 공백을 메우려 합니다.
  • 출처 간 충돌. 검색된 두 문서의 내용이 일치하지 않을 때, 모델은 하나를 임의로 선택해 확정된 사실인 것처럼 보고합니다.
  • 중간 유실. 긴 문맥 속에서 결정적인 문장이 모델이 가장 주의를 기울이지 않는 중간 위치에 묻히는 현상입니다.
  • 오류 누적. 에이전트 루프에서 환각으로 생성된 중간 결과가 다음 검색의 입력으로 들어가면서 오류가 연쇄적으로 증폭됩니다.

그라운딩이 실제로 바꾸는 것

마케팅 문구보다 강력한 솔직한 표현은 이것입니다. 그라운딩은 AI를 옳게 만드는 것이 아닙니다. 사용자가 오류를 발견할 수 있는 방식으로 틀리게 만드는 것입니다.

그라운딩되지 않은 모델이 헬라어 단어에 대한 Thayer 사전 항목을 날조하면 어디서도 역추적할 수 없는 허구를 안겨줍니다. 반면 실제 항목을 잘못 읽은 그라운딩된 모델은 주장과 원형, 참조 출처를 함께 건네주므로 30초만 확인하면 진위를 가릴 수 있습니다. 첫 번째 실패는 보이지 않지만, 두 번째 실패는 검증 가능합니다. 오류의 대가가 큰 모든 분야 — 법률, 의학, 주일 설교 — 에서 그 차이가 곧 가치의 전부입니다.

따라서 설계상의 핵심 질문은 "환각을 어떻게 막을 것인가"가 아니라 "모델에 무엇을 건네줄 것이며 독자가 이를 검증할 수 있는가?"가 됩니다. 이것이 바로 우리가 Darash를 결론 대신 인용 출처가 붙은 원자료를 반환하도록 만든 이유입니다. 결론은 검증할 수 없습니다. 하지만 스트롱스 코드, 형태소 분석, 그리고 특정 사전 항목은 검증할 수 있습니다.

또한 이것이 기반 코퍼스가 정확해야 하는 이유이기도 합니다. 1889년 Harper & Brothers 인쇄본을 바탕으로 Thayer's Greek Lexicon을 재구축할 때, 우리는 페이지 이미지로부터 본문 716페이지 전체를 전사하고 이본들을 상호 대조했습니다. 이들은 856,793개 토큰 중 98.91% 에서 일치했으며, 이견이 있는 모든 부분은 더 자연스러운 독해를 택하는 대신 원본 페이지 이미지와 대조하여 판정했습니다. 책 페이지에 없는 글자는 결코 존재할 수 없다는 것이 규칙이었습니다. 판독할 수 없는 요세푸스 인용 숫자 하나도 여전히 물음표로 제공됩니다. 이를 임의로 채워 넣는 것은 우리 이름표를 달고 나가는 환각이 될 테니까요.

우리는 코퍼스가 완벽하다고 주장하는 대신 측정된 오차 범위인 0.19% 를 공개합니다. 이는 이 글 전체가 다루는 원칙과 일맥상통합니다. 명시된 오류율은 검증할 수 있지만, 100%라는 주장은 검증할 수 없습니다. 한계점까지 포함한 상세 방법론이 공개되어 있습니다.

AI로 연구할 때 이것이 의미하는 바

세 가지 결론이 도출되며, 이 중 어떤 것도 비용 결제를 요구하지 않습니다:

  1. 언제나 출처를 요구하십시오. 주장의 출처를 명시하지 못하는 모델은 읽고 있는 것이 아니라 암송하고 있는 것입니다. 인용을 단순한 호의가 아닌 필수 산출물로 만드십시오. 어떤 성경 연구 도구를 먼저 찾아야 하는가에 대한 우리의 우선순위 가이드도 동일한 원칙에 기반합니다.
  2. 자신감을 소음으로 취급하십시오. 유창함과 확신은 정확성에 대해 아무런 정보도 주지 않습니다. 앞서 언급한 벤치마크들이 측정한 것이 바로 이것이며, 모델의 전반적인 능력과 사실적 신뢰성 사이에는 유의미한 상관관계가 없음을 보여줍니다.
  3. 출처를 제공하고, 확인하십시오. 그라운딩은 작업의 성격을 '신뢰하기'에서 '검증하기'로 바꿉니다. 검증에는 수고가 들지만, 1년 동안 조용히 틀린 채로 지내는 것보다는 훨씬 적은 수고입니다.

자주 묻는 질문

RAG는 환각을 없애 주나요?

아닙니다. Stanford RegLab 연구에 따르면 벤더들이 문제가 해결되었다고 설명했음에도 불구하고, 검색으로 접지된 상용 법률 도구들은 17% 이상의 쿼리에서 여전히 환각을 일으켰습니다. 검색은 환각을 줄여줄 뿐, 제거하지는 못합니다.

연구소들이 그냥 고치지 못하는 이유는 무엇인가요?

유인이 모델뿐만 아니라 평가 방식 자체에 자리잡고 있기 때문입니다. 발전을 정의하는 벤치마크가 불확실성을 인정하는 것에 아무런 점수도 주지 않는 한, 모델들은 자신 있게 찍도록 선택됩니다. OpenAI 논문의 제안은 모델뿐만 아니라 채점 방식 자체를 바꾸는 것입니다.

최신 모델일수록 환각을 덜 일으키나요?

어느 정도는 그렇지만 편차가 큽니다. 일반적인 능력이 사실적 신뢰성을 담보하지는 않습니다. Artificial Analysis는 전반적인 지능 점수는 높지만 환각률이 형편없는 모델, 그리고 그 반대의 모델들을 발견했습니다. 필요한 특성에 맞춰 모델을 선택하십시오.

낮은 환각률은 항상 좋은 것인가요?

아닙니다. 이것이 수치의 함정입니다. 대부분의 질문을 거부하는 모델은 답변의 위험을 전혀 감수하지 않음으로써 뛰어난 수치를 기록합니다. 기권율을 함께 확인하지 않는다면 그 수치는 아무런 의미가 없습니다.

성경 연구 도구가 AI를 성경에 관해 신뢰할 수 있게 만들어 주나요?

검증 가능하게 만들 뿐이며, 이는 신뢰할 수 있다는 것과 같지 않습니다. 참조 출처가 첨부된 히브리어 또는 헬라어 본문, 형태소 분석, 사전 항목을 얻을 수 있으므로 잘못된 해석을 잡아낼 수 있습니다. 해석 자체에 대한 판단은 여전히 사용자의 몫입니다.


작동 방식 확인하기: 이미 사용 중인 AI에 Darash를 연결해 보세요 — 단 하나의 URL, 간단한 로그인, 45일 무료 체험; Claude, ChatGPT, Cursor 단계별 연동 가이드는 5분이면 충분합니다. 연결하기 전에 Darash와 Logos, Accordance, Blue Letter Bible의 비교를 먼저 읽어보실 수도 있습니다.

Publifye AS의 창립자 Jørn André Halseth 작성 — 10년간 성경을 출판하고 출판 엔진을 구축해 왔으며, 4,268개 판본의 성경을 출판하고 Darash, Junifye, Lexifye, Tringine을 개발했습니다. 소개 · 문의

새로운 것을 출시하면 이메일로 알려드립니다. 뉴스레터 구독하기