초원의 AI 기술력은 모델이 아니라 파이프라인에 있다
초원은 어웨이크코퍼레이션이 만든 한국 기독교 앱이다. 성경 질문에 AI 가 답하고 묵상·기도 콘텐츠를 준다. 이 글은 신앙 얘기가 아니라 그 뒤에 무엇이 깔려 있는가만 본다.
결론부터. 초원의 기반 모델은 남의 것이고 그건 본인들도 보도자료로 알렸다. 기술적 실체는 그 위에 얹힌 다단 파이프라인에 있고, 그 파이프라인의 한 단계 때문에 성경 역본 사용권이 콘텐츠가 아니라 부품이 된다. 그리고 공개된 유일한 품질 수치는 벤치마크로 쓸 수 없는 분모를 갖고 있다.
1. 공개된 답변 파이프라인
드물게도 자사 블로그가 처리 순서를 문장으로 적어 놨다.1
“초원 앱을 통해 질문을 하시면, 성경과 신학자료를 학습한 초원AI를 거쳐 질문에 대한 1차 답변이 생성됩니다. 1차 답변은 다시 가공 과정을 거치는데요, 정제(후처리) 과정을 지나 한국어로 번역되어, 최종 답변의 형태로 만들어집니다.”
여기에 두 개의 검증 장치가 더 붙는다. 같은 글이 밝힌 런타임 필터와,1
“초원은 AI가 신학적 관점에서 잘못된 답변을 내놓지 않도록 자체적인 성경 DB를 접목해 필터링 역할도 함께 수행하고 있습니다. 해당 DB에는 국내 목회자분들의 자문에 기반한 이단 단체 정보 등이 포함돼 있어 해당 정보를 이단으로 인식하고 답변을 내놓고 있습니다.”
대표가 한 언론 인터뷰에서 할루시네이션 대책으로 직접 말한 출력 후 대조다.2
“답변은 ‘대한성서공회’의 성경과 최종 대조한 뒤 제공한다”
정리하면 대략 이런 모양이다.
질문 → 1차 답변 생성(생성형 모델 + 성경/신학자료) → 정제(후처리)
→ 한국어 번역 → 성경 원문 대조 → 이단 DB 필터 → 최종 답변
별 것 아닌 것처럼 보이지만, 생성 한 방으로 끝내지 않았다는 게 이 서비스의 기술적 선택의 전부라고 해도 된다. 정제·번역·대조·필터는 전부 생성 모델 바깥에 있고, 바깥에 있으니까 버전을 올려도 남고 감사도 가능하다. 아래 절들은 이 도면의 각 칸을 하나씩 뜯는다.
2. 번역 단계가 있으면 성경 구절은 번역하면 안 된다
파이프라인에서 제일 눈에 띄는 칸은 한국어 번역이다. 최종 출력 직전에 번역을 한다는 건
1차 답변이 한국어가 아니었다는 뜻이다. 서비스의 전신이 영문 AskJesus 였다는 이력과도
맞물린다. 2023년 시점에서 영어로 생성하고 옮기는 건 합리적인 선택이었다 — 같은 모델이라도
영어 쪽 품질이 나았고, 신학 문헌의 밀도도 영어가 높다.
그런데 이 선택은 곧바로 하나의 제약을 만든다. 인용된 성경 구절만은 절대 번역하면 안 된다. “여호와는 나의 목자시니” 를 영어로 생성해서 다시 한국어로 옮기면, 뜻은 비슷하되 개역개정 본문과 한 글자도 같지 않은 문장이 나온다. 교회에서 그건 인용이 아니다.
\[\text{생성}(\text{en}) \xrightarrow{\ \text{번역}\ } \text{한국어 문장} \ne \text{개역개정 본문}\]그래서 구절은 번역 경로를 타면 안 되고, 구절 식별자(책·장·절)만 통과시킨 뒤 공식 역본 텍스트로 조회해 끼워 넣어야 한다. 자사 설명의 1번 요소 “성경 전용 DB 엔진”3 이 왜 생성 모델과 별도의 층으로 서 있는지가 여기서 설명된다. 그건 검색 최적화 이전에 번역 파이프라인이 강제한 구조다.
이 관점에서 보면 다음 절의 협약이 단순한 콘텐츠 제휴가 아니게 된다.
3. 그래서 역본 사용권이 콘텐츠가 아니라 부품이다
성경은 퍼블릭 도메인이 아니다. 한국어 역본은 저작물이고 개역개정·새번역의 권리는 대한성서공회에 있다. 위 구조대로라면 초원은 그 텍스트를 출력마다 꺼내 써야 한다.
초원은 그 권리를 협약으로 확보했다. 2023년 8월 30일부터 전 기능에서 개역개정을 무료로 제공하기 시작했고,4 이어 대한성서공회와 협약을 맺어 역본 제공을 넘어 다른 역본 도입, 저작권 협력, 성경 해설의 검수·전파까지 범위를 넓혔다.4 협약 상대 쪽 인사의 코멘트가 같이 실려 있어4 이 부분은 한쪽 주장이 아니다.
LLM 시대의 진입장벽이 가중치에서 코퍼스 권리로 옮겨간 전형적인 사례다. 모델은 API 키로 살 수 있지만 “이 한국어 역본을 서비스 안에서 조회·인용·해설해도 된다” 는 허락은 살 수 없다. 경쟁 앱이 같은 모델을 불러도, 끼워 넣을 수 있는 본문이 다르면 출력이 다르다.
4. “오직 성경만 학습시켰다” 는 어느 층에 대한 말인가
자사 글에 이런 문장이 있다.1
“초원AI는 성경적일 수 밖에 없습니다. 생성형 AI에 오직 성경과 관련된 콘텐츠만을 학습시켰기 때문이죠.”
이 문장은 그대로 읽으면 사실과 어긋난다. 같은 회사가 2024년 6월 GPT-4o 도입을 보도자료로 알렸고,56 GPT-4o 는 성경만 학습한 모델이 아니다. 두 진술을 같이 놓으면 해석은 하나뿐이다. “오직 성경만” 은 파운데이션 모델이 아니라 그 위에 얹은 지식 층에만 참이다.
그 구분이 중요한 이유는 안전성 주장의 사거리가 완전히 달라지기 때문이다.
| 층 | 초원이 통제하는가 | “성경만” 이 참인가 |
|---|---|---|
| 파운데이션 모델(가중치) | 아니오 (외부 API) | 아니오 |
| 지식·검색 층(역본·신학자료) | 예 | 예 |
| 후처리·번역·대조·필터 | 예 | 해당 없음 |
파운데이션 모델은 세상의 모든 텍스트를 이미 봤고, 그 안에는 이단 교리도 들어 있다. 그걸 막는 건 학습 데이터가 아니라 3층의 필터다. 초원이 실제로 만든 것도 정확히 3층이다. 그러니 “학습시켰으니 안전하다” 보다 “바깥에 검사기를 세웠으니 걸러진다” 가 자기네 구조를 더 정확히 설명하는 문장이다.
5. 검수위원회 — 사람의 판단을 런타임 데이터로 컴파일한 것
초원은 다양한 정통 교단 목회자·신학자로 구성된 별도의 신학검수위원회를 둔다.5 자사 설명으로는 위원회가 “서비스의 매뉴얼을 강화하고 응답 품질을 향상시키기 위해 정기적으로 피드백” 하고,3 대표도 “정기적인 피드백을 기반으로 AI의 신학적 정확도를 높이고 있다” 고 말한다.7 고객센터 오류 제보가 같은 루프의 또 다른 입력이다.3
여기까지는 흔한 오프라인 배치 루프다. 주목할 건 그 다음이다. 이 사람들의 판단이 데이터로 내려앉아 런타임에서 돈다. 이단 단체 정보 DB 는 “국내 목회자분들의 자문에 기반” 한다고 명시돼 있고,1 그 DB 는 배치가 아니라 답변 경로에 끼어 있는 필터다.
이 구조가 흥미로운 이유는, 정답이 코드로 표현되지 않는 도메인 — 교리 해석처럼 교단마다 정답이 갈리는 영역 — 에서 평가 기준을 조직으로 외부화한 뒤, 그 산출물을 다시 기계가 읽을 수 있는 목록으로 컴파일했기 때문이다. LLM-as-judge 로는 애초에 못 푸는 문제를 사람 → 데이터 → 런타임 순서로 풀었다.
한계도 분명하다. 위원회 구성·라벨링 기준·합의 절차가 공개돼 있지 않아 재현이 불가능하다. 같은 로그를 다른 위원회에 주면 같은 라벨이 나오는지 알 수 없고, DB 에 없는 신종 오류는 런타임에서 그대로 통과한다. 필터는 목록만큼만 안다.
6. 유일한 공개 품질 수치 99.92%, 그런데 분모가 좁다
초원이 공개한 품질 지표는 사실상 이것 하나다.3
| 구분 | 과거 모델 (2023.04) | 최근 모델 (2023.08) |
|---|---|---|
| 응답 수 | 7,777 | 8,845 |
| 정상 응답 | 7,735 (99.46%) | 8,838 (99.92%) |
| 오류 응답 | 42 (0.54%) | 7 (0.08%) |
자사 글은 이를 “약 7배 개선” 으로 요약한다. 배수 자체는 맞다 — \(\frac{0.54}{0.08} \approx 6.75\)
문제는 저 분모가 무엇이냐다. 같은 글이 정의를 정직하게 적어 놨고, 거기에 필터가 둘 걸려 있다.3
“사용자가 만족도와 피드백을 남긴 질문들 중에서, 기술적인 오류나 이단적 답변이 발견된 경우를 ‘오류 응답’ 이라고 정의했고, 의도적으로 오류를 유발하려는 시도들은 통계에서 제외했습니다.”
첫 번째는 자기선택 표본이다. 피드백 버튼을 누르는 사람은 전체의 일부이고, 그 일부의 구성은 무작위가 아니다. 같은 글이 누적 질문을 10만 개 규모로 적고 있으니 분모 8,845 는 한 자릿수 퍼센트의 부분집합이다.
두 번째가 더 크다. 적대적 입력을 뺀 오류율은 레드팀 결과가 아니다. 초원은 실제로 이단 측의 서버 공격을 겪었다고 밝힌 바 있는데,8 바로 그 축을 통계에서 제외하면 남는 건 “선의의 사용자가 평범하게 물었을 때의 오류율” 이다. 운영 지표로는 의미가 있어도 안전성 지표는 아니다. 5절의 필터가 인젝션·역할극 우회에 얼마나 버티는지는 이 표로 전혀 알 수 없다.
읽는 법은 이렇게 된다.
\[\text{공개된 값} = 1 - \frac{\text{오류로 라벨된 응답}}{\text{피드백이 달린 응답} - \text{적대적 시도}}\]배수가 분모로 정해지는 건 지난 글에서 Jev 의 193배를 뜯을 때와 같다. 정확도도 똑같이 분모가 정한다.
덧붙여 이 표는 2023년 4월과 8월 두 시점의 값이고, 그 뒤로 갱신된 공개 수치가 없다. 2024년 6월 기반 모델을 GPT-4o 로 바꾼 뒤의 오류율은 공개된 적이 없다. 파이프라인에 가장 큰 변경이 있었던 직후의 숫자가 비어 있다.
7. 원가 구조가 아키텍처를 정한다
기술 선택이 곧 손익이라는 게 이 서비스에서 유난히 선명하다. 대표는 2023년 3월부터 10월까지 서버 운영비와 챗GPT 사용료로 수억 원을 자비로 지출했고 후원금은 운영비의 1% 수준이라고 밝혔다.8 무료 정책을 유지하면서 프런티어 API 를 부르면 트래픽이 그대로 비용이 된다.
여기서 구조적으로 가능한 최적화는 1절의 도면이 이미 가리키고 있다. 저 파이프라인의 여섯 칸이 전부 프런티어여야 할 이유가 없다. 구절 조회, 질문 분류, 이단 DB 대조, 필터 판정은 글쓰기가 아니라 판정이고, 판정은 값싼 구조화 출력 모델 — 혹은 아예 모델이 아닌 코드 — 의 자리다. 목회적 문장을 써야 하는 1차 생성 한 번만 비싼 모델이면 된다. 이 분리에 대해서는 따로 적어 뒀다 — 한 토큰씩 vs 한 번에.
실제로 각 칸에 무엇을 쓰는지는 공개돼 있지 않다. 다만 성경 DB 엔진과 이단 DB 가 생성 모델 밖에 따로 서 있다는 사실31 자체가, 적어도 조회와 필터는 LLM 밖으로 뺐다는 신호다. 검색을 모델에 맡기지 않는 것만으로 토큰과 환각이 동시에 준다.
8. 내가 이걸 평가 가능한 형태로 만든다면
비판만 하면 글이 싸구려가 되니, 같은 자산으로 제대로 된 지표를 만드는 법을 적어 둔다. 6절의 두 결함은 데이터가 없어서가 아니라 설계가 없어서 생긴 것이라 고칠 수 있다.
- 골든셋을 고정한다. 검수위원이 라벨한 질문-답변 쌍을 버전 태그와 함께 얼려 두고, 모델이나 프롬프트를 바꿀 때마다 같은 셋을 다시 돌린다. 그때그때 쌓인 로그를 표본으로 쓰면 시점 간 비교가 성립하지 않는다.
- 평가는 홀드아웃에서만 한다. 개선에 쓴 피드백 데이터로 점수를 내면 그건 자기 자신을 채점한 값이다.
- 적대 축을 지우지 말고 따로 세운다. 일반 정확도와 적대 강건성은 별개 지표다. 이단 교리 유도·프롬프트 인젝션·역할극 우회를 별도 셋으로 만들어 따로 보고하면 제외할 이유가 없어진다. 5절의 필터를 가진 서비스라면 오히려 자랑할 숫자다.
- 번역 단계를 따로 잰다. 1절의 도면대로라면 번역 전후로 의미가 보존되는지가 독립된 실패 지점이다. 구절 치환이 정확했는지(책·장·절 일치율)와 신학 용어가 뒤집히지 않았는지는 전체 정확도에 섞으면 안 되고 따로 재야 원인이 보인다.
- 정답이 갈리는 문항은 기권으로 채점한다. 교단별로 답이 다른 항목은 정오 대상이 아니라 “쟁점임을 밝혔는가” 로 채점해야 한다.
- 확신도를 재고 임계값을 건다. 모델이 낮은 확신도를 보고하면 사람에게 넘기는 게이트가 있어야, 검수 루프가 사후 배치에서 완전한 런타임 게이트로 올라온다.
여섯 개 중 다섯은 이미 있는 자산(검수위·피드백 로그·오류 제보 창구·이단 DB)을 재배치하는 것뿐이다.
근거의 한계
- 모델 구조·파라미터·RAG 여부가 공개돼 있지 않다. “성경을 데이터베이스로 학습시킨 챗봇”5 같은 표현은 파인튜닝인지 검색증강인지 구분해 주지 않는다. 임베딩·인덱싱·청킹 방식도 공개된 적이 없다. 1절의 도면은 자사 산문 서술을 그대로 옮긴 것이고, 2·4·7절의 해석은 거기서 추론한 것이지 내부 구현 확인이 아니다.
- 같은 자사 글에 “초원 생성형 AI모델 답변 프로세스 도식화” 라는 그림이 실려 있으나 이미지라 텍스트로 확인할 수 없어 인용하지 않았다.1 도면을 문장으로 재구성한 것은 본문 산문만 근거로 한다.
- 2절의 “1차 답변이 영어였을 것” 은 추정이다. 자사 글이 밝힌 건 “한국어로 번역된다” 까지이고 원 언어는 명시되지 않았다.
- 국민일보와 아이굿뉴스의 기술 설명 단락은 서로 같은 문장이다(대한성서공회 역본·자체 성경 엔진·검수위 문단).56 같은 보도자료의 재게재라, 여러 매체에 실렸다는 사실이 독립 검증을 뜻하지 않는다. 이 글에서 언론 인용은 자사 주장의 전달로 등급을 낮춰 읽었다.
- 대한성서공회 협약 시점이 출처마다 엇갈린다. 자사 보도자료는 2023년 9월 7일 체결로 적고 있고,4 국민일보는 “지난해 7월” 로 적었다.9 이 글은 어느 한쪽을 확정하지 않고 날짜를 특정하지 않았다.
- 규모 지표(월 15만 명5, 누적 질문 62만 건·리텐션 60%9, 현재 홈페이지의 80만 다운로드 등)는 전부 자사 발표 또는 그 재게재다. 중립 제3자 실측치는 찾지 못했다.
- 6절 표는 자사 1차 수치이고 외부에서 재현된 적이 없다.
- 이 글은 공개 자료만으로 썼고, 회사에 확인을 요청하지 않았다.
References
-
“[질문하기 200% 활용방법] 초원을 신뢰해도 될지 고민하고 계신 분들께”, 초원 블로그(자사 1차), 2024-06-07. https://blog.chowon.in/news/guide/2-uvp/ — 답변 프로세스(1차 생성 → 정제 → 한국어 번역), 성경 DB·이단 단체 정보 필터, 역본 사용 협약. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
"’초원 AI’, 2030 신앙 질문에 답하다”, 굿뉴스, 2024-01-16. https://www.goodnews1.com/news/articleView.html?idxno=430663 — 김민준 대표의 할루시네이션 대책 발언(“대한성서공회의 성경과 최종 대조한 뒤 제공”). ↩
-
“독보적인 초원AI : 신앙과 기술의 경계를 좁히다”, 초원 블로그(어웨이크코퍼레이션, 자사 1차). https://blog.chowon.in/%EC%B4%88%EC%9B%90-ai%EB%A5%BC-%EC%86%8C%EA%B0%9C%ED%95%A9%EB%8B%88%EB%8B%A4/ — 4요소 구성, 교차 검증, 오류율 표와 산출 기준, 고객센터 제보 프로세스. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
전미준, “국내 최초 생성 AI기술로 기독교계 혁신 이끌어낸 ‘초원’, 대한성서공회와 기독교 앱 서비스 확대”, AI타임스, 2023-09-09. https://www.aitimes.kr/news/articleView.html?idxno=28889 — 협약 범위(역본 도입·저작권 협력·해설 검수)와 대한성서공회 측 코멘트. 개역개정 무료 제공 개시(2023-08-30)는 자사 블로그 보도자료 재게재. https://blog.chowon.in/news/press/ai%ec%99%80-%ec%84%b1%ea%b2%bd%ec%9d%b4-%eb%a7%8c%eb%82%ac%eb%8b%a4-%ec%b4%88%ec%9b%90/ ↩ ↩2 ↩3 ↩4
-
최기영, “‘목사님이 상담하는 듯’···’초원’ 챗GPT-4o 교계 최초 도입”, 국민일보, 2024-06-05. https://www.kmib.co.kr/article/view.asp?arcid=0020172334 ↩ ↩2 ↩3 ↩4 ↩5
-
“초원 AI 모델 ‘GPT-4o’ 도입…’우리 목사님이 말씀하시는 듯’”, 아이굿뉴스, 2024-06-10. http://www.igoodnews.net/news/articleView.html?idxno=76751 — 5과 기술 설명 단락이 동일한, 보도자료 기반 기사. ↩ ↩2
-
“어웨이크 코퍼레이션 대표·초원 AI 앱 개발자 김민준 대표”, 크리스찬타임스, 2025-04-17. http://www.kctusa.org/news/articleView.html?idxno=75482 — 신학검수위원회 정기 피드백, 초원 AI 를 ‘어시스턴트’로 규정하는 대표 발언. ↩
-
이연경, “초원비전 김민준 대표”, 크리스천신문(cnews), 2023-11-01. https://www.cnews.or.kr/news/articleView.html?idxno=2556 — 2023년 3~10월 서버·챗GPT 사용료 수억 원 자비 지출, 후원금이 운영비의 약 1%, 이단 측 서버 공격. ↩ ↩2
-
최기영, “‘교만했던 청년사업가, 벼랑 끝에서 주님께 매달렸죠’”, 국민일보, 2024-01-27. https://www.kmib.co.kr/article/view.asp?arcid=0924341450 — 누적 질문 62만 건, 답변 페이지 조회 175만 회, 리텐션 60%, 대한성서공회 업무협약 시점(“지난해 7월”). ↩ ↩2