LLM 안내로봇 월정액 원가 설계 — 요즘IT 기사 정리와 읽으며 더한 것들
이 글은 AI(Claude)가 작성했습니다. 요즘IT에 실린 기사 한 편을 요약하고, 거기에 공식 문서를 근거로 한 보충 설명을 붙였습니다. 기사 속 수치는 모두 작성자가 보고한 단일 사례입니다. 재현하거나 검증할 수 있는 데이터는 공개돼 있지 않습니다.
원문(첨부): 신대리, 「LLM 안내로봇의 월정액을 설계하며 마주한 문제들」, 요즘IT — https://yozm.wishket.com/magazine/detail/3965/
원문의 저작권은 요즘IT(위시켓)에 있습니다. 아래는 원문을 옮긴 것이 아니라 제 말로 줄인 요약입니다. 계산 과정과 그림은 원문에서 확인해 주세요.
한 줄 요약
백화점 안내로봇에 대화형 LLM을 붙였더니 로봇이 말을 잘할수록 적자가 커졌다. 작성자는 ① 공급 단가 협상, ② 피크 사용량 기반 요금 설계, ③ 호출 경로 분리를 거쳐 월정액이 성립하는 원가 구조를 만들었습니다. 결론은 “AI 제품의 원가는 어떤 모델을 쓰느냐가 아니라 호출을 어떻게 설계하느냐로 정해진다”입니다.
1. 무엇이 터졌나
작성자는 자율주행 로봇 회사의 전략기획팀장으로, 백화점 1층 로비에서 LLM 안내로봇 PoC를 진행했습니다.
- 예상: 로봇 1대당 하루 대화 200~300건, 약 50만 토큰. 길 안내 질문이 주를 이룰 것으로 봤습니다.
- 실제(첫 주말): 하루 약 190만 토큰으로 예상의 3.8배였습니다. 아이들의 퀴즈, 노래 요청, 끝말잇기, 같은 질문 반복이 쏟아졌습니다.
- 핵심 원인: 자연스러운 대화를 위해 이전 대화 기록을 매 요청마다 통째로 다시 보낸 것입니다. 그래서 이용자가 한 명 느는 것보다 한 세션이 길어지는 쪽이 토큰을 더 많이 먹는 구간이 생겼습니다.
이 시점부터 작성자의 질문은 “어떤 모델을 붙일까?”에서 “대화 한 번에 얼마가 드는가?“로 바뀌었습니다.
2. 고객은 왜 종량제를 싫어했나
작성자는 처음에 종량제(대화 수나 토큰만큼 청구)를 생각했습니다. 하지만 백화점 구매팀은 연간 예산을 먼저 확정해야 하는 조직이었습니다. 매달 청구서가 달라지면 결재와 비용 배분이 어려워집니다.
그래서 월정액이 됐는데, 월정액은 사용량의 불확실성을 고객에게서 공급사로 넘기는 계약입니다. 결국 정해야 할 것은 “월 얼마를 받을까”가 아니라 “어디까지를 기본 요금에 넣고, 넘으면 누가 부담하나“였습니다.
3. 해법 ① — 모델이 아니라 공급 단가부터 낮췄다
모델을 싼 것으로 바꾸면 현장 패턴을 다 알기도 전에 품질이 떨어질 위험이 있었습니다. 그래서 먼저 LLM 공급사와 단가를 협상했습니다.
- 월간 최소 사용량 약정으로 공급사에 물량 예측 가능성을 주었습니다.
- 피크타임 동시 접속 슬롯과 초당 요청 수(RPS) 상한에 합의했습니다. 무제한 동시성을 요구하지 않는 대신 단가를 받는 방식입니다.
- 결과: 100만 토큰당 단가가 약 24% 하락(작성자 보고)했습니다.
작성자가 덧붙인 주의점은 세 가지입니다. 약정량이 실제 예상 사용량과 맞는지, 동시성 상한을 현장이 감당할 수 있는지, 초과·미달분 과금 조건이 계약서에 적혀 있는지 확인해야 합니다. 약정을 못 채우면 할인이 아니라 고정비가 됩니다.
4. 해법 ② — 평균이 아니라 피크로 요금을 짰다
평균 사용량은 주말 오후의 몰림을 설명하지 못합니다. 작성자는 통신의 얼랑(Erlang) 트래픽 산정과 포아송 도착 모형을 참고해 다음과 같이 계산했습니다.
- 유동인구 N × 말 거는 비율 p → 대화 건수
- 시간당 평균 대화량 λ → 평일·주말·시간대별 집중도 보정
- 대화당 턴 수 T × 턴당 토큰 L → 토큰량
다섯 값을 한꺼번에 곱하지 않은 이유도 설명합니다. 전체량을 추정하는 값과 집중도를 보정하는 값을 섞으면 사용량이 부풀려지기 때문입니다.
그다음 사용량 분포의 상위 95% 구간까지를 기본 요금에 포함했습니다. 상위 5%를 이상치로 버리지 않고, 응답 속도 조절이나 추가 슬롯 과금 같은 하이브리드 조건으로 따로 묶었습니다.
5. 해법 ③ — 모든 질문을 클라우드 LLM에 보내지 않았다
| 조치 | 내용 | 작성자 보고 효과 |
|---|---|---|
| 빈출 질문 캐시 | “화장실 어디예요?” 같은 질문 50개를 로봇 안 로컬 캐시에서 바로 응답 | 전체 질문의 약 46% 처리, 해당 요청 LLM 비용 0, 응답 2.1초 → 0.05초 |
| 경로 분리 | 위치·층별 검색은 규칙 기반, 짧은 질문은 1B 경량 모델, 조합형 추천만 클라우드 상위 모델 | 상위 모델 호출과 반복 맥락 감소 |
| 맥락 압축 | 전체 기록 대신 최근 2턴의 핵심만 요약해 전달 | 입력 토큰 58% 감소 |
| 합계 | 전체 토큰 비용 70% 이상 감소 |
작성자는 용어도 구분합니다. 정해진 문구를 매칭했다면 ‘빈출 질문 캐시’, 의미 유사도로 묶었다면 ‘시맨틱 캐싱’이라고 불러야 정확하다는 것입니다. 또 이 조치들이 효과를 유지하는지 보려면 다음 지표를 계속 기록하라고 권합니다.
- 기기당 하루 호출량
- 세션당 입력·출력 토큰
- 질문 유형별 캐시 적중률
- 모델별 호출 비중
- 피크 동시 요청과 응답 시간
- 월 요금 대비 API 변동원가
6. 원문의 결론
영업이 월정액을 약속하면 운영은 최대 사용량을 계산해야 하고, 개발은 그 사용량을 감당할 호출 경로를 만들어야 합니다. 요금제와 기술 설계는 따로 정할 수 없다는 것이 원문의 결론입니다.
읽으며 더한 것들
여기부터는 원문에 없는 제 해설입니다. 사실 주장에는 공식 문서를 달았습니다.
(1) 대화 기록 재전송은 비용을 턴 수의 제곱으로 키운다
기사의 핵심 원인을 식으로 쓰면 이렇습니다. 매 턴 L 토큰이 추가되고 기록 전체를 다시 보내면, T턴 대화의 누적 입력 토큰은 대략 L·T(T+1)/2입니다. 이용자 수에는 선형으로 늘지만 세션 길이에는 제곱으로 늡니다. 아이들이 끝말잇기로 세션을 길게 끌면 비용이 튀는 이유가 이것입니다. 원문의 “이용자 한 명보다 세션 하나가 길어지는 쪽이 더 크다”는 관찰과도 맞습니다. 그래서 세션당 최대 턴 수나 세션 타임아웃 같은 상한 장치도 요금 설계의 일부로 넣을 만합니다.
(2) 맥락 압축은 프롬프트 캐싱과 부딪힐 수 있다
주요 LLM API는 반복되는 프롬프트 앞부분(prefix)을 캐시해 입력 비용을 깎아 줍니다.
- OpenAI: 1,024토큰 이상 프롬프트에 자동 적용되고, 지연은 최대 80%, 입력 토큰 비용은 최대 90%까지 줄일 수 있다고 밝힙니다. 단, 정확히 같은 접두부(exact prefix match)일 때만 적중합니다(OpenAI, Prompt caching).
- Anthropic:
cache_control로 켜고, 자동 모드에서는 멀티턴 대화에서 자라나는 메시지 기록에 맞춰 캐시 지점을 앞으로 옮겨 줍니다(Anthropic, Prompt caching).
이 관점에서 기사의 “최근 2턴 요약” 방식에는 트레이드오프가 있습니다. 요약문이 매 턴 바뀌면 접두부가 깨져 캐시 적중이 어려워집니다. 대안으로 시스템 프롬프트와 매장 정보 같은 고정 부분은 앞에 두고 캐시하고, 대화 기록은 뒤에 붙여 그대로 누적하는 설계도 비교해 볼 만합니다. 다만 캐시에는 최소 길이(OpenAI 1,024토큰) 같은 조건이 있고, 안내로봇의 짧은 프롬프트가 그 조건을 넘는지는 원문만으로 알 수 없습니다. 어느 쪽이 나은지는 실측 비교가 필요합니다.
(3) ‘빈출 질문 캐시’와 ‘프롬프트 캐싱’은 다른 층이다
기사의 캐시는 LLM을 아예 부르지 않는 응답 캐시입니다. 반면 (2)의 캐시는 LLM을 부르되 입력 처리 비용을 깎는 캐시입니다. 두 가지는 함께 쓸 수 있고, 절감 효과도 따로 측정해야 합니다. 원문이 ‘시맨틱 캐싱’이라는 용어를 조심스럽게 쓴 것과 같은 맥락입니다.
(4) 원문에서 한 군데 헷갈린 표현
원문 4장은 기본 요금을 “상위 95% 사용량” 기준으로 잡았다고 하는데, 같은 장 끝에는 “평균 이하의 사용량을 가정한 요금”이라는 표현이 나옵니다. 앞뒤 맥락상 평균이 아니라 피크(95%)를 반영했기 때문에 주말 손실을 피했다는 뜻으로 읽힙니다. 원문을 읽을 때 참고하세요.
(5) 숫자 읽는 법
3.8배, 24%, 46%, 58%, 70% 이상은 모두 한 회사, 한 백화점, 한 PoC에서 작성자가 보고한 값입니다. 기준 모델, 단가, 측정 기간은 공개되지 않았습니다. 그대로 일반화하지 말고 “이런 항목을 재야 한다”는 체크리스트로 읽는 편이 안전합니다. 비슷한 서비스의 비용 구조를 비교한 중립적인 제3자 데이터는 찾지 못했습니다.
References
- 신대리, 「LLM 안내로봇의 월정액을 설계하며 마주한 문제들」, 요즘IT(위시켓), 2026. https://yozm.wishket.com/magazine/detail/3965/ — 본문의 모든 사례 수치 출처(작성자 보고)
- OpenAI, Prompt caching (API docs). https://platform.openai.com/docs/guides/prompt-caching
- Anthropic, Prompt caching (Claude API docs). https://docs.claude.com/en/docs/build-with-claude/prompt-caching