제68호

오픈 모델을 쓸 때, 토큰 단가와 운영비는 어떻게 달라질까요

GLM-5와 Gemma 4를 계기로, 에이전트의 API 요금과 직접 운영 비용을 살펴봐요

AI·테크오픈 모델을 쓸 때, 토큰 단가와 운영비는 어떻게 달라질까요

에이전트에 어떤 모델을 쓸지 다시 계산해 볼 때

오픈 모델은 모델의 학습 결과인 가중치를 공개해, 이용자가 내려받아 실행할 수 있게 한 모델을 말해요. 허용되는 이용 범위는 라이선스마다 달라요. 필요한 장비를 갖추면 자기 컴퓨터나 회사 서버에서 실행할 수 있고, 다른 회사가 운영하는 API로 이용할 수도 있어요.

구글이 4월 2일 발표한 Gemma 4도 이런 선택지를 제공해요. 스마트폰에서 쓸 수 있는 소형 모델부터 서버용 모델까지 공개했고, 상업적 이용을 허용하는 Apache 2.0 라이선스를 채택했어요.

같은 날 LangChain의 Deep Agents 팀은 GLM-5와 MiniMax M2.7을 Claude Opus 4.6, GPT-5.4 등과 비교한 자체 평가를 공개했어요. 파일 수정, 도구 호출, 지시 이행 같은 작업에서 저렴한 모델도 활용할 가능성을 보여준 결과였어요. 이 평가는 API로 실행한 결과이므로, 모두 당장 개인 컴퓨터에 설치할 수 있다는 뜻은 아니에요.

저는 여러 번 말했듯 벤치마크 점수만으로 모델을 고르는 데 회의적이에요. 이번에 관심이 간 것도 가격과 실제 업무 성능의 관계였어요. 우리 업무를 만족스럽게 처리하는 모델이 여러 개라면, 그때부터 비용 차이가 선택에 큰 영향을 줘요.

출력 백만 토큰의 가격은 25달러, 3.15달러, 1.2달러

Deep Agents 팀이 4월 2일 글에 제시한 출력 토큰 가격은 다음과 같아요. 모델이 답변을 생성할 때 발생하는 요금이며, 우리가 보내는 입력 토큰에는 별도 요금이 붙어요.

모델제공 경로출력 백만 토큰당 가격
Claude Opus 4.6Anthropic25달러
GLM-5Baseten3.15달러
MiniMax M2.7OpenRouter1.2달러

출력 단가만 보면 Opus 4.6은 GLM-5의 약 7.9배, MiniMax M2.7의 약 20.8배예요. 다만 저렴한 모델이 답을 얻기까지 더 많이 재시도하거나 더 긴 답변을 생성한다면, 작업 한 건의 비용 차이는 줄어들어요.

하루 천만 출력 토큰을 365일 쓴다고 가정해 볼게요. Opus 4.6은 하루 250달러, MiniMax M2.7은 12달러로, 연간 출력 요금 차이는 86,870달러예요. 입력 요금, 캐시 할인, 도구 사용료를 제외한 단순 계산이지만, 사용량이 많을수록 단가를 꼼꼼히 볼 이유는 충분해요.

여러분의 생각이 다음 호를 만듭니다

이번 호에서 가장 공감했거나, 다른 경험을 한 지점은 무엇인가요?

댓글은 무료 회원이면 누구나 남길 수 있어요.

SEND A COFFEE

이 관점이 좋았다면, 다음 글에 커피 한 잔

오스왈드에게 커피와 함께 짧은 쪽지를 보내주세요. 응원은 다음 취재와 집필에 보탭니다.

FOR OSWARLD

커피와 쪽지 보내기

“오픈 모델을 쓸 때, 토큰 단가와 운영비는 어떻게 달라질까요”을 읽고 떠오른 말을 남겨주세요. 메뉴 이름만큼의 응원금과 함께 전달됩니다.