MOBLING

AI 모델 캐시 실효 단가

모델 정가표는 어디에나 있습니다. 없는 것은 «에이전트 루프에서 실제로 얼마가 나가는가» 입니다. 반복 컨텍스트가 원가의 대부분을 차지하는 실사용에서는 프롬프트 캐시가 먹는지에 따라 같은 모델이 5~20배 갈립니다. 우리는 그것을 직접 재서 여기에 공개합니다.

4
우리가 직접 잰 모델
403
카탈로그 수록 모델
0
선언과 실측이 어긋난 모델

어떻게 쟀나

같은 프리픽스로 예열 1회 + 반복 N회를 호출하고, 반복 중 최저 비용 회차를 정상 상태로 봅니다. 캐시는 되거나 안 되거나가 아니라 콜드·웜이 섞이므로 «N회 중 몇 번 걸렸나»를 함께 표기합니다. 실효 입력단가 = 정상 상태 비용 ÷ 그 회차 입력토큰 × 100만.

회차원가 환산 기준(실사용 프로파일): 입력 484 · 출력 13,570 · 캐시읽기 3,072,894 · 평균 34.4턴

실측 완료 — 회차원가가 싼 순

모델컨텍스트정가 입력 /M정가 출력 /M캐시 선언캐시 실측실효 입력단가 /M회차원가 환산
deepseek/deepseek-v4-flash1M$0.140$0.280있음먹음2/3$0.028-80%$0.105
qwen/qwen3-coder-flash1M$0.195$0.975있음먹음2/3$0.043-78%$0.154
qwen/qwen3-coder-plus1M$0.650$3.250있음먹음3/3$0.144-78%$0.515
moonshotai/kimi-k31M$3.000$15.000있음먹음2/3$0.769-74%$1.454

카탈로그 (아직 실측 전)

모델컨텍스트정가 입력 /M정가 출력 /M캐시 선언
cohere/north-mini-code:free256K$0.000$0.000
google/gemma-4-26b-a4b-it:free262K$0.000$0.000
google/gemma-4-31b-it:free262K$0.000$0.000
google/lyria-3-clip-preview1M$0.000$0.000
google/lyria-3-pro-preview1M$0.000$0.000
inclusionai/ling-3.0-tiny:free262K$0.000$0.000
nvidia/nemotron-3.5-content-safety:free128K$0.000$0.000
nvidia/nemotron-3.5-lightning:free1M$0.000$0.000
nvidia/nemotron-3-nano-30b-a3b:free256K$0.000$0.000
nvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free256K$0.000$0.000
nvidia/nemotron-3-super-120b-a12b:free262K$0.000$0.000
nvidia/nemotron-3-ultra-550b-a55b:free1M$0.000$0.000
nvidia/nemotron-nano-12b-v2-vl:free128K$0.000$0.000
nvidia/nemotron-nano-9b-v2:free128K$0.000$0.000
openai/gpt-oss-20b:free131K$0.000$0.000
openrouter/free200K$0.000$0.000
poolside/laguna-s-2.1:free262K$0.000$0.000
poolside/laguna-xs-2.1:free262K$0.000$0.000
inclusionai/ling-2.6-flash262K$0.010$0.030있음
ibm-granite/granite-4.0-h-micro131K$0.017$0.112
mistralai/mistral-nemo131K$0.019$0.030
inclusionai/ling-3.0-flash262K$0.021$0.063있음
nex-agi/nex-n2-mini262K$0.025$0.100있음
openai/gpt-5-nano:batch400K$0.025$0.200있음
meta-llama/llama-3.2-1b-instruct60K$0.027$0.201
openai/gpt-oss-20b131K$0.030$0.130있음
qwen/qwen3.7-flash1M$0.030$0.130있음
upstage/solar-pro4524K$0.030$0.120있음
amazon/nova-micro-v1128K$0.035$0.140
openai/gpt-oss-120b131K$0.037$0.170
cohere/command-r7b-12-2024128K$0.037$0.150
sao10k/l3-lunaris-8b8K$0.040$0.050
qwen/qwen3-30b-a3b-instruct-2507262K$0.048$0.193
google/gemini-2.5-flash-lite:batch1M$0.050$0.200있음
google/gemma-3-12b-it131K$0.050$0.150
google/gemma-3-4b-it131K$0.050$0.100
ibm-granite/granite-4.1-8b131K$0.050$0.100있음
meta-llama/llama-3.1-8b-instruct131K$0.050$0.080있음
meta-llama/llama-3.2-3b-instruct131K$0.050$0.330
mistralai/mistral-small-24b-instruct-250133K$0.050$0.080
nvidia/nemotron-3-nano-30b-a3b262K$0.050$0.200있음
openai/gpt-4.1-nano:batch1M$0.050$0.200있음
openai/gpt-5-nano400K$0.050$0.400있음
amazon/nova-lite-v1300K$0.060$0.240
google/gemma-3n-e4b-it33K$0.060$0.120
gryphe/mythomax-l2-13b8K$0.060$0.060
poolside/laguna-xs-2.1262K$0.060$0.120있음
z-ai/glm-4.7-flash203K$0.060$0.400있음
tencent/hy3-preview262K$0.063$0.210있음
qwen/qwen3.5-flash-02-231M$0.065$0.260
microsoft/phi-416K$0.070$0.140
qwen/qwen3-coder-30b-a3b-instruct262K$0.070$0.280
bytedance-seed/seed-1.6-flash262K$0.075$0.300
inclusionai/ling-2.6-1t262K$0.075$0.625있음
inclusionai/ring-2.6-1t262K$0.075$0.625있음
openai/gpt-4o-mini:batch128K$0.075$0.300있음
openai/gpt-oss-safeguard-20b131K$0.075$0.300있음
~deepseek/deepseek-v4-flash-latest1M$0.080$0.252있음
deepseek/deepseek-v4-flash-07311M$0.080$0.180있음
google/gemma-3-27b-it262K$0.080$0.450있음

카탈로그 최종 동기화: 2026-08-11 13:16 UTC