DeepSeek V4는 구독형 코딩 에이전트, 직접 API 키, 게이트웨이의 세 가지 채널로 판매되며, 채널마다 가격이 다릅니다. 각 채널은 어떤 모델 체크포인트가 트래픽을 처리하는지에 대한 보장 수준도 서로 다릅니다. 2026년 8월 16일, 바로 그 체크포인트 차이가 비용 측면에서 결정적인 문제가 되었습니다. DeepSeek이 V4 가격을 변경하자 리셀러들이 일제히 가격을 조정했고, 쏟아진 불만 스레드는 대부분의 고객이 실제로 무엇을 사는지 제대로 이해하지 못하고 있었음을 보여줬습니다.

2026년 8월 16일, DeepSeek V4 가격에 어떤 변화가 있었나요?

DeepSeek은 8월 16일 16:00 UTC에 V4 제품군을 피크·오프피크 티어로 전환했습니다. 피크 시간대는 01:00–04:00 및 06:00–10:00 UTC이며, 해당 시간대에는 오프피크 요금의 정확히 두 배가 청구됩니다. 오프피크 기준 V4 Flash는 캐시 히트 입력, 캐시 미스 입력, 출력 각각 백만 토큰당 $0.007 / $0.22 / $0.66이고, 피크 시간대에는 이 수치가 두 배가 됩니다. V4 Pro 오프피크는 $0.022 / $0.66 / $1.98입니다.

가장 큰 주목을 받은 것은 캐시 히트 가격 급등이었습니다. InfoWorld는 특정 요금에서 10배를 초과하는 인상을 보도했습니다. V4 Pro의 오프피크 캐시 히트 가격은 6배 이상, 피크 요금은 12배 이상 상승했습니다. DeepSeek은 그동안 캐시 히트를 약 98% 할인해 왔는데, 이는 업계 평균인 약 90%보다 훨씬 높은 수준이었습니다. 따라서 에이전트 청구서의 상당 부분이 거의 제로에 가까운 캐시 읽기 비용으로 채워지고 있었던 셈입니다.

이 격차 때문에 가격 변경이 채팅 인터페이스보다 코딩 에이전트에 훨씬 큰 타격을 주었습니다. 에이전트는 매 턴마다 긴 시스템 프롬프트와 점점 길어지는 대화 히스토리를 다시 전송합니다. 입력 토큰의 대부분이 캐시 히트에 해당하는 구조입니다. 캐시 히트 가격 인상이 에이전트에 직격탄이 된 이유입니다.

OpenCode Go가 DeepSeek 한도를 축소한 이유는?

OpenCode Go는 월 $10이며, 처음에는 최대 $60 상당의 총 모델 사용량을 포함한다고 홍보되었습니다. DeepSeek이 새로운 요금을 발표한 후, 같은 $10으로 살 수 있는 토큰이 크게 줄었습니다. OpenCode는 수 시간 내에 한도를 축소했습니다. V4 Flash는 50% 줄어 월 $30이 되었고, V4 Pro는 75% 줄어 $15가 되었습니다.

r/opencode에서 반응은 즉각적이었습니다. “Bye bye OpenCode Go”라는 제목의 게시물이 315업보트와 댓글 108개를 받았고, Flash 예산에 대한 별도 스레드는 173업보트를 기록했습니다. 다음 날 OpenCode는 Flash 한도를 다시 올렸고, CEO의 공개 설명 글은 1,517업보트를 기록하며 그 주 가장 많은 업보트를 받은 게시물이 되었습니다.

이 메커니즘은 모든 정액제 리셀러에 동일하게 적용됩니다. 종량제 업스트림 용량을 재판매하는 구독 모델은 업스트림 가격 변동 리스크를 리셀러가 떠안는 구조입니다. 업스트림이 가격을 10배 올리면, 리셀러는 마진을 흡수하거나, 가격을 올리거나, 한도를 줄여야 합니다. OpenCode는 하루도 안 되어 공개적으로 한도를 축소했는데, 이는 대부분의 리셀러보다 빠르고 솔직한 대응이었습니다. 구매자 입장에서는 여전히 분명한 트레이드오프가 있습니다. 정액제는 결국 다른 누군가의 비용 구조에 가격이 연동된 셈이고, 그 구조는 언제든 바뀔 수 있습니다.

진짜 DeepSeek V4 Flash를 받고 있는 건가요?

문제는, 확실히 알 방법이 없다는 점입니다.

DeepSeek V4 Flash는 양자화 인식 학습(quantization-aware training) 방식으로 구축된 모델입니다. 라우팅된 전문가—모델의 약 96%—는 MXFP4를 기본 정밀도로 사용하고, 나머지 파라미터는 FP8 또는 BF16을 사용합니다. 이 아키텍처 덕분에 공개된 가중치가 광고된 성능을 그대로 발휘할 수 있습니다. 그런데 많은 서버리스 프로바이더가 이 기본 정밀도 위에 액티베이션을 fp8로 추가 양자화하여 자체 서빙 비용을 낮춥니다. 그 결과는 ZenMux의 벤치마크 분석에 정리되어 있습니다. 응답이 참조 가중치에서 벗어나고, 동일한 모델명을 서빙하는 두 프로바이더가 측정 가능한 수준으로 다른 결과를 반환합니다.

이 메커니즘 덕분에 “같은 프롬프트인데 답변이 다르다”는 불만에 테스트 가능한 설명이 생겼고, 단순한 일화 차원을 넘어설 수 있게 되었습니다. 동시에 더 날카로운 질문도 제기됩니다. OpenCode 리포지토리에는 미해결 이슈 #40409가 있는데, Go의 deepseek-v4-flash이 2025년 5월 지식 컷오프를 가진 DeepSeek V3.2로 자체 식별한다는 보고가 기록되어 있습니다. 반면 사용량은 V4 Flash 쿼터로 청구됩니다. 이는 확인된 사실이 아니라 미해결 이슈에 대한 한 사용자의 보고로 취급해야 합니다. 자체 식별은 신뢰할 수 없는 증거입니다. 모델은 서빙 스택이 아니라 학습 데이터에서 자기 버전을 학습하기 때문입니다. 해당 이슈는 여전히 열려 있고 구체적이며, 반박은 공개되지 않았습니다.

이 실질적인 교훈은 이슈가 어떻게 해결되든 유효합니다. 재현성을 확보하려면 어떤 체크포인트와 어떤 정밀도가 각 요청을 서빙했는지를 공개하는 프로바이더를 선택해야 합니다. 대부분의 구독 서비스는 이 정보를 공개하지 않습니다. 업스트림 간 풀링 라우팅이 정액제를 지속 가능하게 만드는 핵심이기 때문입니다.

실제로 서빙되는 모델을 확인하세요

DeepSeek V4를 구매하는 세 가지 방법 비교

코딩 에이전트 구독DeepSeek 직접 API게이트웨이
과금 방식정액 월 요금, 한도 설정된 쿼터종량제, 피크/오프피크 분리종량제, 프로바이더 간 단일 키
체크포인트 보장보통 공개되지 않음참조 가중치, 자체 제공상이함; 계약 전 확인 필요
가격 변동 리스크리셀러가 흡수 후 한도 조정본인이 직접 부담다른 업스트림으로 라우팅 변경
모델 범위큐레이션된 목록DeepSeek 전용수백 개 모델
최적 용도간헐적 탐색 코딩재현 가능한 오프피크 배치 작업멀티모델 프로덕션 트래픽

구매자는 더 이상 예전처럼 무시하고 넘어갈 수 없습니다. 가격과 모델 범위는 랜딩 페이지만 봐도 쉽게 비교할 수 있습니다. 하지만 모델 출처는 기본적으로 어디에도 공개되지 않으며, 바로 이 축이 이번 달에 결정적으로 바뀌었습니다.

DeepSeek V4, 어떻게 액세스해야 하나요?

광고된 요금이 아니라 워크로드에 필요한 보장에 따라 선택하세요.

  • haimaker.ai — DeepSeek V4와 수백 개의 다른 모델을 하나의 OpenAI 호환 엔드포인트로 제공하며, 요청별 비용 로깅이 내장되어 있습니다. 프로바이더가 가격을 변경하면 커뮤니티 포럼 게시물이 아닌 내 텔레메트리에서 바로 확인할 수 있습니다. 게이트웨이의 넓은 모델 범위가 필요하면서도 라우팅을 검사할 수 있어야 할 때 적합합니다. AI API 게이트웨이 페이지에서 라우팅 모델을 상세히 다룹니다.
  • DeepSeek 자체 API — 참조 구현이며, 체크포인트를 확실하게 확인할 수 있는 유일한 소스입니다. 추론을 오프피크 시간대로 옮길 수 있는 워크로드에 적합하며, Flash 출력은 백만 토큰당 $0.66입니다.
  • OpenCode Go 및 유사 구독 — 고정 월 비용으로 간헐적 워크로드에 적합합니다. 8월 토론 스레드에서 여러 사용자가 축소된 주간 한도조차 소진하기 어렵다고 보고했습니다. 트레이드오프는 명확합니다. 어떤 체크포인트를 받고 있는지 검증할 수 없습니다.
  • 기타 게이트웨이 — OpenRouter는 80개 이상 프로바이더의 400개 이상 모델을 라우팅하며 명시적 라우팅 모드를 제공합니다. 다만 통합이 가속화되고 있습니다. Stripe가 8월 16일에 $7B 이상으로 OpenRouter를 인수하기로 합의했는데, 이는 3개월 전 Series B 밸류에이션 대비 5.4배에 달하는 금액입니다.

프로바이더를 이미 선택했고 설정 세부 사항만 필요한 경우, OpenCode에서 DeepSeek 설정 가이드에 프로바이더 블록과 일반적인 /models 실패 모드가 정리되어 있습니다. 어떤 저비용 API가 키를 발급받을 가치가 있는지에 대한 더 넓은 질문은 가장 저렴한 AI API 키에서 프론티어 가격 아래 티어를 다루며, OpenRouter 대안 비교에서 게이트웨이를 정면으로 비교합니다.

다음 가격 변경 전에 무엇을 해야 하나요?

DeepSeek은 한 달 안에 두 번 가격을 변경했습니다. 피크·오프피크 티어 도입은 이익 마진이 아닌 가용 용량이 이 제약을 주도하고 있음을 보여줍니다. 당시 OpenCode 엔지니어의 해석에 따르면, 이번 인상은 재정적 어려움이 아니라 트래픽 관리를 반영한 것이었습니다. 이 설명이 맞다면, 앞으로의 가격 변경은 이전 요금으로의 회귀가 아니라 스케줄링에 의해 좌우될 것입니다.

최소한의 준비는 자체 인프라에서 요청별 비용을 로깅하는 것입니다. 그러면 다음 요금 조정이 Reddit 스레드에 등장하기 전에 내 메트릭에서 먼저 포착할 수 있습니다. 모델명과 기본 URL을 하드코딩하지 않고 설정 파일에 넣어 두면 전환 마찰도 줄어듭니다. 업스트림 전환이 코드베이스 리팩토링이 아닌 단순 배포로 처리되기 때문입니다. 그다음 핵심 아키텍처 질문은 워크로드가 실제로 검증된 체크포인트를 요구하는지 여부입니다. 이 하나만 정리되면 나머지 결정은 표준적인 가격 비교로 단순화됩니다.

하나의 제한 사항이 남아 있습니다. 현재로서는 이러한 세부 사항을 요청 단위로 외부에서 검증할 수 없습니다. 주요 프로바이더 중 어느 곳도 API 응답에 서빙 정밀도나 체크포인트 해시를 포함하지 않습니다. 이것이 바뀌기 전까지는, 모델 출처를 확인하는 방법은 독립적 검사가 아니라 벤더에게 직접 묻는 것뿐입니다.

DeepSeek과 모든 모델을 하나의 키로

자주 묻는 질문

OpenCode Go가 DeepSeek API보다 저렴한가요?

간헐적이고 탐색적인 작업에는 정액 월 구독이 합리적입니다. 고정 비용이 종량제 과금이라면 페널티를 받을 사용량 급증을 흡수해 주기 때문입니다. 다만 지속적인 대량 로드에서는 직접 API가 더 저렴한 경향이 있으며, 특히 오프피크 시간대에 그렇습니다. 또한 특정 요청을 실제로 처리한 체크포인트를 확인할 수 있는 유일한 경로이기도 합니다.

프로바이더마다 DeepSeek V4 Flash의 답변이 다른 이유는 무엇인가요?

DeepSeek V4 Flash는 양자화 인식 학습된 가중치를 제공하며, 라우팅된 전문가는 MXFP4를 기본 정밀도로 사용하고 나머지는 FP8 또는 BF16에 위치합니다. 많은 서버리스 프로바이더가 서빙 비용을 줄이기 위해 액티베이션에 추가 fp8 양자화 패스를 적용하는데, 이로 인해 출력이 공개된 참조 가중치에서 벗어나게 됩니다. 실질적으로, 동일한 모델명을 내세우는 두 프로바이더가 측정 가능한 수준으로 다른 결과를 반환할 수 있습니다.

2026년 8월 DeepSeek V4 가격에 어떤 변화가 있었나요?

피크 및 오프피크 요금제가 2026년 8월 16일 16:00 UTC에 적용되었습니다. 피크 시간대는 01:00–04:00 및 06:00–10:00 UTC이며, 요금은 오프피크 가격의 정확히 두 배로 설정됩니다. 캐시 히트 입력이 가장 큰 폭으로 인상되어 특정 티어에서 약 1,100%까지 상승했으며, 프롬프트 캐싱에 의존하는 에이전트 워크로드에 가장 큰 부담을 줍니다.