DeepSeek V4‑Flash 100배 저렴?|입력 $0.14·출력 $0.28의 진짜 조건

DeepSeek는 2026년 7월 31일 V4‑Flash의 정식 체크포인트 ‘DeepSeek‑V4‑Flash‑0731’을 공개하고 API 가격을 입력 100만 토큰당 0.14달러, 출력 0.28달러로 책정했습니다. 독립 평가기관 Artificial Analysis는 자사 종합 테스트 1회 평균 비용이 0.03달러로 Claude Fable 5의 3.15달러보다 약 105배 낮았다고 분석했습니다. 그러나 지능 지수는 50점이었고 향후 피크 시간 요금은 2배로 예고됐으므로, ‘가장 싸다’가 모든 업무에서 ‘가장 경제적이다’라는 뜻은 아닙니다.
핵심 요약은 무엇인가요?
- 공식 API 모델은 deepseek-v4-flash, 버전은 DeepSeek‑V4‑Flash‑0731입니다.
- 공식 가격은 캐시 미적중 입력 $0.14, 캐시 적중 입력 $0.0028, 출력 $0.28이며 모두 100만 토큰 기준입니다.
- 컨텍스트는 100만 토큰, 최대 출력은 38만4천 토큰이며 thinking·non-thinking, 도구 호출, JSON 출력과 Responses API를 지원합니다.
- Artificial Analysis의 ‘105배’는 토큰 단가가 아니라 동일한 자체 벤치마크 묶음을 실행한 평균 비용 비교입니다.
- 오픈 가중치는 MIT 라이선스로 공개됐지만 공식 예시가 4×GB300 단일 노드를 제시할 만큼 로컬 운영 장벽은 높습니다.
프리뷰와 비교해 무엇이 달라졌나요?
공식 확인: DeepSeek는 이번 0731 체크포인트가 V4‑Flash 프리뷰를 대체하는 정식 릴리스라고 밝혔습니다. 모델 카드는 에이전트 작업 능력과 DSpark 추측 디코딩을 개선했다고 설명하며, 304B 파라미터 가중치를 Hugging Face에 MIT 라이선스로 공개했습니다.
정식 릴리스의 의미는 모델 이름만 바뀐 것이 아닙니다. 개발자는 고정된 체크포인트와 가격표, 100만 토큰 컨텍스트, Responses API·Anthropic API 호환 범위를 기준으로 비용과 마이그레이션을 계산할 수 있게 됐습니다. 다만 지역별 제공 제한은 공식 가격 문서에 별도로 명시되지 않았으므로 실제 계정에서 접근 가능 여부를 확인해야 합니다.
가격·캐시·사용 제한은 어떻게 구성됐나요?
- 캐시 미적중 입력: 100만 토큰당 $0.14
- 캐시 적중 입력: 100만 토큰당 $0.0028
- 출력: 100만 토큰당 $0.28
- 동시 처리 한도: 공식 문서상 2,500
- 예고된 피크 요금: 베이징 시간 09:00~12:00, 14:00~18:00에 기본 단가의 2배. 시행일은 아직 발표되지 않음
캐시 적중 입력은 미적중보다 50분의 1 수준이지만, 모든 입력이 자동으로 이 가격을 받는다고 가정하면 안 됩니다. 반복되는 시스템 프롬프트와 동일한 긴 문맥의 캐시 적중률을 실제 로그로 측정해야 하며, 출력이 긴 추론 작업에서는 출력 비용 비중이 커집니다.
‘105배 저렴’ 비교는 어떤 조건인가요?
독립 확인: Reuters가 인용한 Artificial Analysis 평가에서 V4‑Flash의 테스트 1회 평균 비용은 $0.03, Kimi K3는 $0.86, GPT‑5.6 Sol은 $1.86, Claude Fable 5는 $3.15였습니다. 따라서 105배는 Fable 5와 같은 평가 묶음을 수행했을 때의 비용 비율이며, 공식 토큰 가격표끼리 단순 나눈 값이 아닙니다.
같은 평가에서 Artificial Analysis Intelligence Index는 V4‑Flash 50점으로 Gemini 3.6 Flash와 같았고, Kimi K3는 57점이었습니다. 상위 모델들은 9점 이상 앞섰습니다. 즉 대량 분류·요약·도구 호출처럼 50점 수준에서 충분한 작업은 가격 이점이 크지만, 한 번의 실패 비용이 높은 복잡한 연구·코딩 업무는 더 비싼 모델이 총비용을 낮출 수 있습니다.
공식 성능 주장은 어디까지 믿어야 하나요?
제조사 주장: DeepSeek 모델 카드에서 Terminal Bench 2.1 점수는 프리뷰 61.8에서 정식판 82.7로 올랐고, GLM 5.2의 81.0보다 높으며 Opus 5의 85.0보다는 낮습니다. Agents’ Last Exam은 25.2로 Opus 5의 25.7과 근접했다고 제시합니다.
평가 조건: 코드 에이전트 과제는 DeepSeek의 최소 하네스, 최대 reasoning effort, temperature 1.0, top_p 0.95 설정을 사용했습니다. 이 수치는 개발사 모델 카드의 결과이므로 독립 재현 전에는 제품 간 확정 순위가 아니라 특정 하네스와 설정에서의 참고치로 봐야 합니다.
API와 오픈 가중치 중 무엇을 선택해야 하나요?
가중치는 MIT 라이선스로 공개돼 수정·내부 배포의 자유가 큽니다. 하지만 304B 파라미터이며 공식 로컬 서빙 예시는 4개의 GB300 GPU를 갖춘 단일 노드를 제시합니다. 개인과 소규모 사업자가 ‘무료 오픈소스’라는 이유만으로 직접 호스팅하면 GPU 임대료, 운영 인력, 장애 대응이 공식 API 비용보다 훨씬 커질 수 있습니다.
민감 데이터의 폐쇄망 처리, 매우 높은 고정 사용량, 모델 수정이 필수라면 자가 호스팅을 검토할 수 있습니다. 일반적인 뉴스 수집·요약·분류에서는 먼저 API로 품질과 토큰 사용량을 측정하고, 데이터 정책이 맞지 않을 때만 로컬 배포의 총소유비용을 비교하는 편이 현실적입니다.
실제 월 비용은 얼마나 달라지나요?
한 달에 캐시 미적중 입력 1억 토큰과 출력 2천만 토큰을 사용한다고 가정하면 V4‑Flash는 입력 $14와 출력 $5.60을 합쳐 $19.60입니다. 같은 토큰량을 OpenAI 공식 가격표의 GPT‑5.6 Luna에 적용하면 입력 $20와 출력 $24로 $44, Terra는 입력 $200와 출력 $240로 $440입니다.
이 계산은 작업 성공률과 재시도 횟수를 제외한 명목 토큰 비용입니다. V4‑Flash가 같은 결과를 내기 위해 더 긴 추론이나 반복 검증을 요구하면 격차는 줄고, 반복 프롬프트가 캐시에 많이 적중하면 다시 커집니다. 예고된 피크 요금이 시행되면 해당 시간대 V4‑Flash 기본 단가도 두 배가 됩니다.
시장과 개발자 생태계에는 어떤 영향이 있나요?
분석: 이번 가격은 중급 지능 모델의 원가 기준을 크게 낮추며, 경쟁사를 토큰 단가뿐 아니라 캐시 정책과 에이전트 한 작업당 비용으로 비교하게 만듭니다. 오픈 가중치와 저가 공식 API를 동시에 제공하는 전략은 개발자가 먼저 API로 제품을 만들고 규모가 커지면 자체 배포로 이동할 선택권도 줍니다.
반면 ‘벤치마크 1회 3센트’가 실제 고객 요청 한 건의 비용을 뜻하지는 않습니다. 프롬프트 길이, 도구 호출 횟수, 재시도, 검증 모델, 지연시간과 실패율을 포함한 작업 단위 비용으로 측정해야 합니다.
개인·소규모 사업자와 ALLONE HUB에는 무엇이 달라지나요?
개인은 긴 문서 분석과 반복 요약을 훨씬 낮은 비용으로 시험할 수 있고, 소규모 사업자는 분류·초안·데이터 정리처럼 사람이 검수할 수 있는 업무부터 적용하기 좋습니다. 고객 대응이나 법률·금융 판단처럼 오류 비용이 큰 업무는 낮은 단가보다 정확도 검증과 사람의 승인이 우선입니다.
ALLONE HUB의 AI 뉴스 자동화에는 V4‑Flash를 후보 수집·중복 분류·초안 보조에 적용할 경제성이 생겼습니다. 다만 공식 원문 검증과 최종 발행 승인은 별도 단계로 유지하고, 모델별 ‘요청당 토큰’이 아니라 ‘검증을 통과한 기사 1건당 총비용·재시도율’을 기록해야 실제 절감 여부를 판단할 수 있습니다.
도입 전에 무엇을 확인해야 하나요?
- 대표 업무 50~100건으로 성공률·재시도·지연시간을 함께 측정합니다.
- 캐시 적중률과 thinking 출력 길이를 실제 로그에서 분리합니다.
- 피크 시간 2배 요금 시행 여부와 작업 예약 시간을 확인합니다.
- 중요 업무는 더 강한 모델 또는 사람 검수와 라우팅합니다.
- 자가 호스팅은 GPU·전력·운영 인력까지 포함한 월 총비용으로 비교합니다.
확인한 자료
- DeepSeek 공식 가격·모델 사양
- DeepSeek 공식 모델 카드·가중치
- DeepSeek Responses API 문서
- Reuters의 Artificial Analysis 교차검증
- OpenAI 공식 API 가격표
관련 AI 뉴스
FAQ
DeepSeek V4‑Flash의 공식 입력·출력 가격은 얼마인가요?
캐시 미적중 입력은 100만 토큰당 $0.14, 캐시 적중 입력은 $0.0028, 출력은 $0.28입니다.
Claude보다 105배 저렴하다는 뜻은 무엇인가요?
Artificial Analysis의 동일 벤치마크 묶음을 실행한 평균 비용이 $0.03 대 $3.15였다는 뜻입니다. 공식 토큰 단가의 단순 비교가 아닙니다.
오픈소스이므로 개인 PC에서 무료로 실행할 수 있나요?
가중치는 MIT 라이선스로 공개됐지만 304B 모델이라 요구 하드웨어가 매우 큽니다. 개인·소규모 사용자는 공식 API가 대체로 현실적입니다.
가장 싼 모델이면 모든 업무에 쓰는 것이 좋은가요?
아닙니다. 오류 비용과 재시도 횟수까지 포함해 비교해야 하며, 복잡한 고위험 업무는 더 강한 모델이나 사람 검수가 총비용을 낮출 수 있습니다.
← 허브로 돌아가기