DeepSeek V4 se vende a través de tres canales con precios distintos: agentes de programación por suscripción, claves API directas y gateways. Cada canal ofrece además una garantía distinta sobre qué checkpoint gestiona el tráfico. El 16 de agosto de 2026, esa diferencia de checkpoint se convirtió en la más costosa. Cuando DeepSeek cambió los precios de V4, los revendedores ajustaron los suyos al unísono. La oleada de hilos de quejas que siguió reveló que la mayoría de los clientes comprendía muy poco lo que realmente estaban comprando.

¿Qué cambió en los precios de DeepSeek V4 el 16 de agosto de 2026?

DeepSeek pasó la familia V4 a tarifas de punta y valle a las 16:00 UTC del 16 de agosto. Las franjas de punta van de 01:00 a 04:00 y de 06:00 a 10:00 UTC, y facturan exactamente el doble de la tarifa de valle. V4 Flash en valle cuesta $0,007 / $0,22 / $0,66 por millón de tokens para entrada con acierto de caché, entrada sin acierto de caché y salida, respectivamente; las horas de punta duplican esas cifras. V4 Pro en valle se sitúa en $0,022 / $0,66 / $1,98.

La atención se concentró en el salto de los aciertos de caché. InfoWorld informó de incrementos superiores a 10x en ciertas tarifas. El precio de acierto de caché en valle para V4 Pro subió más de seis veces, y la tarifa de punta subió más de doce veces. DeepSeek había descontado los aciertos de caché en aproximadamente un 98 %, muy por encima de la norma del sector, más cercana al 90 %. Una gran parte de la factura de cada agente era, por tanto, lecturas de caché facturadas a un coste casi nulo.

Esa brecha explica por qué el cambio de precios afectó más a los agentes de programación que a las interfaces de chat. Un agente reenvía un prompt de sistema extenso más un historial de conversación creciente en cada turno, de modo que la mayoría de sus tokens de entrada se cuentan como aciertos de caché. La subida del precio de los aciertos de caché afectó especialmente a los agentes.

¿Por qué OpenCode Go recortó sus límites de DeepSeek?

OpenCode Go cuesta $10 al mes y en su lanzamiento se anunció que cubría hasta $60 de uso agregado de modelos. Cuando DeepSeek publicó las nuevas tarifas, los mismos $10 compraban significativamente menos tokens. OpenCode recortó sus límites en cuestión de horas: V4 Flash cayó un 50 % hasta $30 al mes, y V4 Pro cayó un 75 % hasta $15.

En r/opencode la reacción llegó rápidamente. Una publicación titulada “Bye bye OpenCode Go” obtuvo 315 votos positivos y 108 comentarios, mientras que un hilo aparte sobre el presupuesto de Flash sumó 173. Al día siguiente, OpenCode restauró el límite de Flash, y la explicación pública del CEO alcanzó 1.517 puntos, convirtiéndose en la publicación más votada de la semana.

Las mismas dinámicas se aplican a cualquier revendedor de tarifa plana. Una suscripción que revende capacidad upstream de pago por uso asume el riesgo de precio del upstream en su balance. Si el upstream multiplica sus precios por 10, el revendedor absorbe el margen, sube el precio o recorta el límite. OpenCode recortó el límite públicamente en menos de un día, más rápido y con más transparencia que la mayoría. Los compradores siguen enfrentándose a una disyuntiva clara: una tarifa plana depende de la estructura de costes de un tercero, y esa estructura puede cambiar.

¿Estás obteniendo el verdadero DeepSeek V4 Flash?

Lo incómodo es la falta de certeza.

DeepSeek V4 Flash se construye mediante entrenamiento con cuantización consciente. Los expertos enrutados, aproximadamente el 96 % del modelo, residen nativamente en MXFP4; los parámetros restantes usan FP8 o BF16. Esa arquitectura es lo que permite que los pesos publicados ofrezcan el comportamiento anunciado. Muchos proveedores serverless cuantizan después las activaciones a fp8 sobre esa precisión nativa, reduciendo sus propios costes de servicio. La consecuencia la describe el análisis de benchmarks de ZenMux: las respuestas se desvían de los pesos de referencia, y dos proveedores que sirven el mismo nombre de modelo devuelven resultados que difieren de forma medible.

El mismo mecanismo proporciona a las quejas de “mismo prompt, respuesta diferente” una explicación verificable y las saca del terreno de la anécdota. También plantea una pregunta más incisiva. El repositorio de OpenCode tiene un issue abierto, #40409, que registra un informe según el cual el deepseek-v4-flash de Go se identifica a sí mismo como DeepSeek V3.2 con fecha de corte de conocimiento de mayo de 2025, mientras que el uso se factura contra la cuota de V4 Flash. Tómalo como el informe de un usuario sobre un issue no resuelto, no como un hallazgo confirmado. La autoidentificación es una prueba poco fiable: un modelo aprende su propia versión de los datos de entrenamiento, no del stack de servicio. El issue sigue abierto y es específico, y no se ha publicado ninguna refutación.

Esa lección práctica se mantiene independientemente de cómo se resuelva el issue. La reproducibilidad requiere un proveedor que revele qué checkpoint y qué precisión sirvió cada petición. La mayoría de las suscripciones omiten esa información, porque el enrutamiento agrupado entre upstreams es lo que hace sostenible la tarifa plana.

DESCUBRE QUÉ TE ESTÁN SIRVIENDO REALMENTE

¿Cómo se comparan las tres formas de comprar DeepSeek V4?

Suscripción de agente de programaciónAPI directa de DeepSeekGateway
FacturaciónTarifa plana mensual, cuota limitadaPor consumo, división punta/vallePor consumo, una clave para varios proveedores
Garantía de checkpointNormalmente no se revelaPesos de referencia, del propio desarrolladorVariable; preguntar antes de comprometerse
Exposición a cambios de precioEl revendedor absorbe y luego ajusta límitesLa absorbes directamenteRedirigir a otro upstream
Amplitud de modelosLista curadaSolo DeepSeekCientos de modelos
Ideal paraProgramación exploratoria en ráfagasTrabajo reproducible y por lotes en valleTráfico de producción multimodelo

Los compradores ya no pueden ignorar la fila de la tabla que antes descartaban. El precio y la amplitud son triviales de evaluar en una landing page. La procedencia no se revela por defecto en ningún sitio, y es el eje que ha cambiado este mes.

¿Cómo deberías acceder a DeepSeek V4?

Elige en función de la garantía que necesite tu carga de trabajo, no según la tarifa anunciada.

  • haimaker.ai — un endpoint compatible con OpenAI que sirve DeepSeek V4 más cientos de otros modelos, con registro de coste por petición integrado. Un cambio de precio del proveedor aparece entonces en tu propia telemetría en lugar de en una publicación de un foro comunitario. Elígelo cuando quieras la amplitud de un gateway y necesites que el enrutamiento siga siendo inspeccionable. La página del gateway de API de IA cubre el modelo de enrutamiento en detalle.
  • La propia API de DeepSeek — la implementación de referencia, y la única fuente que permite confirmar el checkpoint con certeza. Se adapta a cargas de trabajo que pueden mover la inferencia a franjas de valle, donde la salida de Flash cuesta $0,66 por millón de tokens.
  • OpenCode Go y suscripciones similares — se adaptan a cargas de trabajo en ráfagas con un coste mensual fijo. Varios usuarios en los hilos de discusión de agosto reportaron dificultades para agotar incluso los límites semanales reducidos. La contrapartida: qué checkpoint recibes no puede verificarse.
  • Otros gateways — OpenRouter enruta entre más de 400 modelos de más de 80 proveedores y expone modos de enrutamiento explícitos. No obstante, la consolidación se está acelerando: Stripe acordó adquirir OpenRouter por más de $7.000 millones el 16 de agosto, un múltiplo de 5,4x sobre su valoración de Serie B de tres meses antes.

Cuando ya se ha elegido un proveedor y solo se necesitan detalles de configuración, la guía de configuración de DeepSeek en OpenCode contiene el bloque de proveedor junto con los fallos comunes de /models. Sobre la cuestión más amplia de qué API de bajo coste merece una clave, la clave de API de IA más barata cubre el nivel por debajo de los precios de los modelos de vanguardia, y alternativas a OpenRouter compara los gateways frente a frente.

¿Qué deberías hacer antes del próximo cambio de precios?

DeepSeek cambió sus precios dos veces en un mes. Los niveles de punta y valle indican que la capacidad disponible, y no los márgenes de beneficio, impulsa esta restricción. La lectura de un ingeniero de OpenCode en ese momento fue que el aumento reflejaba gestión de tráfico y no dificultades financieras. Si esa explicación se mantiene, los próximos cambios de precio estarán determinados por la programación de capacidad y no por una vuelta a las tarifas anteriores.

La preparación de mínimo esfuerzo consiste en registrar el coste de cada petición en tu propia infraestructura. El siguiente ajuste de tarifa aparece entonces en tus métricas antes de que aparezca en un hilo de Reddit. Poner el nombre del modelo y la URL base en archivos de configuración en lugar de codificarlos también reduce la fricción, de modo que un cambio de upstream es un despliegue y no una refactorización del código. Después de eso, la pregunta arquitectónica crítica es si la carga de trabajo requiere realmente un checkpoint verificado. Resolver esa única cuestión convierte las decisiones restantes en una comparación de precios estándar.

Queda una limitación: estos detalles no pueden verificarse externamente en la actualidad petición a petición. Ningún proveedor importante incluye la precisión de inferencia ni un hash de checkpoint en sus respuestas de API. Hasta que eso cambie, confirmar la procedencia significa preguntar directamente al proveedor en lugar de confiar en una inspección independiente.

OBTÉN UNA CLAVE PARA DEEPSEEK Y TODO LO DEMÁS

Preguntas frecuentes

¿Es OpenCode Go más barato que la API de DeepSeek?

Para trabajo en ráfagas y exploratorio, una suscripción mensual de tarifa plana tiene sentido: el coste fijo absorbe los picos de uso que la facturación por consumo penalizaría. Bajo carga sostenida de alto volumen, la API directa tiende a ser más barata, especialmente en las franjas de valle. Además, es la única vía que permite confirmar qué checkpoint gestionó realmente una petición concreta.

¿Por qué las respuestas de DeepSeek V4 Flash difieren entre proveedores?

DeepSeek V4 Flash se distribuye con pesos entrenados con cuantización consciente, manteniendo los expertos enrutados nativamente en MXFP4 mientras el resto permanece en FP8 o BF16. Muchos proveedores serverless aplican una pasada adicional de cuantización fp8 a las activaciones para reducir el coste de servicio, lo que desplaza las salidas respecto a los pesos de referencia publicados. En la práctica, dos proveedores que listan el mismo nombre de modelo pueden devolver resultados que difieren de forma medible.

¿Qué cambió en los precios de DeepSeek V4 en agosto de 2026?

Los precios de punta y valle entraron en vigor a las 16:00 UTC del 16 de agosto de 2026. Las franjas de punta van de 01:00 a 04:00 y de 06:00 a 10:00 UTC, con tarifas exactamente el doble del precio de valle. La entrada con acierto de caché experimentó la mayor subida, hasta aproximadamente un 1.100 % en ciertos niveles, lo que supone la mayor carga para las cargas de trabajo de agentes que dependen de la caché de prompts.