DeepSeek V4 ufficiale: prezzi dinamici e contesto da 1 milione di token per l'AI cinese
DeepSeek rilascia V4 in versione GA con struttura peak-valley pricing. V4-Pro a 12 yuan per milione di token in fascia oraria di punta, ma resta 17 volte più economico di GPT-5.5.
Il 13 luglio 2026 DeepSeek ha rilasciato la versione GA (General Availability) di V4, il suo modello linguistico di punta, segnando non solo un traguardo tecnico ma un punto di svolta nel mercato globale dell'AI. La novità più discussa è l'introduzione di una struttura di prezzi dinamici - chiamata peak-valley pricing (tariffazione picco-valle) - che raddoppia il costo durante le fasce orarie di maggiore utilizzo a Pechino.
Un rilascio atteso da mesi
DeepSeek V4 era in preview dal 24 aprile 2026, quando era stato rilasciato con licenza MIT e pesi open-source su Hugging Face in due versioni: V4-Pro (1,6 trilioni di parametri, 49 miliardi attivi) e V4-Flash (284 miliardi di parametri, 13 miliardi attivi). Entrambi condividono un contesto da 1 milione di token - sufficiente per elaborare l'intera trilogia de I Tre Corpi in una sola sessione - e un'architettura Mixture-of-Experts (MoE) che attiva solo una frazione dei parametri per ogni richiesta, garantendo efficienza.
La finestra di contesto da 1 milione di token posiziona DeepSeek V4 tra i modelli con la più lunga capacità di elaborazione nel panorama AI globale, competendo direttamente con Gemini 3.1 Pro e Claude Opus 4.8, entrambi nell'ordine del milione di token.
Come funziona il peak-valley pricing
Dal 13 luglio, DeepSeek applica una tariffazione dinamica basata sull'orario di Pechino (CST, UTC+8):
- 🔴 Fascia peak (09:00-12:00 e 14:00-18:00, 7 ore al giorno): V4-Pro output a 12 yuan (~$1,71) per milione di token
- 🟢 Fascia off-peak (restanti 17 ore): V4-Pro output a 6 yuan (~$0,86) per milione di token
- V4-Flash segue lo stesso schema: ~$0,56 in peak, ~$0,28 in off-peak
DeepSeek stessa paragona il sistema alle fasce tariffarie dell'elettricità: l'obiettivo dichiarato è distribuire il carico sulle API, non un mero aumento. La promessa? Almeno 24 ore di preavviso prima di ogni modifica tariffaria.
Per l'Italia (CEST, UTC+2), le fasce peak cadono alle 03:00-06:00 e 08:00-12:00 - la mattinata lavorativa italiana finisce in fascia maggiorata. Per la East Coast USA sono perlopiù in orario serale.
Vantaggio competitivo immutato
Anche a prezzo maggiorato, DeepSeek V4-Pro resta 17 volte più economico di GPT-5.5 ($30 per milione di token in output) e 14 volte più di Claude Opus 4.8 ($25). Un rapporto qualità-prezzo che ha già innescato una guerra dei prezzi senza precedenti nel mercato cinese dell'AI: Alibaba, Baidu, ByteDance e Tencent hanno tagliato i prezzi dei loro LLM del 75-97% per non perdere terreno.
Sul fronte delle prestazioni, i benchmark sono impressionanti: SWE-bench Verified all'80,6% (contro il 77,2% di GPT-5.4), LiveCodeBench al 93,5%, e un rating Codeforces di 3206 - il primo modello open-source a raggiungere la vetta della classifica. V4-Pro è testa a testa con Claude Opus 4.6 Max (80,6% contro 80,8%).
DSpark e l'ecosistema hardware
Il 27 giugno DeepSeek ha rilasciato anche DSpark, un framework di speculative decoding sviluppato con l'Università di Pechino che accelera l'inferenza del 60-85% su V4-Flash e V4-Pro. Il framework è open-source e compatibile anche con i modelli Qwen e Gemma di Alibaba e Google.
DeepSeek V4 è inoltre ottimizzato per i chip Huawei Ascend 950, la cui produzione di massa è prevista per la seconda metà del 2026 - un tassello cruciale nella strategia cinese di indipendenza dai semiconduttori occidentali.
Una strategia di mercato inedita
La mossa di DeepSeek è tanto audace quanto calcolata. Aver scatenato una guerra dei prezzi, poi aver introdotto un sovrapprezzo peak, e infine averlo giustificato come misura di stabilità del servizio - tutto mentre si prepara al ritiro definitivo dei vecchi nomi modello (deepseek-chat e deepseek-reasoner) previsto per il 24 luglio - disegna il profilo di un'azienda che non vuole solo competere, ma ridefinire le regole del mercato.
Con un round da 51 miliardi di yuan (~$7 miliardi) chiuso con Tencent e CATL, DeepSeek ha le risorse per giocare questa partita. Resta da vedere se la strategia peak-valley verrà adottata da altri player cinesi o rimarrà una peculiarità del modello di punta.
Glossario
- Mixture-of-Experts (MoE) - Architettura che divide il modello in 'esperti' specializzati, attivandone solo una parte per ogni richiesta per bilanciare potenza ed efficienza.
- Token - Unità fondamentale di elaborazione del linguaggio per i modelli AI. Un token corrisponde approssimativamente a 0,75 parole in inglese, 1-2 caratteri in cinese.
- Speculative decoding - Tecnica che accelera l'inferenza generando più token in parallelo con un modello più piccolo e verificandoli con quello principale.
- SWE-bench Verified - Benchmark standard per valutare la capacità dei modelli AI di risolvere problemi reali di ingegneria del software.
📱 Cosa ne pensi? Continua a seguirci per non perdere i prossimi trend dalla Cina.
Torna alla homepage
Vic