Mentre Alibaba mostrava i muscoli con un modello da 2,4 trilioni di parametri, DeepSeek ha giocato la carta opposta: il prezzo. Il laboratorio cinese ha rilasciato a cavallo tra fine luglio e inizio agosto 2026 DeepSeek V4-Flash, un modello con pesi aperti dai costi così bassi da riscrivere le tabelle di riferimento del settore. Sui benchmark, il costo medio per test dichiarato è di 0,03 dollari, contro cifre di due o tre ordini di grandezza superiori per i modelli di punta occidentali.
Quanto costa davvero
I prezzi ufficiali dell'API si collocano intorno a 0,14 dollari per milione di token in ingresso e 0,28 dollari per milione di token in uscita. Per dare un'idea concreta: elaborare l'equivalente di un libro di media lunghezza in ingresso costa pochi centesimi. È questo divario — una firma di ricerca ha stimato il modello oltre cento volte più economico dei modelli premium occidentali su alcuni test — ad aver riacceso la guerra dei prezzi tra i laboratori. La strategia di DeepSeek è chiara: rendere l'IA così a buon mercato da spostare la domanda sul volume, mentre l'azienda si prepara, secondo indiscrezioni, a una possibile quotazione in Borsa.
Provarlo dal browser, gratis
Il modo più semplice è l'app web ufficiale su deepseek.com: si crea un account, si apre la chat e si seleziona il modello. È gratuito per l'uso conversazionale, con i consueti limiti di frequenza. Per chi sviluppa, però, il valore vero sta nell'API.
Usare l'API in Python in cinque minuti
L'API di DeepSeek è compatibile con lo standard OpenAI: si può quindi riutilizzare la libreria ufficiale openai cambiando l'URL di base e la chiave. Dopo aver creato una chiave dal pannello sviluppatori, il codice minimo è questo:
pip install openai
from openai import OpenAI
client = OpenAI(
api_key="LA_TUA_CHIAVE_DEEPSEEK",
base_url="https://api.deepseek.com"
)
risposta = client.chat.completions.create(
model="deepseek-chat", # verifica il nome esatto nella documentazione
messages=[
{"role": "system", "content": "Sei un assistente conciso che risponde in italiano."},
{"role": "user", "content": "Spiega la differenza tra RAM e VRAM in 4 righe."}
],
temperature=0.3
)
print(risposta.choices[0].message.content)
Il risultato atteso è una spiegazione breve e corretta in italiano. Da qui, cambiando il contenuto dei messaggi, si costruiscono riassunti, classificatori, estrattori di dati o piccoli agenti. Il nome preciso del modello (ad esempio la variante «Flash») va confermato nella documentazione ufficiale, perché i laboratori aggiornano spesso gli identificativi.
Scaricare i pesi ed eseguirlo in locale
Essendo un modello con pesi aperti, V4-Flash può essere scaricato dai repository ufficiali di DeepSeek su Hugging Face e integrato in ambienti di inferenza come vLLM o llama.cpp (per le versioni quantizzate). Il download tipico con lo strumento di Hugging Face è:
pip install -U huggingface_hub
huggingface-cli download deepseek-ai/DeepSeek-V4-Flash --local-dir ./deepseek-v4-flash
L'esecuzione locale del modello completo richiede hardware da data center; per chi ha un PC domestico, la strada praticabile sono le versioni quantizzate della community, quando disponibili, oppure semplicemente l'API, che a questi prezzi rende spesso poco conveniente attrezzarsi in proprio. Anche qui, requisiti e nomi esatti dei repository vanno verificati sulla scheda del modello.
Quando conviene e a cosa fare attenzione
Per progetti ad alto volume — classificazione di grandi quantità di testi, generazione automatica di contenuti, elaborazione di documenti — il rapporto qualità-prezzo di V4-Flash è difficile da battere. Restano due cautele. La prima riguarda i dati: inviando informazioni a un servizio cloud cinese è bene valutare policy sulla privacy e conformità con il GDPR, soprattutto per dati personali o aziendali sensibili; in questi casi la versione locale è preferibile. La seconda è la qualità sui casi specifici: un modello economico va comunque testato sui propri compiti, perché il prezzo più basso non garantisce la resa migliore su ogni scenario. La regola d'oro resta misurare su un campione reale prima di adottarlo in produzione.
Prezzi e specifiche derivano dalle comunicazioni di DeepSeek e dalla stampa di settore; verificare sempre i valori aggiornati nella documentazione ufficiale.




