Aggiornamenti sui modelli AI cinesi per sviluppatori API
Briefing tempestivi sugli aggiornamenti dei modelli cinesi, pesi aperti, compatibilità hardware locale e accesso OpenAI-compatibile. Documentazione ufficiale al primo posto.
Codex ripristina il limite di 5 ore, Claude Code taglia il 25% — Il punto di vista delle API a consumo
OpenAI ha ripristinato il limite di 5 ore di Codex il 25 agosto dopo un agosto ricco di reset (tre reset completi: 8/13/21 agosto); Anthropic riduce i limiti di Claude Code a partire dal 14 settembre. La cronologia verificata, il meccanismo delle quote e perché le API dei modelli cinesi pay-per-token non hanno alcuna finestra temporale.
I pesi aperti di GLM-5.3 arrivano puntuali: il top di gamma del post-training scaling è ora scaricabile
zai-org/GLM-5.3 è andato online la notte del 28 agosto — 141 shard safetensors + BF16, accesso non vincolato (ungated), licenza personalizzata glm-5.3 — chiudendo la finestra di revisione della sicurezza di circa due settimane promessa il 14 agosto. Specifiche, note sulla licenza e cosa completa nel panorama dei pesi aperti.
Qwen3.8-Flash-Next: Alibaba rilascia in anticipo l'architettura Qwen4 — Pesi aperti stasera
Conto alla rovescia su ModelScope: MoE multimodale a pesi aperti in arrivo stasera alle 23:00 (ora di Pechino) — 125B principali + 51B di embedding N-gram con 6B attivi per token, primo assaggio di GDN + Qwen Sparse Attention di Qwen4. Analisi confermati vs non confermati, perché i 6B attivi sono importanti per l'esecuzione in locale e cosa monitorare al rilascio del repository.
Mac mini M6 vs M5 Pro per LLM locali: 32GB o 64GB?
Il chip M6 di Apple offre un'architettura di accelerazione più recente, ma M5 Pro raddoppia il tetto massimo di memoria e raggiunge 307 GB/s di larghezza di banda. Una guida all'acquisto concreta con specifiche ufficiali, etichette dei test Apple, compatibilità con Qwen3.8-27B e la decisione sull'upgrade da M4.
Mac Studio M5 Max vs M5 Ultra per LLM locali
M5 Max con 128GB è la workstation più ragionevole; M5 Ultra con 256GB/512GB è riservato ai modelli che non possono girare altrove. Calcolo della memoria per DeepSeek V4, GLM-5, Qwen3.8 e Kimi K3, oltre ai limiti dichiarati per i cluster Apple.
Svelato Ox Alpha: Zhipu conferma GLM-5.3-Flash — Rilascio ufficiale e pesi aperti stasera
Mistero risolto: Zhipu ha confermato a Bloomberg che Ox Alpha è GLM-5.3-Flash, con il rilascio ufficiale e i pesi aperti stasera (26 agosto). La fase di test segreta da 100T token/giorno è stata eseguita su chip cinesi (SemiAnalysis); il copione di Pony Alpha si è ripetuto alla lettera. All'interno la storia completa, l'analisi tecnica e tutti i dettagli.
Harvey, supportata da OpenAI, sviluppa il suo primo modello sui pesi aperti di Kimi K3
Il leader del legal-tech Harvey (sostenuto da OpenAI/Sequoia/a16z) ha annunciato Harvey Tenet — una base a pesi aperti Kimi K3 con post-training di Fireworks per il lavoro legale a lungo orizzonte. ~2× nei compiti rispetto a K3 base su LAB di Harvey a costi open-source; anteprima di ricerca senza pesi pubblicati. Il segnale di adozione occidentale più chiaro finora per i pesi aperti cinesi.
DeepSeek elimina le tariffe di punta nel fine settimana: sabato e domenica ora sono interamente a tariffa ridotta
Dal 23 agosto alle 00:00 (ora di Pechino), i fine settimana sono fatturati interamente a tariffe fuori punta — output v4-pro a 13,5 ¥/M tutto il giorno contro i 27 ¥ del picco nei giorni feriali. Meno di una settimana dopo l'introduzione del meccanismo di fasce orarie. Tabella completa delle tariffe del weekend, calcoli di pianificazione e fonti.
HappyHorse 1.1 diventa globale: API completa su Model Studio, video editing e sorpasso su Seedance
Alibaba ha reso disponibili le funzionalità complete di HappyHorse 1.1 tramite API su Model Studio — nuova modalità di montaggio video, audio integrato senza costi aggiuntivi, sconto di lancio del 40% per due settimane, $0.0988/s (720p) su OpenRouter e 2° posto nella classifica globale dell'arena video davanti a Seedance e Sora. All'interno piattaforme, tabella dei prezzi e fonti.
L'API di GLM-5.3 entra in GA: $1.40/$4.40, un giorno di ritardo e un ecosistema che non ha aspettato
Zhipu ha aperto l'accesso generale alle API nelle prime ore del 19 agosto — con un giorno di ritardo, allo stesso prezzo di GLM-5.2 e con AA Index 60 (co-#1 open source). Cronologia verificata della settimana di lancio, tabella dei prezzi vs Qwen3.8/K3/V4-Flash, panoramica delle piattaforme (ZCode, PhanRouter, internet di supercalcolo) e cosa cambia prima dell'arrivo dei pesi il 28 agosto.
MiniMax Design: il modello video H3 ottiene un workbench per agenti
Tre settimane dopo aver reso open-source H3, MiniMax ha rilasciato l'interfaccia per commercializzarlo: un workbench di creazione per agenti in linguaggio naturale con regia 3D e integrazione ComfyUI. Un prodotto, non un'API — gli endpoint del modello rimangono il percorso programmatico. Breve sintesi con fonti.
Pesi aperti Qwen3.8 (2026): checkpoint Max da 2.4T + un 27B con licenza Apache-2.0 per il tuo portatile
Il primo rilascio di classe Max a pesi aperti di Alibaba: Qwen3.8-2.4T-A95B (+FP8) su Hugging Face, oltre a un modello multimodale denso da 27B sotto licenza Apache 2.0 che gira da un file da 17GB. Cronologia, dettagli sulla licenza, prezzi API di $2/$6, la guida per l'esecuzione in locale di Simon Willison e una tabella di instradamento.
API Kling 3.0 (2026): prezzi ufficiali, Turbo & Omni e lo spin-off da $3B
La famiglia Kling 3.0 di Kuaishou sull'API internazionale ufficiale: prezzi di listino $0.084–$0.42/s (4K nativo), Turbo con audio incluso, Omni con input video, architettura API basata su task JWT. Risultati Q2: ricavi superiori a 850M di RMB (+200% YoY), oltre 100M di utenti, round da ~$3B a luglio con valutazione di ~$18B. Tabella di instradamento + calcolo dei costi per 10 secondi a confronto con Seedance.
DeepSeek-V4-Flash-Vision-Exp (2026): lancio ufficiale, prezzi, guida rapida alle API
Lanciato la sera del 21 agosto (UTC+8): modello multimodale di visione sperimentale con prezzi pari a V4-Flash ($0.22/1M di input, immagini limitate a 384 token), parità testuale con V4-Flash, agente multimodale vicino a Opus-4.8, nuova API Files, supporto per Harness v0.1.1-rc.1. Include guida rapida per curl/Python, confronto dei costi con la visione di Claude/Gemini/Grok e indicazioni su quale modello DeepSeek instradare.
DeepSeek Harness aggiunge l'input di immagini multimodale: rc.7 + rc.8
Rilascio in due fasi: rc.7 (17 agosto) allegati immagine persistenti in MCP/ACP; rc.8 (19 agosto) richieste native di immagini per gli adapter DeepSeek più input di immagini per /goal e /plan. L'harness ora supporta le immagini — ma V4-Pro/V4-Flash restano solo testo, e rc.8 utilizza il tag npm next. Turing Post definisce l'harness un "secondo momento DeepSeek".
Gemini 3.7 Flash: il modello workhorse di Google per coding e agenti
Google ha annunciato Gemini 3.7 Flash il 13 agosto — contesto da 1M, DeepSWE 65.3%, prezzo di lancio di $0.75/$3.75 per 1M di token per tutto il 2026. Nota di riferimento sui modelli di frontiera occidentali; Gemini non è instradato da ChinaModelAPI.
DeepSeek Harness v0.1: DeepSeek rende open source il suo harness per agenti
Harness per agenti (dsh) con licenza MIT basato su architettura «everything-is-a-plugin» annunciato la sera del 13 agosto — la stampa estera lo definisce un rivale open source di Claude Code. Quattro modalità di lavoro, importazione sessioni da Claude Code, 288 plugin in 24 ore. Agnostico rispetto al modello per progettazione.
GLM-5.3 rilasciato ufficialmente: scaling del post-training, capacità cyber emergenti, pesi in 2 settimane
Il blog ufficiale di Z.ai ha annunciato GLM-5.3 il 14 agosto — stessa base di GLM-5.2, Terminal-Bench 3.0 da 4.6 a 28.3, CyberGym 84.5%, 2.436 vulnerabilità reali scoperte. Aggiornato il 19 agosto: prezzo API identico a 5.2 ($1.40/$4.40 per 1M), indice indipendente AA pari a 60, pesi attesi per il ~28 agosto; inclusa la copertura di VentureBeat / The Decoder / Interconnects.
DeepSeek-V4-Pro-0813 Ufficiale: GA della versione finale con agenti potenziati
La documentazione API ufficiale di DeepSeek ha aggiornato deepseek-v4-pro a DeepSeek-V4-Pro-0813 la sera del 2026-08-13. Stesso model ID, capacità degli agenti migliorata, lieve adeguamento dei prezzi. Cosa devono fare gli sviluppatori di API — quasi nulla.
Grok 4.6: il nuovo modello di punta consigliato da xAI, ora nell'API
La documentazione ufficiale per sviluppatori di xAI elenca ora grok-4.6 come modello di punta più recente — contesto da 500k, $2/$6 per 1M di token, raccomandato per il codice. Nota di riferimento sui modelli di frontiera occidentali; Grok non è instradato da ChinaModelAPI.
China Model Watch — Stato settimanale dei modelli
Istantanea settimanale dei modelli di punta cinesi monitorati da ChinaModelAPI al 2026-08-09, a confronto con i riferimenti GPT-5.6 Sol / Claude Opus 5. Breve report di stato automatico per sviluppatori di API.
Pesi aperti MiniMax H3: modello video nativo A/V
H3 (non M3) è il modello video multimodale di MiniMax con audio stereo nativo. Pesi HF + ComfyUI + API ospitata. Non è una denominazione ufficiale di "Kling aperto" — discussioni sulla qualità spesso a confronto con Seedance.
Qwen3.8-Max: modello di punta da ~2.4T — Non un nuovo generatore video
Modello di punta Qwen di agosto 2026 per la programmazione e i task a lungo orizzonte. Chiarisce le indiscrezioni: non si tratta di un rilascio T2V di classe Seedance come Qwen2.5-VL / Qwen2-VL-72B.
Monitoraggio sconti Seedance 2.0 Mini / Fast: segnali di sconti al 40% del prezzo (~4折) per Mini
Nota di mercato di agosto 2026: Mini viene spesso pubblicizzato a circa 4折 (40% del prezzo), Fast a ~75折 su alcune piattaforme. Non sono i prezzi di ChinaModelAPI — verificare su ciascuna console. Mini per l'iterazione, 2.5 per le versioni finali.
Funzionalità di Seedance 2.5: piano sequenza da 30s, 50 riferimenti, piattaforme disponibili
Lancio ufficiale e rilascio di agosto 2026: sequenza singola da 30s, ~50 riferimenti multimodali, editing potenziato. Dove lo usano i creator e cosa dovrebbero fare gli sviluppatori di API.
Stato di Seedance 2.5 (Storico): note sul ritardo di luglio
Breve panoramica sullo stato pre-lancio di fine luglio. Superata dal post di lancio ufficiale del 2026-07-31 — conservata solo per il contesto cronologico.
DeepSeek-V4-Pro per sviluppatori API: cosa ha sostituito V3.2
DeepSeek-V4-Pro e V4-Flash sono la coppia di punta del 2026 (contesto da 1M, pesi aperti). Come migrare i client compatibili con OpenAI dagli ID modello dell'era V3.
Kimi K3 + GLM-5.2: la coppia di frontiera aperta del 2026
Come Kimi K3 di Moonshot e GLM-5.2 di Zhipu si completano a vicenda per la programmazione a lungo orizzonte, contesto da 1M e deployment a pesi aperti — con note sull'accesso compatibile con OpenAI.
data/model-watch/; pubblicare dopo le verifiche delle fonti.