ChinaModelAPI

الأخبار / راصد النماذج · الإطلاق الرسمي + دليل المطورين

إطلاق رسمي deepseek-v4-flash-vision-exp Vision API الأسعار البدء السريع
2026-08-21 · راصد النماذج · أُطلق مساء 21 أغسطس (UTC+8) بعد الإدراج الرمادي في 20 أغسطس

DeepSeek-V4-Flash-Vision-Exp (2026): الإطلاق الرسمي، والأسعار، ودليل البدء السريع لـ API جاهز للنسخ واللصق

بعد يومين من الإعلان التشويقي لتميمة الحوت، ويوم واحد من تسريب الاسم في قوائم API للإطلاق الرمادي، جعلت DeepSeek الأمر حقيقة: deepseek-v4-flash-vision-exp، وهو نموذج تجريبي متعدد الوسائط لفهم الرؤية البصرية، بات متاحاً على API الرسمي اعتباراً من 21 أغسطس 2026. تبقى جودة النصوص مماثلة لـ V4-Flash؛ وقدرات الوكلاء متعددي الوسائط "قريبة من Opus-4.8"؛ والأسعار لم تتغير عن V4-Flash؛ كما تم إطلاق Files API جديد بالتزامن معه. يتضمن هذا الدليل الجدول الزمني للإطلاق، وحسابات مقارنة الأسعار مع نماذج الرؤية الغربية، وأكواد بدء سريع جاهزة للتشغيل، ونموذج DeepSeek المناسب لتوجيه كل نوع من أعباء العمل إليه.

الإجابة المباشرة

يُعد DeepSeek-V4-Flash-Vision-Exp نموذجاً رسمياً من DeepSeek، أُطلق في 21 أغسطس 2026، وفقاً لـ سجل تغييرات API بتاريخ 2026-08-21. يمكن استدعاؤه باستخدام model='deepseek-v4-flash-vision-exp'؛ وهو يقبل النصوص والصور عبر base64، أو روابط URL الخارجية، أو Files API الجديد من خلال Chat Completions، وMessages API المتوافق مع Anthropic، وResponses API. وفقاً لـ صفحة الأسعار الرسمية، فإن تكلفته مطابقة تماماً لتكلفة V4-Flash — $0.22 لكل 1M رمز إدخال خارج أوقات الذروة ($0.44 في أوقات الذروة) — وتُحسب كل صورة بما لا يتجاوز 384 رمزاً. يدعمه DeepSeek Harness v0.1.1-rc.1 بشكل أصلي.

من الإعلان التشويقي إلى الإطلاق: الجدول الزمني خلال 72 ساعة

الموعدماذا حدث · المصدر
18 يونيوتطبيق وموقع DeepSeek يحصلان على ميزة الرؤية للصور (في المنتج فقط، دون نموذج API). باحثون على X: "الرؤية متاحة الآن على الويب والتطبيق."
3–4 أغسطسالمجتمع يرفض الانتظار: وصول مهايئ MoonViT لنموذج DeepSeek-V4-Flash-Vision-NVFP4 من WebBrain و0731-vision من FlyCockpit إلى Hugging Face (مزيد من التفاصيل أدناه).
19–20 أغسطسباحث النماذج متعددة الوسائط في DeepSeek، شياوكانغ تشن، ينشر إعلاناً تشويقياً للحوت مفتوح العينين "الآن، نحن نراكم. 👀" على X — وربطه موقع TestingCatalog بنموذج رؤية قادم.
20 أغسطسظهور المعرّف الدقيق للنموذج في الإطلاق الرمادي: لقطات شاشة لقائمة نماذج API تُظهر deepseek-v4-flash-vision-exp تنتشر على X (@NFT_Chen) وفي كود DeepSeek Harness — دون تحديث الوثائق بعد.
21 أغسطس (مساءً UTC+8)الإطلاق الرسمي. إضافة سجل التغييرات "DeepSeek-V4-Flash-Vision-Exp Release" (2026-08-21)؛ وإطلاق صفحة الأسعار، ودليل Vision، ودليل Files API؛ وإعلان رسمي عبر WeChat (تغطية صحفية خلال ساعة)؛ مع إضافة دعم أصلي في DeepSeek Harness v0.1.1-rc.1.

ملاحظة المحرر: نسخة سابقة من هذا الموجز، نُشرت في صباح 21 أغسطس قبل الإطلاق، خلصت إلى عدم وجود نموذج رسمي — وكان ذلك دقيقاً في تلك الساعة (إذ لم تحتوِ الوثائق على أي إشارة؛ وكان الاسم محصوراً في الإطلاق الرمادي)، لكنه تغير بحلول المساء. عمليات الإطلاق الرسمية في نفس اليوم هي السبب تحديداً وراء توثيقنا لكل معلومة بطابع زمني.

ما تم إطلاقه، وفقاً للوثائق الرسمية

  • النموذج. نموذج تجريبي لفهم الرؤية البصرية؛ model='deepseek-v4-flash-vision-exp'. التوصيف الرسمي: جودة النصوص "مماثلة لنموذج DeepSeek-V4-Flash الرسمي"، وقدرات الوكلاء متعددي الوسائط "قريبة من Opus-4.8". لم يحصل V4-Pro على قدرات الرؤية — فهذه الميزة مقتصرة حالياً على عائلة Flash.
  • ثلاث طرق لإرسال الصور. تضمين روابط base64 data: مباشرة؛ أو رابط صورة خارجي عام (بحد أقصى 8,192 حرفاً، ومهلة تنزيل 60 ثانية)؛ أو عبر Files API — ارفع الصورة مرة واحدة واستخدم معرّف file_id للإشارة إليها. تعمل جميع نقاط النهاية الثلاث: Chat Completions المتوافقة مع OpenAI، وMessages المتوافقة مع Anthropic (يتطلب Files API ترويسة anthropic-beta: files-api-2025-04-14)، وResponses.
  • قيود الصور. JPEG / PNG / GIF / WebP؛ 32 MiB لكل صورة مضمنة أو عبر رابط، و64 MiB عبر file_id؛ حتى 600 صورة لكل طلب؛ حجم جسم الطلب 48 MiB (إجمالي 64 MiB للصور، و200 MiB للصور عبر file_id)؛ أقصى أبعاد 8,192 px لكل جانب (4,096 px عند إرسال 15 صورة فأكثر).
  • Files API (إطلاق جديد ومنفصل). purpose=user_data؛ 64 MiB لكل ملف؛ 25 GiB و10,000 ملف لكل مستخدم؛ مدة الاحتفاظ من ساعة واحدة إلى 30 يوماً أو دائم؛ ويتم تحديد التنسيق بناءً على المحتوى وليس الامتداد.
  • دعم Harness في اليوم نفسه. DeepSeek Harness v0.1.1-rc.1 (الحساب الرسمي، 21 أغسطس 18:22): "أضاف مهايئ نماذج DeepSeek خيار النموذج متعدد الوسائط DeepSeek-V4-Flash-Vision-Exp، مع دعم إعداد طلبات الصور الأصلية" — بنية معالجة الصور التي أُعدت في إصدارات rc.7/rc.8 الأسبوع الماضي باتت تمتلك الآن نموذجاً رسمياً لربطه بها (راجع موجز rc.7/rc.8).

أسعار deepseek-v4-flash-vision-exp (2026): مماثلة لـ V4-Flash، وبحد أقصى 384 رمزاً للصور

تكلفة deepseek-v4-flash-vision-exp مطابقة لتكلفة deepseek-v4-flash: $0.22 لكل 1M رمز إدخال خارج أوقات الذروة، و$0.44 في أوقات الذروة، و$0.66/$1.32 لرموز الإخراج — وتُحسب كل صورة بحد أقصى 384 رمزاً. ساعات الذروة هي 01:00–04:00 و06:00–10:00 بتوقيت UTC (09:00–12:00 و14:00–18:00 بتوقيت بكين)؛ وخارج أوقات الذروة تكون التكلفة نصف تكلفة الذروة.

لكل 1M رمز (USD)خارج الذروةأوقات الذروةملاحظات
الإدخال — إصابة الذاكرة المخبأة (cache hit)$0.007$0.014مطابق لـ deepseek-v4-flash
الإدخال — إخفاق الذاكرة المخبأة (cache miss)$0.22$0.44≈ ¥1.5 / ¥3.0
المخرجات$0.66$1.32≈ ¥4.5 / ¥9.0
فوترة الصورتغيير الحجم قبل الاستنتاج: يتم تكبير ما هو أصغر من <~384×384، وتصغير الأحجام الأكبر إلى ما يعادل ~800×800 بكسلحد أقصى 384 رمزاً لكل صورة — صورة بدقة 2000×2000 وأخرى بدقة 5000×5000 تكلفان السعر نفسه؛ وتُحسب كل صورة في الطلبات متعددة الصور بشكل مستقل

المصدر: صفحة الأسعار الرسمية ودليل استهلاك الرموز لـ Vision، تم الاطلاع بتاريخ 2026-08-21.

التكلفة الفعلية للصورة: مقارنة بين vision-exp ونماذج الرؤية الغربية (2026)

تكلف الصورة بأقصى حجم على vision-exp ما لا يزيد عن $0.00017 في أوقات الذروة ($0.000084 خارج أوقات الذروة) — أي ما يقارب 1,000 لقطة شاشة بأقل من $0.09 خارج أوقات الذروة. بينما تحسب النماذج الغربية المدعومة بالرؤية تكلفة الصور بناءً على عدد رموز خاص بها (أكبر، ويعتمد على الدقة) وبأسعار للرمز الواحد أعلى بمقدار 1.7×–13.6×:

النموذج (2026)الإدخال $/1Mمقارنة بـ vision-expفوترة الصور
deepseek-v4-flash-vision-exp$0.22 / $0.44 (خارج/في الذروة)الأساس≤384 توكن/صورة، حد أقصى صارم
Gemini 3.7 Flash (السعر التقديمي)$0.751.7–3.4×يعتمد على الدقة، دون سقف معلن على غرار 384 رمزاً
Grok 4.6$2.004.5–9.1×يعتمد على الدقة
Claude Sonnet 4.5$3.006.8–13.6×لقطة الشاشة النموذجية ≈1,000+ توكن → ≈$0.003+/للصورة (تقديرًا)

أسعار المقارنة هي الأسعار الرسمية المعلنة من صفحات الأسعار العامة لـ Claude Sonnet 4.5 وGrok 4.6 والأسعار الترويجية المعلنة من Google لـ Gemini 3.7 Flash (راجع موجز Gemini 3.7 لدينا)؛ وتختلف أعداد رموز الصور لدى المنافسين حسب الدقة وهي تقديرية. تظل النقطة الجوهرية قائمة رغم ذلك: يجمع vision-exp بين أرخص سعر للرمز في فئته والسقف الثابت الوحيد لعدد الرموز لكل صورة.

كيفية استدعاء deepseek-v4-flash-vision-exp: دليل البدء السريع (curl + Python)

إن API متوافق مع OpenAI — حيث يعمل تنسيق رسائل الرؤية القياسي كما هو مع https://api.deepseek.com. إرسال صورة عبر رابط URL عام:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Describe the UI bug visible in this screenshot."},
        {"type": "image_url",
         "image_url": {"url": "https://example.com/screenshot.png"}}
      ]
    }]
  }'

الاستدعاء نفسه بلغة Python باستخدام حزمة OpenAI SDK الرسمية — وجّه base_url إلى DeepSeek، وقم بتضمين الصورة بتنسيق base64:

from openai import OpenAI

client = OpenAI(api_key="YOUR_KEY", base_url="https://api.deepseek.com")

resp = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Summarize this dashboard."},
            {"type": "image_url",
             "image_url": {"url": "data:image/png;base64,"}},
        ],
    }],
)
print(resp.choices[0].message.content)
  • JavaScript/Node: البنية متطابقة باستخدام حزمة npm الخاصة بـ openai — ما عليك سوى استبدال baseURL ومعرّف النموذج.
  • لقطات الشاشة المتكررة (حلقات عمل الوكلاء): ارفع الصورة مرة واحدة عبر Files API (purpose="user_data")، ثم أشر إلى معرّف file_id المُعاد — 64 MiB لكل صورة، دون الحاجة لإعادة الرفع في كل دورة. هذا هو النمط الذي يستخدمه DeepSeek Harness v0.1.1-rc.1 بشكل أصلي.
  • البيئة المتوافقة مع Anthropic: تعمل نقطة النهاية Messages أيضاً؛ وتتطلب مراجع Files API ترويسة anthropic-beta: files-api-2025-04-14.
  • عبر وسيط أو بوابة: أي وكيل (Proxy) متوافق مع OpenAI يقوم بتمرير كتل محتوى image_url سيمرر حمولات الرؤية دون تغيير — تحقق من أن بوابتك تمرر مصفوفات المحتوى متعددة الأجزاء قبل افتراض وجود خلل في النموذج.

أي نموذج DeepSeek يجب التوجيه إليه: مقارنة بين vision-exp وv4-flash وv4-pro

طبيعة استخدامكالتوجيه إلىالسبب
النصوص + حلقات البرمجة للوكلاء، واستدعاء الأدوات، والسياق الطويلdeepseek-v4-flashنموذج عام (GA) مستقر، بالسعر نفسه؛ لا داعي لتحمل تكلفة الرؤية الإضافية في الحوارات النصية البحتة
لقطات الشاشة، واستكشاف أخطاء واجهات المستخدم، وقراءة المخططات البيانية ولوحات التحكم، وصور المستنداتdeepseek-v4-flash-vision-expسعر فئة Flash + سقف 384 رمزاً للصورة؛ وكيل متعدد الوسائط قريب من Opus-4.8؛ تجريبي — يُنصح بتثبيت المعرّف
الاستدلال الأكثر تعقيداً، أعلى جودة، وسياق بحجم 1Mdeepseek-v4-proأقوى نماذج DeepSeek؛ لا يزال نصياً فقط — ادمجه مع vision-exp لخطوة معالجة الصور
رؤية أصلية بأوزان مفتوحة، للاستضافة الذاتيةKimi K3 / Qwen-VLإن vision-exp متاح عبر API فقط؛ للتعرف على نماذج الرؤية ذات الأوزان المفتوحة، راجع دليل Kimi API لدينا

احصل على النماذج الصينية المزودة بقدرات الرؤية عبر نقطة نهاية واحدة متوافقة مع OpenAI

تُعد ChinaModelAPI منصة وساطة مستقلة توفر النماذج الصينية الرائدة — DeepSeek وQwen وGLM وKimi — للمطورين حول العالم عبر API واحد متوافق مع OpenAI، مع دعم الدفع بعملات USDT/USD1 ودون الحاجة إلى اشتراك شهري. وتعتبر إصدارات النماذج الجديدة مثل vision-exp الهدف الأساسي الذي بُنيت المنصة من أجله: توفير النماذج من اليوم الأول، وتسعير شفاف لكل رمز، وتكامل واحد لجميع النماذج الصينية المتاحة.

تعتبر ChinaModelAPI منصة وساطة مستقلة لا تربطها أي علاقة رسمية بـ DeepSeek. يتم التحقق من معرّفات النماذج الموجهة بشكل مباشر قبل الإطلاق — انضم إلى قائمة الانتظار لتلقي إشعار فور تفعيل توجيه نماذج الرؤية.

أين يضع هذا مهايئات المجتمع (وحالة الارتباك)

  • حُسم تضارب الأسماء — لصالح DeepSeek. على مدى أسبوعين، كان مصطلح "رؤية V4-Flash" يشير إلى نقاط فحص طورها المجتمع: نموذج DeepSeek-V4-Flash-Vision-NVFP4 من WebBrain (نموذج V4-Flash مجمد + Kimi-K2.6 MoonViT مجمد + مسقاط مدرب بحجم 40.1M معامل، 3 أغسطس) ونموذج 0731-vision من FlyCockpit (4 أغسطس). والآن، أصبح الاسم ملكاً للنموذج الرسمي — مع دعم ووثائق وأسعار فئة Flash التي لا تستطيع المهايئات مضاهاتها.
  • المهايئات لم تفقد قيمتها — بل أعيد تموضعها. إذا كنت تستضيف أوزان V4-Flash ذاتياً على معالجاتك الرسومية وتريد قدرات رؤية تعمل دون اتصال بالإنترنت أو في بيئة معزولة تماماً، فإنها تظل الخيار الوحيد؛ فنماذج vision-exp الرسمية متاحة عبر API فقط، ولم يتم فتح مصدر أي أوزان للرؤية.
  • نمط الانتقال من الإطلاق الرمادي إلى الإطلاق الرسمي جدير بالملاحظة. هذا هو الإصدار الثاني من DeepSeek خلال شهر يظهر في قوائم API أو في الكود قبل تحديث الوثائق (اتبع V4-Flash-0731 المسار نفسه). لمشغلي منصات الوساطة ومطوري الأدوات: مراقبة نقطة نهاية قائمة النماذج وملاحظات إصدار DSH أفضل بكثير من انتظار سجل التغييرات.

المصادر الأولية

الأسئلة الشائعة (2026)

هل أصبح vision-exp رسمياً الآن؟

نعم — أُطلق في 21 أغسطس 2026 مع إدراجه في سجل التغييرات بتاريخ محدد، وتوفير الوثائق مباشرة، والإعلانات الرسمية. كانت لقطات الشاشة الخاصة بـ "الإطلاق الرمادي" في 20 أغسطس للنموذج الحقيقي أثناء مرحلة التجهيز، وليست شائعة.

هل حصل V4-Pro على ميزة الرؤية أيضاً؟

لا. حصلت عائلة Flash فقط على إصدار يدعم الرؤية. ولا يزال V4-Pro مقتصراً على النصوص فقط؛ ولم يُعلن بعد عما إذا كان سيتبعه إصدار رؤية بمستوى Pro.

كيف يتم احتساب تكلفة الصور؟

يتم تغيير حجم الصور إلى ما يعادل تقريباً 800×800 بكسل (بحد أدنى ~384×384)، ثم تحويلها إلى رموز، واحتساب تكلفتها كرموز إدخال — بحد أقصى 384 رمزاً لكل صورة. وتكلفة الصورة بدقة 2K مطابقة تماماً لتكلفة الصورة بدقة 5K.

هل تم إطلاق الأوزان المفتوحة؟

لا. نموذج vision-exp متاح عبر API فقط في الوقت الحالي. ويحتفظ أصحاب الاستضافة الذاتية بمهايئات المجتمع (WebBrain NVFP4 وFlyCockpit) كخيار للعمل دون إنترنت — وهي غير رسمية ولم يتم تقييم أدائها مقارنة بهذا الإصدار.

هل هو متاح على OpenRouter أو لدى مزودي الخدمة التابعين لجهات خارجية؟

حتى وقت النشر (مساء 21 أغسطس بتوقيت UTC+8)، كان النموذج يُقدم عبر منصة DeepSeek الرسمية؛ ولم يتم تأكيد توفره لدى مزودين خارجيين بعد. تحقق من قائمة النماذج المباشرة لدى مزود الخدمة الخاص بك قبل التوجيه.

هل يدعم إدخال الفيديو أو ملفات PDF؟

لا — توضح الوثائق الرسمية دعم إدخال الصور فقط (JPEG/PNG/GIF/WebP). بالنسبة للمستندات، استخرج الصفحات كصور من جهة المستدعي؛ وبالنسبة للفيديو، استخرج لقطات من الإطارات.

حدود معدل الاستخدام؟

توضح صفحة الأسعار الرسمية أن عدد الطلبات المتزامنة هو 2,500 لكلا نموذجي Flash (مقارنة بـ 500 لنموذج V4-Pro). تعني الحالة التجريبية أن الحدود قد تتغير — يرجى التحقق من الوثائق.

هل هو جاهز للإنتاج؟

تعامل مع صفة "تجريبي" (Exp) بجدية: احتمال حدوث تغير في السلوك، أو تعديل في الأسعار/الشروط، أو إيقاف النموذج/إعادة تسميته (تاريخ DeepSeek نفسه: من المعاينة التجريبية preview إلى الإصدار العام 0731 GA). احتفظ ببديل يدعم الرؤية الأصلية (مثل Kimi K3 أو Qwen-VL) جاهزاً للإعداد بنقرة واحدة.

أدلة ذات صلة