هوش مصنوعی | مدلهای زبانی بزرگ
DeepSeek V4 Pro و DeepSeek Harness: نسل جدید کدنویسی عاملمحور
بررسی کامل مدل جدید DeepSeek و سیستم عاملمحور کدنویسی آن — با تست واقعی و تحلیل هزینه
DeepSeek بالاخره نسخه نهایی (GA) مدل V4 Pro خود را منتشر کرد — و نتیجه واقعاً چشمگیر است. اما جذابترین بخش این انتشار، خود مدل نیست؛ بلکه DeepSeek Harness است: سیستم کدنویسی عاملمحور (Agentic Coding System) اختصاصی DeepSeek که ظاهری خیرهکننده و قابلیتهای بسیار جالبی دارد. در این مقاله، هم مدل را بررسی میکنیم و هم قدمبهقدم نشان میدهیم که Harness چگونه نصب و استفاده میشود — بر اساس تست عملی ویدیوی جدید.
🧠 DeepSeek V4 Pro: ارتقای بزرگ عاملمحور
DeepSeek این انتشار را یک «ارتقای عمده برای عاملها» (Major Agent Upgrade) توصیف میکند. کدنویسی عاملمحور در ماههای اخیر تمرکز اصلی تمام مدلهای چینی بوده و V4 Pro همین مسیر را ادامه میدهد. سه ویژگی کلیدی این انتشار:
- تقویت شدید قابلیتهای عاملمحور (Agentic Coding): تمرکز اصلی روی این است که مدل بتواند بهعنوان یک عامل مستقل کدنویسی، دیباگ و تست انجام دهد.
- استدلال انعطافپذیر (Flexible Reasoning Effort): برای نسخههای Pro و Flash، میتوانید میزان تلاش استدلالی مدل (reasoning effort) را تنظیم کنید — از پاسخ سریع و ارزان تا استدلال عمیق و گران.
- پشتیبانی بومی از OpenAI Responses API: مدل مستقیماً از فرمت Responses API اوپنایآی پشتیبانی میکند که مهاجرت از ابزارهای موجود را آسان میکند.
📊 بنچمارکها و جایگاه رقابتی
بنچمارکها روز قبل از انتشار لو رفته بودند و به نظر میرسد لوها دقیق از آب درآمدهاند. V4 Pro نسبت به نسخه قبلی خود (پیشنمایش) یک پرش نسبتاً بزرگ دارد، هرچند نه به اندازه پرشی که نسخه Flash داشت. از نظر جایگاه، این مدل بیشتر با Kimi K3 همراستاست تا Fable 5. در بنچمارکهای مستقل، V4 Pro بهعنوان هشتمین مدل برتر شناخته میشود — دستاوردی قابلتوجه — اما کمی از Qwen 3.8 Max (که چند روز قبل منتشر شد) عقبتر است. نکته مهم: V4 Pro از نظر اندازه بهطور قابلتوجهی از رقبایی مثل Kimi K3 یا Qwen 3 کوچکتر است، و همین مقایسه را منصفانهتر میکند.
💲 افزایش قیمت، اما همچنان مقرونبهصرفه
DeepSeek قیمتها را افزایش داده است؛ بسته به نوع کاربرد، ۲ تا ۴ برابر گرانتر از قبل. با این حال، حتی با این افزایش، V4 Pro همچنان یکی از بهترین گزینههای قیمت در کلاس مدلهای مرزی (Frontier Level) است و از نظر نسبت هزینه به عملکرد، رقابتپذیری خود را حفظ کرده. این افزایش قیمت همچنین نشانهای از یک واقعیت صنعتی است: همه آزمایشگاههای هوش مصنوعی با کمبود منابع محاسباتی (Compute Crunch) دستوپنجه نرم میکنند، و DeepSeek هم از این قاعده مستثنی نیست. با وجود این، توانستهاند قیمتهایی رقابتیتر از دیگر ارائهدهندگان عرضه کنند.
🔧 DeepSeek Harness: سیستم کدنویسی عاملمحور
حالا به سراغ هیجانانگیزترین بخش انتشار میرویم: DeepSeek Harness. این سیستم هنوز در وضعیت پیشنمایش توسعهدهنده (Developer Preview) است، پس طبیعتاً لبههای ناهمواری دارد. فلسفه اصلی آن یکپارچگی مطلق است: همه چیز یک پلاگین (Plug-in) است — حتی ابزارها (Tools)، مهارتها (Skills) و نشستها (Sessions). شما میتوانید قابلیتهای مختلف را ترکیب، جایگزین یا توسعه دهید. جالبتر اینکه حتی میتوانید Codex یا Claude Code را بهعنوان پلاگین فراخوانی کنید و یک سیستم چندعاملی با هارنسهای مختلف بسازید. فلسفه کامل این معماری در مقاله جدیدی به نام « یک پارادایم برنامهنویسی برای ترکیبپذیری فضایی-زمانی» (A Programming Paradigm for Spatio-Temporal Composability) توضیح داده شده که لینک آن در توضیحات ویدیو موجود است.
⚙️ نصب و راهاندازی
نصب ساده است: ریپوی Harness را کلون کنید و مستقیماً از سورس نصب کنید — روشی که در ویدیو «عالی» کار کرده و برای مواقع برخورد با مشکل هم توصیه شده است. بعد از نصب، میتوانید وباپلیکیشن آن را اجرا کنید:
ds-web
این دستور وباپ را روی localhost با پورت ۳۰۱۸ بالا میآورد (قابل تغییر). رابط کاربری آن واقعاً تمیز و مدرن است — یکی از نقاط قوت Harness. در اولین ورود، باید API Key خود را وارد کنید که از پنل حساب DeepSeek (بخش API Keys) ساخته میشود.
🖥️ رابط کاربری و حالتها
پس از ورود، باید یک Workspace (پوشه پروژه) انتخاب کنید که همه چیز مربوط به پروژه در آن ذخیره شود. سپس حالتهای مختلفی در اختیار دارید:
- حالت ۱۰۰ (100 Mode): عامل کدنویسی کامل با ویرایش فایل، شل (Shell) و جستجوی وب (جستجوی وب باید جداگانه تنظیم شود).
- حالت کد (Code Mode): مینیمال و متمرکز بر کدنویسی.
- حالت سازنده (Creator Mode): برای ساخت پروفایلهای سفارشی و عاملهای شخصیسازیشده خودتان.
- انتخاب مدل: با داشتن API Key دیپسیک، به هر دو مدل Flash و Pro دسترسی دارید.
- ابزارهای مدیریتی: فشردهسازی (Compact) و خروجیگرفتن (Export) لاگ جلسات، ارائه بازخورد، و دستور
/goal— همه امکانات یک هارنس مدرن در اینجا حضور دارند.
🔐 تنظیمات، مجوزها و مدلها
بخش تنظیمات (Settings) جایی است که چیزهای واقعاً جالبی پیدا میکنید:
- مجوزها (Permissions): چهار سطح — فقطخواندنی (Read-Only)، فقط ورکاسپیس (Workspace)، حق نوشتن (Write)، و دسترسی کامل (Full Access) که همان حالت خطرناک «رد شدن از تأیید» (Dangerously Skip Permission) است، مشابه آنچه در Claude Code دیده بودیم.
- ارائهدهندگان مدل (Providers): این پروژه با لایسنس MIT منتشر شده، بنابراین بهراحتی میتوانید مدلهای دیگر را اضافه کنید. حتی امکان اجرای نسخه محلی مدل — مثلاً روی یک کلاستر DGX — وجود دارد.
- پلاگینها (Plugins): فهرستی از پلاگینهای موجود با امکان فعال/غیرفعال کردن و تغییر تنظیمات در یک فایل YAML. جستجوی وب (Web Search) اگر با کلید DeepSeek وارد شده باشید، بهصورت خودکار فعال میشود؛ در غیر این صورت در دسترس نیست.
🧪 تست واقعی: ردیاب زنده ایستگاه فضایی
برای آزمایش قابلیتهای Harness، یک کار ساده اما گویا انجام شد: ساخت ردیاب بلادرنگ ایستگاه فضایی بینالمللی (ISS) که از یک API مشخص هر ۵ ثانیه داده میگیرد و موقعیت ایستگاه را نمایش میدهد. این کار نشان میدهد عامل چطور کدنویسی میکند، دیباگ میکند و در نهایت یک خروجی بصری تحویل میدهد.
نتیجه از چند جهت شگفتانگیز بود:
- سرعت: هر دو نسخه Flash و Pro سریع کار کردند.
- واسط کاربری: رابط کاربری روان و با جزئیات — لاگهای دقیق از تمام اقدامات عامل با تزریق زمینه (Context Injection) کامل.
- احساس Codex: تجربه استفاده بسیار شبیه Codex بود — و منطقی هم هست: یکی از کاربران اشاره کرده که DeepSeek Coder بهشدت با استفاده از Codex توسعه یافته و حداقل ۲۰٪ از کامیتها و PRهای آن از درخت کاری Codex میآید!
- آمار زنده: در پایین صفحه، اطلاعات جالبی نمایش داده میشود: سرعت فعلی (مثلاً ۱۱۲ توکن در ثانیه)، نرخ Cache Hit که بین ۹۵ تا ۹۸٪ متغیر بود — یکی از بهترین نرخهای کش که تاکنون دیده شده — تعداد نوبتها (Turns) و زمان اجرا.
- خودکارسازی تست: عامل بعد از پیادهسازی اولیه، تست را در Playwright اجرا کرد تا صحت کار را تأیید کند.
📊 آمار نهایی شگفتانگیز
پس از حدود ۳۵ دقیقه کار (با دو نوبت؛ یک بار برای رفع یک مشکل کوچک)، آمار نهایی واقعاً چشمگیر بود:
| متریک | مقدار |
|---|---|
| مدت اجرا | ۳۵ دقیقه |
| کل توکن مصرفی | ۲۰ میلیون توکن |
| توکنهای خروجی | ۲۴۰,۰۰۰ توکن |
| سرعت | ۱۳۰ توکن در ثانیه |
| نرخ Cache Hit | ۱۰۰٪ (محدوده ۹۵ تا ۱۰۰٪) |
مصرف ۲۰ میلیون توکن برای یک کار ظاهراً ساده «دیوانهوار» به نظر میرسد — و همین نکتهای است که باید به آن توجه کرد (در بخش معایب بیشتر توضیح میدهیم). اما نرخ Cache Hit صددرصدی، نشاندهنده یکی از بهترین طراحیهای کش در صنعت است و هزینه واقعی را بهشدت کاهش میدهد.
🎨 کیفیت خروجی: فراتر از انتظار
کیفیت خروجی نهایی واقعاً غافلگیرکننده بود — یکی از بهترین نتایج دیدهشده برای این نوع پرامپت. ویزوالها بسیار زیبا بودند؛ از یک شیدر (Shader) موجود برای رندر زمین استفاده شده، اما عامل چندین بار تکرار کرده تا بهترین را انتخاب کند. نکتهای که نشاندهنده دقت بالاست: موقعیت خورشید نسبت به زمین درست بود — ساعت ۱ صبح به وقت آمریکا در خروجی منعکس شده بود. مسیر ایستگاه فضایی هم با دقت بالا ردیابی میشد؛ موقعیت لحظهای ایستگاه (در مسیر شمال آمریکا به سمت آمریکای جنوبی و آفریقا) دقیقاً با داده واقعی مطابقت داشت. تجربه قبلی با مدلهای DeepSeek نشان میداد که کیفیت بصری نقطه ضعف آنهاست، اما با این هارنس، این ضعف عملاً برطرف شده است.
⚖️ Flash یا Pro؟ نتیجهگیری تجربه عملی
بر اساس تستهای سریع ویدیو، نسخه Flash ترجیح داده میشود — هم برای کدنویسی از Pro بهتر بود و هم بهمراتب ارزانتر. حتی با وجود قیمتگذاری بسیار رقابتی Pro، نسخه Flash بازده سرمایه (ROI) بهتری دارد. Pro نسبت به نسخه قبلی خودش یک ارتقای بزرگ است، اما برای کارهای کدنویسی کارآمد، Flash انتخاب منطقیتری است. توصیه نویسنده: اگر به دنبال کارهای کدنویسی بهینه هستید، حتماً نسخه Flash را بررسی کنید. او منتظر اضافهشدن پشتیبانی از مدلهای دیگر به Harness است که میتواند بسیار جالب باشد.
⚠️ معایب: عطش توکن مدلهای متنباز
صادقانه بگوییم: تجربه DeepSeek Coder تا اینجا خوب است، اما بهشدت توکنخور (Token-Hungry) به نظر میرسد — همانطور که در تست ۲۰ میلیون توکنی دیدیم. امید است نسخههای بعدی کارایی توکن را هم بهبود دهند. این در واقع یکی از بزرگترین نقاط ضعف مدلهای متنباز (Open Models) است: مدلهای اختصاصی مثل GPT یا Claude معمولاً کارایی توکن بهتری دارند، در حالی که مدلهای متنباز برای رسیدن به کیفیت مشابه، توکن بیشتری میسوزانند. نکته مثبت: با V4 Flash میتوانید مدل را روی سختافزار شخصی خودتان اجرا کنید — مثلاً در ویدیو روی یک کلاستر DGX کار میکرده و عملکرد خوبی دارد. توانایی اجرای محلی، آزادی کامل و حریم خصوصی را فراهم میکند که بسیاری از کاربران حرفهای به آن نیاز دارند.
✅ جمعبندی
DeepSeek با این انتشار دو چیز مهم عرضه کرده است: یک مدل بسیار رقابتی (V4 Pro) که با وجود افزایش قیمت، هنوز از نظر هزینه به عملکرد جزو بهترینهاست؛ و یک هارنس کدنویسی عاملمحور که فلسفه پلاگینمحور آن — با امکان ترکیب Codex، Claude Code و هر ابزار دیگری — میتواند پایه یک سیستم چندعاملی قدرتمند باشد. رابط کاربری تمیز، شفافیت کامل در آمار (سرعت، نرخ کش، هزینه)، نرخ Cache Hit بینظیر و کیفیت خروجی غافلگیرکننده، آن را به گزینهای جدی برای توسعهدهندگان تبدیل میکند.
اگر توسعهدهنده هستید و به سیستمهای کدنویسی عاملمحور علاقهمندید، DeepSeek Harness ارزش امتحان کردن را دارد — مخصوصاً اگر بهدنبال گزینهای اقتصادی با قابلیت اجرای محلی میگردید. نسخه Flash را کنار بگذارید… یعنی حتماً امتحان کنید! تنظیماتی مثل Reasoning Effort به شما اجازه میدهد بین سرعت، هزینه و کیفیت تعادل دلخواهتان را پیدا کنید.
منبع: ویدیوی بررسی DeepSeek V4 Pro و DeepSeek Harness — DeepSeek V4 Pro + Harness: Agentic Coding System
