چگونه دستیار کدنویسی هوش مصنوعی در ویندوز بسازیم؟

دستیارهای کدنویسی مبتنی بر ابر (Cloud) بدون شک ابزارهای بسیار مفیدی هستند، اما دو چالش بزرگ به همراه دارند: اول به دلیل فیلتر بودن ابزار های ابری هوش مصنوعی در ایران، دوم اینکه باید هزینههای اشتراک ماهانه دلاری یا پرداخت به ازای مصرف را به دوش بکشید و سوم اینکه از نظر امنیتی ریسک بالایی دارند. ممکن است از کد های اختصاصی شما بدون اجازه استفاده کنند.
اما خبر خوب این است که میتوانید کل این فرآیند را به سختافزار شخصی خودتان منتقل کنید! شما با اجرا کردن ابزار Ollama روی سیستم خود و متصل کردن آن به VS Code از طریق یک افزونه اختصاصی، میتوانید به سادگی یک جایگزین کاملاً خصوصی، آفلاین و بدون نیاز به اشتراک برای مدلهای ابری بزرگ راهاندازی کنید.
در این مقاله کاربردی، قدم به قدم یاد میگیرید که چطور بدون نیاز به اینترنت و اشتراکهای گرانقیمت، یک دستیار هوش مصنوعی اختصاصی و کاملاً محلی (Local) برای کدنویسی در محیط ویندوز راهاندازی کنید. ما برای این کار از ابزار قدرتمند Ollama و محیط محبوب VS Code استفاده خواهیم کرد تا تمام دادهها و کدهای شما در امنیت کامل روی سیستم خودتان پردازش شوند. توجه داشته باشید که چون این دستیار به صورت لوکال اجرا میشود از منابع سیستم شما استفاده کرده به همین دلیل باید سیپییو و رم مناسبی داشته باشید.
فهرست مطالب
چرا هوش مصنوعی محلی؟
دستیارهای کدنویسی هوش مصنوعی اکنون محبوبتر از هر زمان دیگری هستند. به لطف پیشرفتهای چشمگیر اخیر، مدلهای محلی (Local) به یک جایگزین کاملاً واقعی و کاربردی برای مدلهای ابری بزرگ تبدیل شدهاند؛ بهویژه اگر عادت داشته باشید پروژههای خود را به بخشهای کوچکتر و قابلمدیریت تقسیم کنید.
اجرای همهچیز به صورت محلی چندین مزیت بزرگ دارد که اولین و ملموسترین آنها، حریم خصوصی است. وقتی کدهای شما هرگز از سیستم شخصیتان خارج نشوند، ریسک لو رفتن کدهای اختصاصی، فاش شدن دادههای حساس یا نقض قوانین حاکم بر حریم خصوصی به صفر میرسد. اگر روی پروژههای حساس کار میکنید یا صرفاً روی امنیت دادههایتان حساس هستید، مدلهای محلی بهترین انتخاب برای شما هستند.
علاوه بر این، دیگر نیازی نیست نگران محدودیتهای استفاده از API یا پرداخت اشتراکهای ماهانه باشید. شما میتوانید بدون هیچ محدودیتی و هر چقدر که میخواهید از دستیار کدنویسی خود استفاده کنید؛ در این حالت تنها هزینه ماهانه شما پول برق مصرفی سیستم خواهد بود!
همچنین به علت فیلتر بودن و در برخی موارد تحریم کردن آیپیهای ایران توسط ابزارهای آنلاین مجبور به استفاده از هوش مصنوعی های قابل نصب و محلی هستیم.
اگرچه شاید در نگاه اول خرید سختافزار گران به نظر برسد،( با افزایش قیمت دلار، رم و ssd موجود در بازار) اما وقتی در نظر بگیرید که برای استفاده سنگین و بدون محدودیت از ابزاری مثل Claude باید ماهانه حدود ۱۰۰ دلار (با قیمت الان دلار و کارمزد شرکتهای واسط حدود 20 میلیون) هزینه کنید، ساخت دستیار هوش مصنوعی کدنویسی محلی، کاملا قابل توجیه است.
پیشنیازهای راهاندازی هوش مصنوعی در ویندوز

وقتی میخواهید یک مدل زبانی بزرگ (LLM) را به عنوان دستیار کدنویسی روی سیستم ویندوزی اجرا کنید، به سه المان کلیدی نیاز خواهید داشت:
- برنامه Ollama: وظیفه میزبانی و اجرای مدل زبانی بزرگ را روی سیستم به عهده دارد.
- محیط VS Code به همراه افزونه Continue یا Cline: رابط کاربری دسترسی به هوش مصنوعی را در محیط کدنویسی شما فراهم میکند.
- یک مدل زبانی (LLM): هسته اصلی هوش مصنوعی که وظیفه فهم کدها و کمک به شما را بر عهده دارد.
شما میتوانید از هر مدلی که دوست دارید استفاده کنید، اما به یاد داشته باشید که LLMها بهشدت به حافظه رم (RAM و VRAM) وابسته هستند. یک قاعده کلی و تجربی برای مدلهای استاندارد ۸ بیتی این است که به ازای هر میلیارد پارامتر، به ۱ گیگابایت حافظه گرافیک (VRAM) نیاز دارید. (به عنوان مثال، مدل Gemma 4 12B برای اجرا به حداقل ۱۲ گیگابایت VRAM گرافیک نیاز دارد).
علاوه بر حجم خود مدل، باید فضای لازم برای Context Window را هم در نظر بگیرید. این فضا در واقع شامل حجم تمام کدهایی است که به هوش مصنوعی میدهید به اضافهی پاسخهایی که دریافت میکنید. پنجره متن میتواند از چندصد مگابایت تا چندین گیگابایت از حافظه گرافیک را اشغال کند. اگر حجم مصرفی شما به سقف VRAM نزدیک است، باید بهشدت مراقب این بخش باشید؛ زیرا پر شدن حافظه گرافیک باعث منقل شدن بار پردازشی به CPU میشود که سرعت و عملکرد هوش مصنوعی را به شدت کاهش میدهد (گلوگاه حرارتی و پردازشی).
کوانتیزاسیون (Quantization)؛ نجاتدهنده سختافزار با یک شرط کوچک
اینجاست که تکنیک کوانتیزاسیون (که میتوان آن را نوعی فشردهسازی مدل دانست) به کمک شما میآید. شما میتوانید نسخه ۳ بیتی فشردهشده از مدل قدرتمند Qwen 3.6 27B را روی یک کارت گرافیک ۱۶ گیگابایتی اجرا کنید؛ چرا که این مدل به جای اشغال کردن تمام حجم VRAM در حالت استاندارد، در حالت ۳ بیتی تنها به حدود ۱۰ تا ۱۳.۵ گیگابایت حافظه گرافیک نیاز دارد.
پاسخ قطعی و واحدی برای سوال «کدام مدل فشرده شده را باید انتخاب کنیم؟» وجود ندارد. ولی به این نکته توجه داشته باشید که، مدلهای فشردهشده (Quantized) به هوشمندی نسخههای اصلی نیستند و هر چقدر میزان فشردهسازی یک مدل بیشتر باشد، از میزان هوش و دقت آن در درک کدهای پیچیده کاسته میشود.
پیشنهاد میکنم که دور کوانتیزاسیونهای ۲ بیتی را خط بکشید؛ این نسخهها تقریباً هیچوقت ارزش امتحان کردن ندارند و خروجی آنها پرتوپلا خواهد بود. با این حال، مدلهای ۳ بیتی گاهی اوقات عملکرد قابلقبول و کارراهاندازی دارند.
راهنمای قدم به قدم راهاندازی دستیار کدنویسی هوش مصنوعی
مرحله اول: دانلود، نصب و اجرای ابزار Ollama و مدلها
برای شروع کار، ابتدا باید ابزار Ollama را دانلود و روی سیستم خود نصب کنید. خوشبختانه اگر از سیستمعامل ویندوز یا مک استفاده میکنید، یک فایل نصبی رسمی و بیدردسر در وبسایت Ollama وجود دارد.




پس از اتمام نصب و اجرای Ollama، نوبت به دانلود (Pull) مدل زبانی متناسب با سختافزار سیستمتان میرسد. به عنوان مثال، اگر میخواهید نسخه فشردهشده Unsloth از مدل قدرتمند Qwen 3.6-27B را دانلود و اجرا کنید، کافیست محیط CMD را باز کرده و دستور زیر را اجرا کنید:
ollama run hf.co/unsloth/Qwen3.6-27B-MTP-GGUF:Q3_K_S
خود من برای کارهای پیشرفتهتر و پروژههای سنگین کدنویسی لوکال، از مدل بهینهسازی شدهی batiai/qwen3.6-27b:q3 استفاده میکنم که تعادل فوقالعادهای میان سرعت و هوش مصنوعی ارائه میدهد.
نکته کاربردی: اجرای دستور بالا برای اولین بار، بسته به سرعت اینترنت شما ممکن است کمی زمان ببرد؛ چرا که Ollama ابتدا تمام فایلهای مدل را دانلود کرده و سپس آن را آماده استفاده آفلاین میکند. در دفعات بعدی، مدل در کمتر از چند ثانیه لود و آماده به کار خواهد بود.
یک نکته حیاتی که باید قبل از دانلود چک کنید: حتماً پیش از دانلود مطمئن شوید مدلی که انتخاب کردهاید از قابلیت Tools (یا Function Calling) پشتیبانی میکند. برخی از مدلها هرچند در چت کردن معمولی عالی هستند، اما توانایی برقراری ارتباط با ابزارهای جانبی را ندارند؛ در حالی که برای کارکرد صحیح دستیار کدنویسی در محیط VS Code، مدل شما حتماً باید قابلیت تعامل با ابزارها را داشته باشد.
مرحله دوم: راهاندازی دستیار هوش مصنوعی در محیط VS Code
در گام بعدی، باید یکی از افزونههای قدرتمند Cline یا Continue را در محیط VS Code نصب کنید. پس از نصب، تنها کاری که باید انجام دهید این است که آدرس سرور محلی Ollama را که روی کامپیوترتان در حال اجراست به افزونه بدهید؛ با این کار، افزونه به طور خودکار تمام مدلهای فعال روی Ollama را شناسایی میکند.
کدام افزونه برای شما مناسبتر است؟
- افزونه Cline: اگر به دنبال ابزاری هستید که بر اساس دستورات شما، بلوکهای کدی کاملاً آماده و ساختاریافته تحویلتان دهد، Cline در این زمینه میدرخشد. البته توجه داشته باشید که این افزونه قابلیت تکمیلی خودکار (Inline Autocomplete) در حین تایپ را ندارد.
- افزونه Continue: اگر هدف اصلی شما این است که هوش مصنوعی در زمان واقعی و دقیقاً همانطوری که در حال تایپ کدهایتان هستید، ادامه کد را برای شما پیشبینی و تکمیل کند، بدون شک باید به سراغ Continue بروید.
پس از انجام تنظیمات، چند درخواست چت برای هوش مصنوعی بفرستید یا بگذارید چند خط کد را برایتان تکمیل (Autocomplete) کند. اگر متوجه شدید که پاسخها با تأخیر شدید ارسال میشوند یا سیستم بهشدت کند شده است، باید ابعاد مدل خود را تغییر دهید و به سراغ گزینه کوچکتری بروید که با حافظه VRAM کارت گرافیک شما سازگارتر باشد.
همچنین میتوانید دستور زیر را در ترمینال اجرا کنید تا ببینید سیستم چگونه منابع خود را بین GPU (کارت گرافیک) و CPU (پردازنده اصلی) تقسیم کرده است:
ollama ps
در یک حالت ایدهآل، شما باید به سهم 100 درصدی GPU برسید؛ چرا که پردازش روی کارت گرافیک بهمراتب سریعتر است.
محدودیتهای مدلهای لوکال؛ وقتی پای CPU به میان میآید!

مدلهای زبانی بزرگ (LLM)ها اکنون میتوانند جایگزین برخی از عملکردهای مدلهای ابری بزرگتر شوند؛ این موضوع برای کسانی که به حریم خصوصی اهمیت میدهند یا تمایلی به پرداخت هزینههای ابری ندارند، یک خبر فوقالعاده است. با این حال، این مسیر بدون عیب و نقص هم نیست.
به عنوان مثال، من از یک کارت گرافیک RTX 5070Ti با ۱۶ گیگابایت حافظه VRAM استفاده میکنم. در عمل، این یعنی در شرایط عادی نمیتوانم به سراغ مدلهایی با بیش از ۱۲ میلیارد پارامتر (مانند مدل Gemma 4 12B گوگل) بروم. چرا که مجموع حجم خود مدل و Context Window، خیلی سریع تمام این ۱۶ گیگابایت حافظه گرافیک را میبلعد!

به محض اینکه این ۱۶ گیگابایت حافظه گرافیک پر شود، سیستم فرآیند پردازش را به CPU و رم اصلی سیستم منتقل یا اصطلاحاً Offload میکند. متأسفانه اینجاست که همهچیز کند میشود.
نتیجهگیری
ترکیب هوشمندانه ابزار Ollama، افزونه Cline و یک مدل اختصاصی کدنویسی، نسخهای محلی و کاملاً شخصیسازیشده از Claude یا Copilot را در اختیارتان میگذارد؛ ابزاری که اگر روش استفاده درست از آن را بلد باشید، در تمام کارهای روزمره پایاپای شما پیش خواهد آمد. هرچند سرویسهای ابری به خاطر قدرت پردازش خام سرورهایشان همچنان مزایایی دارند، اما رویکرد لوکال دقیقاً در همان لحظهای که بحث هزینهها یا حریم خصوصی به میان میآید، ارزش واقعی خود را اثبات میکند.
اگر سختافزار مناسب را در اختیار دارید، وقت آن است که کنترل کدهایتان را خودتان به دست بگیرید، هزینههای اشتراک ماهانه را حذف کنید و طعم کدنویسی امن و آفلاین را بچشید.



