کسب و کار

هوش مصنوعی در دنیای واقعی ایران به چه زیرساختی نیاز دارد؟

از خودروهای هوشمند تا فوتبال؛ هوش مصنوعی در دنیای واقعی به چه زیرساختی نیاز دارد؟

تا چند سال پیش وقتی درباره هوش مصنوعی صحبت می‌شد، ذهن بسیاری از افراد به آزمایشگاه‌های تحقیقاتی و پروژه‌های دانشگاهی می‌رفت. امروز شرایط کاملاً متفاوت است. هوش مصنوعی وارد خودرو، ورزش، کارخانه، سیستم‌های نظارتی، پزشکی، فروشگاه‌های آنلاین و حتی نرم‌افزارهایی شده که روزانه با آن‌ها کار می‌کنیم.

اما پشت بسیاری از این قابلیت‌ها یک بخش کمتر دیده‌شده قرار دارد: زیرساخت پردازشی.

مدل هوش مصنوعی برای اینکه بتواند میلیون‌ها تصویر را بررسی کند، ویدئوها را تحلیل کند یا الگوهای پیچیده را یاد بگیرد، به CPU، GPU، حافظه، Storage و شبکه نیاز دارد. هرچه حجم داده و مدل بزرگ‌تر شود، اهمیت انتخاب زیرساخت مناسب نیز افزایش پیدا می‌کند.

به همین دلیل سؤال اصلی دیگر فقط این نیست که «کدام مدل هوش مصنوعی بهتر است؟»؛ بلکه باید پرسید:

این مدل قرار است روی چه سخت‌افزاری آموزش ببیند و اجرا شود؟

خرید سرور اچ پی

هوش مصنوعی از دیتاسنتر خارج شده است

یکی از مهم‌ترین تغییرات سال‌های اخیر، حضور AI در محیط‌های واقعی است.

خودرو یک نمونه واضح است. خودروهای جدید می‌توانند از دوربین، رادار، سنسورهای اولتراسونیک، GPS و سیستم‌های مختلف برای درک محیط استفاده کنند.

بخش مهمی از تصمیم‌های فوری باید داخل خود خودرو انجام شود؛ زیرا برای مثال ترمز اضطراری نمی‌تواند اطلاعات را به یک دیتاسنتر در نقطه‌ای دیگر ارسال کند و منتظر پاسخ بماند.

این نوع پردازش محلی را معمولاً Edge Computing می‌نامند.

اما به این معنی نیست که دیتاسنتر دیگر نقشی ندارد.

داده‌های آزمایش جاده‌ای، ویدئوها، گزارش خطا و اطلاعات حسگرها می‌توانند برای توسعه و آموزش الگوریتم‌ها در زیرساخت‌های مرکزی پردازش شوند. در مطلب خودروهای هوشمند چگونه اطلاعات را پردازش می‌کنند؟ این ارتباط میان سنسورها، Edge Computing، دیتاسنتر و پردازش هوش مصنوعی با جزئیات بیشتری بررسی شده است. (رانتو)

چرا خودروهای هوشمند حجم زیادی داده تولید می‌کنند؟

یک دوربین با وضوح بالا به‌تنهایی می‌تواند حجم قابل توجهی داده تولید کند. حالا تصور کنید چند دوربین در کنار Radar، LiDAR، GPS و سایر Sensorها دائماً در حال ثبت اطلاعات باشند.

ارسال و نگهداری تمام این اطلاعات همیشه منطقی نیست.

به همین دلیل داده‌ها معمولاً فیلتر، فشرده و اولویت‌بندی می‌شوند. اطلاعات مهم‌تر برای تحلیل و توسعه مدل نگهداری می‌شوند و داده‌های غیرضروری ممکن است حذف شوند.

در محیط‌های تحقیقاتی، شرایط متفاوت است. یک ناوگان آزمایشی می‌تواند دیتاست بسیار بزرگی از شرایط واقعی جاده ایجاد کند. برای آموزش مدل‌های تشخیص خودرو، عابر، خطوط جاده یا تابلوها این اطلاعات ارزش زیادی دارند، اما پردازش آن‌ها نیز منابع سخت‌افزاری قدرتمندی می‌طلبد. (رانتو)

فوتبال هم به یک پروژه Data تبدیل شده است

هوش مصنوعی فقط وارد خودرو نشده است.

ورزش حرفه‌ای نیز به شکل گسترده‌تری از داده استفاده می‌کند.

در یک مسابقه فوتبال می‌توان اطلاعاتی مانند موقعیت بازیکنان، سرعت، مسیر حرکت، تعداد پاس، مناطق تحت فشار و ده‌ها متغیر دیگر را استخراج کرد.

اگر چند دوربین مسابقه را به‌صورت همزمان ضبط کنند، سیستم AI می‌تواند ویدئوها را پردازش کرده و بازیکن، توپ یا رخدادهای مختلف را شناسایی کند.

این اطلاعات می‌توانند در تحلیل تاکتیکی، ارزیابی عملکرد بازیکنان یا حتی استعدادیابی مورد استفاده قرار بگیرند.

چرا پردازش ویدئو برای AI سنگین است؟

ویدئو در واقع مجموعه‌ای از تعداد زیادی تصویر است.

اگر یک سیستم بخواهد در هر Frame بازیکنان، توپ، خودرو یا عابر را تشخیص دهد، باید تعداد بسیار زیادی عملیات ریاضی انجام دهد.

این مسئله وقتی چند دوربین به‌طور همزمان وارد سیستم شوند دشوارتر می‌شود.

برای مثال ممکن است یک پروژه لازم داشته باشد:

  • چند Stream ویدئویی را دریافت کند

  • Frameها را Decode کند

  • مدل تشخیص تصویر را اجرا کند

  • نتیجه هر Frame را ثبت کند

  • اطلاعات را در Database ذخیره کند

  • ویدئوی اصلی را نیز آرشیو کند

همین مثال نشان می‌دهد که یک AI Server فقط به کارت گرافیک محدود نمی‌شود.

CPU، RAM، GPU، Storage و Network باید به صورت متعادل انتخاب شوند.

چرا GPU در هوش مصنوعی این‌قدر مهم شده است؟

CPU پردازنده‌ای عمومی است و برای اجرای مجموعه متنوعی از دستورها طراحی شده است.

GPU معماری متفاوتی دارد و می‌تواند تعداد بسیار زیادی عملیات مشابه را به صورت موازی انجام دهد.

این ویژگی دقیقاً با بخش بزرگی از محاسبات مورد استفاده در Deep Learning همخوانی دارد.

آموزش شبکه‌های عصبی شامل تعداد بسیار زیادی عملیات ماتریسی است. انجام این عملیات روی CPU امکان‌پذیر است، اما GPU در بسیاری از Workloadهای یادگیری عمیق به دلیل معماری موازی گزینه بسیار مناسب‌تری محسوب می‌شود. (روزنامه صمت)

در راهنمای چرا GPU برای هوش مصنوعی اهمیت دارد؟ نقش GPU، حافظه گرافیکی و تفاوت آن با RAM سیستم با جزئیات بیشتری توضیح داده شده است. (دیلی تک)

VRAM؛ عددی که گاهی از قدرت GPU مهم‌تر می‌شود

یکی از اولین مشخصاتی که هنگام انتخاب GPU برای AI باید بررسی شود مقدار VRAM است.

VRAM حافظه‌ای است که مستقیماً در اختیار GPU قرار دارد.

وزن‌های مدل، داده ورودی و بخشی از اطلاعات موردنیاز محاسبات باید در این حافظه قرار بگیرند.

اگر مدلی به حافظه‌ای بیشتر از ظرفیت GPU نیاز داشته باشد، حتی ممکن است یک کارت از نظر قدرت پردازشی مناسب باشد اما اجرای مدل روی آن دشوار یا غیرممکن شود. انتقال مداوم داده بین RAM سیستم و VRAM نیز می‌تواند عملکرد را کاهش دهد. (دیلی تک)

به همین دلیل نباید GPUها را فقط براساس تعداد Core یا قدرت خام مقایسه کرد.

در پروژه AI باید حداقل این موارد بررسی شوند:

  • ظرفیت VRAM

  • پهنای باند حافظه

  • نوع مدل

  • Training یا Inference

  • Batch Size

  • تعداد کاربران

  • تعداد GPU

  • امکان توسعه آینده

CPU هنوز نقش مهمی دارد

GPU قدرتمند به معنی بی‌اهمیت شدن CPU نیست.

CPU همچنان وظایفی مانند اجرای سیستم‌عامل، مدیریت سرویس‌ها، آماده‌سازی Data، اجرای Database و هماهنگی بین اجزای مختلف سیستم را انجام می‌دهد.

در بسیاری از پروژه‌ها CPU باید اطلاعات را آماده کرده و به GPU تحویل دهد.

اگر CPU، RAM یا Storage نتوانند اطلاعات را با سرعت مناسب در اختیار GPU قرار دهند، کارت گرافیک بخشی از زمان خود را منتظر می‌ماند.

بنابراین یک سرور AI مناسب باید متعادل باشد.

RAM سیستم چقدر باید باشد؟

هیچ عدد ثابتی برای تمام پروژه‌ها وجود ندارد.

مقدار RAM به نوع مدل، حجم Dataset، تعداد کاربران و نحوه بارگذاری اطلاعات بستگی دارد.

برای پروژه‌های کوچک شاید 64 یا 128 گیگابایت حافظه کافی باشد، در حالی که یک سرور Multi-GPU می‌تواند به چند صد گیگابایت یا حتی بیشتر نیاز پیدا کند.

نکته مهم این است که RAM و VRAM دو چیز متفاوت هستند.

وجود 512GB RAM نمی‌تواند جای یک GPU با حافظه مناسب را بگیرد و بالعکس.

Storage؛ بخشی که معمولاً دیر به آن توجه می‌شود

فرض کنید چند GPU قدرتمند در سرور نصب کرده‌اید، اما Dataset روی Storage بسیار کند قرار دارد.

در این حالت GPU باید دائماً منتظر خوانده شدن فایل‌ها بماند.

نتیجه این است که سخت‌افزار گران‌قیمت به شکل کامل مورد استفاده قرار نمی‌گیرد.

برای همین در بسیاری از پروژه‌های AI از چند لایه Storage استفاده می‌شود.

NVMe برای دیتاست فعال و فایل‌هایی که دائماً خوانده می‌شوند.

SSD برای سیستم‌عامل، نرم‌افزارها و اطلاعات سریع.

HDD Enterprise برای آرشیو حجیم، Backup و Datasetهایی که فعلاً مورد استفاده نیستند.

این معماری می‌تواند هزینه هر ترابایت را کنترل کند و در عین حال داده فعال را با سرعت بالا در اختیار سیستم قرار دهد.

شبکه در پروژه‌های AI اهمیت بیشتری پیدا می‌کند

اگر تمام پردازش روی یک Server انجام شود، ممکن است Network اهمیت کمتری داشته باشد.

اما پروژه‌های بزرگ معمولاً از چند سیستم استفاده می‌کنند.

ممکن است Dataset روی Storage Server قرار داشته باشد، چند GPU Server عملیات پردازش را انجام دهند و Backup نیز روی سیستم دیگری نگهداری شود.

در چنین شرایطی ارتباط 1GbE می‌تواند گلوگاه بزرگی ایجاد کند.

بسته به حجم پروژه ممکن است 10GbE، 25GbE، 100GbE یا زیرساخت‌های سریع‌تر مورد نیاز باشند.

هرچه تعداد Nodeها و میزان جابه‌جایی Data بیشتر شود، طراحی شبکه اهمیت بیشتری پیدا می‌کند.

سرور گرافیکی چه تفاوتی با یک سرور معمولی دارد؟

از نظر پایه، سرور گرافیکی نیز یک Server است؛ اما طراحی آن باید برای نصب و استفاده پایدار از GPU مناسب باشد.

یک GPU دیتاسنتری ممکن است توان مصرفی بالایی داشته باشد، چند Slot اشغال کند و گرمای زیادی تولید کند.

بنابراین تنها وجود اسلات PCIe کافی نیست.

موارد زیر اهمیت دارند:

تعداد PCIe Lane، فاصله Slotها، Riser، Power Supply، کابل برق GPU، Fan، Airflow و ظرفیت شاسی.

برای همین برخی مدل‌های سروری اساساً برای Accelerated Computing طراحی شده‌اند.

اگر قصد آشنایی بیشتر با این دسته تجهیزات را دارید، مقاله معرفی سرورهای گرافیکی HPE مدل‌های مختلف HPE برای GPU و تفاوت نقش CPU و GPU را بررسی کرده است. (روزنامه صمت)

آیا HPE DL380 برای GPU مناسب است؟

DL380 یکی از شناخته‌شده‌ترین سرورهای دو یونیت HPE است و به دلیل فضای توسعه بیشتر نسبت به سرورهای 1U، در بسیاری از پروژه‌های سازمانی مورد استفاده قرار می‌گیرد.

مزیت اصلی این خانواده انعطاف‌پذیری آن است.

بسته به نسل و کانفیگ می‌توان مقدار زیادی RAM، Storage، NIC و کارت توسعه روی آن نصب کرد و بعضی پیکربندی‌ها نیز برای GPU مناسب هستند. (نبض نت | نبض کسب و کار شما)

اما این نکته بسیار مهم است:

اینکه یک سرور «DL380» باشد به‌تنهایی تضمین نمی‌کند که هر GPU روی آن نصب شود.

باید نسل سرور، نوع GPU، Riser، Power Supply، Cooling و کیت‌های موردنیاز به‌طور جداگانه بررسی شوند.

سرور رک‌مونت یا Tower؟

قبل از انتخاب CPU و GPU حتی باید مشخص شود سرور در چه محیطی قرار است نصب شود.

دو فرم اصلی سرورهای HPE عبارت‌اند از Rackmount و Tower.

سرور Tower از نظر شکل به یک کیس بزرگ کامپیوتر شباهت دارد و برای مجموعه‌هایی که اتاق سرور یا Rack استاندارد ندارند گزینه ساده‌تری است.

خانواده‌هایی مانند ML30، ML110 و ML350 در این گروه قرار می‌گیرند.

در مقابل Rack Server برای نصب در رک طراحی شده است و ارتفاع آن با واحد U مشخص می‌شود. مدل‌هایی مثل DL360 و DL380 از معروف‌ترین نمونه‌های Rackmount هستند. (خبرگزاری هنر ایران)

برای بررسی جزئی‌تر می‌توانید راهنمای تفاوت کیس سرور HP ایستاده و رک‌مونت را مطالعه کنید.

چه زمانی Tower انتخاب بهتری است؟

Tower Server برای دفتر یا شرکت کوچکی که زیرساخت Rack ندارد می‌تواند انتخاب مناسبی باشد.

راه‌اندازی آن ساده‌تر است و برای استفاده داخل محیط اداری نیز طراحی شده است.

اما با افزایش تعداد سرورها، Rackmount معمولاً مدیریت منظم‌تری ایجاد می‌کند.

در دیتاسنتر، استفاده از Rack باعث می‌شود تجهیزات Server، Switch، Storage و UPS در ساختار مشخصی کنار یکدیگر قرار گیرند.

قیمت سرور فقط قیمت شاسی نیست

یکی از اشتباهات رایج هنگام استعلام قیمت سرور، مقایسه صرف مدل دستگاه است.

دو سرور HPE DL380 ممکن است از بیرون کاملاً شبیه باشند، اما قیمت آن‌ها چند برابر متفاوت باشد.

دلیل این اختلاف می‌تواند موارد زیر باشد:

  • نسل سرور

  • مدل CPU

  • تعداد CPU

  • حجم RAM

  • نوع و تعداد SSD یا HDD

  • RAID Controller

  • NIC

  • Power Supply

  • Drive Cage

  • Riser

  • GPU

  • Rail Kit

  • وضعیت نو یا استوک

بنابراین سؤال «DL380 چقدر است؟» بدون مشخص بودن کانفیگ پاسخ دقیقی ندارد.

مقاله راهنمای خرید و قیمت سرور اچ پی در ایران مدل‌هایی مانند DL360 و DL380 و تفاوت کاربرد نسل‌های مختلف HPE را بررسی کرده و می‌تواند برای مقایسه اولیه کانفیگ‌ها مفید باشد. (نبض نت | نبض کسب و کار شما)

سرور نو بخریم یا استوک؟

این تصمیم کاملاً به نوع پروژه بستگی دارد.

برای یک File Server یا Backup Server داخلی ممکن است یک نسل قبلی HPE همچنان کاملاً مناسب باشد.

اما پروژه‌ای که به جدیدترین GPU، NVMe سریع، PCIe جدید یا مقدار بسیار زیاد RAM نیاز دارد، معمولاً از نسل‌های جدیدتر بیشتر بهره می‌برد.

سرور استوک در صورتی که قطعات آن به‌درستی تست شده باشند می‌تواند هزینه راه‌اندازی را کاهش دهد.

اما در پروژه‌های Critical باید وضعیت قطعات، عمر Storage، Power Supply، Fanها و Controllerها نیز بررسی شوند.

برای AI Server از کجا شروع کنیم؟

قبل از خرید سخت‌افزار بهتر است چند سؤال پاسخ داده شوند:

  1. قرار است چه مدلی اجرا شود؟

  2. Training انجام می‌شود یا فقط Inference؟

  3. حداقل VRAM موردنیاز چقدر است؟

  4. Dataset چه حجمی دارد؟

  5. چند کاربر همزمان از سیستم استفاده خواهند کرد؟

  6. آیا یک GPU کافی است؟

  7. آیا در آینده تعداد GPU افزایش پیدا می‌کند؟

  8. چه مقدار Storage سریع نیاز داریم؟

  9. حجم Archive چقدر است؟

  10. شبکه فعلی چه سرعتی دارد؟

بدون پاسخ به این سؤال‌ها، خرید براساس نام کارت گرافیک یا مدل سرور می‌تواند به یک کانفیگ نامتعادل منجر شود.

یک پروژه کوچک هوش مصنوعی به چه سیستمی نیاز دارد؟

برای پروژه‌های کوچک الزاماً نیازی به یک سرور چند GPU بسیار گران وجود ندارد.

یک سیستم با پردازنده چند‌هسته‌ای مناسب، RAM کافی، NVMe و یک GPU متناسب با مدل ممکن است نیاز پروژه را پوشش دهد.

اما اگر Dataset و Model رشد کنند باید امکان توسعه نیز در نظر گرفته شود.

در اینجا انتخاب شاسی اهمیت پیدا می‌کند.

سروری که امروز فقط یک GPU دارد اگر امکان نصب کارت دوم را نداشته باشد، ممکن است خیلی زود به محدودیت برسد.

پروژه‌های حرفه‌ای چه تفاوتی دارند؟

در پروژه‌های بزرگ شرایط پیچیده‌تر است.

ممکن است چند GPU دیتاسنتری، صدها گیگابایت RAM، چند NVMe و ارتباط شبکه بسیار سریع لازم باشد.

در چنین سیستمی Power و Cooling اهمیت بسیار زیادی پیدا می‌کنند.

همچنین Backup و Storage باید از ابتدا طراحی شوند. خروجی چند ماه Training یا یک Dataset ارزشمند نباید فقط روی Storage اصلی قرار داشته باشد.

برای مثال در تحلیل ورزشی حرفه‌ای، علاوه بر GPU، حجم آرشیو ویدئویی نیز می‌تواند به بخش بزرگی از پروژه تبدیل شود؛ به همین دلیل ترکیبی از NVMe برای داده فعال و HDD Enterprise برای آرشیو می‌تواند منطقی باشد. (بتاکاپ)

آینده AI به سخت‌افزار متعادل وابسته است

رقابت شرکت‌ها فقط بر سر مدل‌های بزرگ‌تر نیست.

هزینه اجرای این مدل‌ها نیز اهمیت بسیار زیادی دارد.

یک GPU سریع که دائماً منتظر Storage یا Network است، سرمایه‌گذاری مناسبی نیست.

به همین دلیل طراحی زیرساخت باید به‌صورت یک سیستم کامل انجام شود.

CPU + GPU + RAM + Storage + Network + Power + Cooling

تمام این اجزا باید متناسب با یکدیگر انتخاب شوند.

جمع‌بندی

هوش مصنوعی امروز از خودرو تا فوتبال و از کارخانه تا سرویس‌های اینترنتی حضور دارد.

در یک خودرو، بخش مهمی از پردازش باید در Edge و با تأخیر بسیار پایین انجام شود. در فوتبال، چندین جریان ویدئویی می‌توانند برای تحلیل بازیکنان و رخدادهای مسابقه پردازش شوند. در دیتاسنتر نیز GPUها برای آموزش و اجرای مدل‌های بزرگ‌تر وارد عمل می‌شوند.

اما GPU تنها بخش ماجرا نیست.

VRAM، CPU، RAM، NVMe، HDD، شبکه، پاور و خنک‌کننده همگی روی نتیجه نهایی تأثیر دارند.

همین موضوع در انتخاب سرور HPE نیز صدق می‌کند. قبل از انتخاب DL360، DL380، ML350 یا یک مدل GPU محور باید Workload، تعداد کارت‌ها، ظرفیت Storage و برنامه توسعه آینده مشخص شوند.

بهترین AI Server الزاماً گران‌ترین سرور موجود نیست؛ بلکه سروری است که برای مدل و Dataset واقعی پروژه طراحی شده باشد و هیچ‌کدام از اجزای آن به گلوگاه جدی تبدیل نشوند.

مشاهده بیشتر

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

دکمه بازگشت به بالا