رویداد 2026 پیشرفت هوش مصنوعی AMD، مقیاس و باز بودن را در اولویت قرار داد و GPU MI455X مبتنی بر CDNA 5 ، سیستم هلیوس 72-GPU و پردازنده های 6th-Gen EPYC Venice را معرفی کرد.اين بررسي به پلتفرم هاي MI455X و هليوس مربوط ميشه، با جزئیات CPU ونیز در یک مقاله اختصاصی.
MI455X دارای حافظه 432GB HBM4 است که 50٪ بیشتر از NVIDIA Rubin / B300 است. 288GB 23,3TB / s پهنای باند حافظه و 40.26 PFLOPS MXFP4 محاسبه می کند. یک قفسه کامل هلیوس 2.9 exaFLOPS FP4، HBM4 کل 31TB، پهنای باند حافظه 1.7PB/s، مقیاس 260TB/s و پهنای باند مقیاس 43TB/s، اطمینان از عملکرد رف AI سطح بالا.
استانداردهای باز Helios را از انتهای به انتهای تعریف می کنند، از جمله پارچه UALoE درون قفسه، مقیاس بندی Ultra Ethernet، فرمت های OCP با دقت پایین و شاسی Open Rack Wide، به علاوه نرم افزار ROCm کاملاً منبع باز.به عنوان یک طراحی مرجع باز، از سفارشی سازی کامل شبکه ، قدرت و مدیریت پشتیبانی می کند. کاربران اصلی OpenAI ، Meta ، Anthropic ، Microsoft و Oracle هستند.
AMD Instinct MI455X: GPU پرچمدار CDNA 5
بسته بندی شده از طریق TSMC CoWoS-L ، ترانزیستور 320 میلیارد MI455X شامل هشت N2 XCD ، دو N3 I / O dies ، دو N3 Fabric & Cache Dies (FCD) و دوازده هارد HBM4 است.رابط HBM4 2048 بیتی آن در هر استیک 23پهنای باند.3TB/s، همراه با دو کیش 96MB FCD L2 با سرعت 54TB/s.
قابلیت های I / O شامل پهنای باند مقیاس UALoE دو طرفه 3.6TB / s ، 256GB / s پیوند CPU-GPU Infinity Fabric و مقیاس پذیری انعطاف پذیر از طریق دو پورت PCIe Gen6 x16 یا سه AI-NIC است.این عملکرد از GPU های AMD نسل قبلی و NVIDIA ¢s Rubin / B300 در اکثر معیارهای کلیدی فراتر می رود.
مقایسه مشخصات کلیدی
|
مشخصات
|
AMD MI455X
|
NVIDIA Rubin
|
AMD MI355X
|
NVIDIA B300
|
|
معماری
|
CDNA 5
|
روبین
|
CDNA 4
|
بلک ول اولترا
|
|
ترانزیستورها
|
320B
|
336B
|
185B
|
208B
|
|
ظرفیت HBM
|
432GB HBM4
|
288GB HBM4
|
288GB HBM3E
|
288GB HBM3E
|
|
پهنای باند HBM
|
23.3TB/s
|
۲۲ ترابایت در ثانیه
|
8TB/s
|
8TB/s
|
|
مقیاس بندی در هر GPU
|
3.6TB/s
|
3.6TB/s
|
1.08TB/s
|
1.8TB/s
|
|
مقیاس بندی در هر GPU
|
۲۴۰۰ گیگابایت در ثانیه
|
1600 گیگابایت در ثانیه
|
۴۰۰ گیگابایت در ثانیه
|
۸۰۰ گیگابایت در ثانیه
|
|
ارتباط CPU-GPU
|
۲۵۶ گیگابایت در ثانیه
|
1.8TB/s C2C
|
PCIe 5
|
900GB/s C2C
|
MI455X در ظرفیت HBM ، پهنای باند حافظه و سرعت مقیاس پذیری رقبای خود را هدایت می کند ، عملکرد مقیاس پذیری روبین را از طریق UALoE مطابقت می دهد تا شکاف طولانی مدت NVLink NVIDIA را برطرف کند.پیوند قوی تر C2C CPU-GPU NVIDIA همچنان مزیت سخت افزاری اصلی آن است، تفاوت های اصلی پلتفرم را ایجاد می کند.
مقایسه محاسبات
|
فرمت دقیق
|
AMD MI455X
|
NVIDIA Rubin
|
AMD MI355X
|
NVIDIA B300
|
|
MXFP4 / NVFP4
|
40.26 PF
|
35 PF
|
10.1 PF
|
15 PF
|
|
MXFP6 / FP6
|
20.13 PF
|
17.5 PF
|
10.1 PF
|
5 PF
|
|
MXFP8 / FP8
|
20.13 PF
|
17.5 PF
|
5 PF
|
5 PF
|
|
FP16 / BF16
|
5.03 PF
|
4 PF
|
2.5 PF
|
2.5 PF
|
|
FP32
|
315 TF
|
130 TF
|
157.3 TF
|
75 TF
|
در مقایسه با MI355X، MI455X سرعت سرعت کم دقت را چهار برابر می کند و عملکرد دقیق استاندارد را دو برابر می کند.روبین را 15 درصد در دقت پایین و 26 درصد در FP16/BF16 هدایت می کند.، و مزایای 2.4x FP32 را برای وزنه های هوش مصنوعی با دقت بالا و حجم کار HPC فراهم می کند.
CDNA 5 ارتقاء معماری
با حفظ 8 XCD و 256 واحد اجرا از CDNA 4 ، CDNA 5 ساختارهای محاسباتی داخلی را اصلاح کرد. هر XCD به دو موتور Shader با 16 پردازنده گروه کاری فعال (WGP) تقسیم می شود.اجرای Wave32 بومی جایگزین Wave64 می شود، کاهش مجازات انحراف، کاهش فشار رژستر و دو برابر کردن موج های همزمان در هر WGP به 64 برای پنهان کردن تاخیر حافظه بهتر.
واحدهای طراحی مجدد SIMD امکان اجرای موازی، شتاب BF16 بومی و دستورالعمل های تبدیل تنسور جدید را فراهم می کند،با دوبرابر شدن خروجی فوق العاده و پشتیبانی بومی تان برای افزایش عملکرد ترانسفورم. یک انتقال دهنده داده تنسور 5D جدید در هر WGP از جریان تنسور بی هم زمان پشتیبانی می کند ، که با قابلیت های شتاب دهنده تنسور اختصاصی NVIDIA مطابقت دارد.
سلسله مراتب حافظه بهینه شده
سی دی ان ای 5 از هر XCD L2 جدا شده و کیش بی نهایت جهانی را حذف کرد و دو کیش L2 مبتنی بر FCD 96MB را با پهنای باند کل 3 برابر بیشتر از سی دی ان ای 4 اتخاذ کرد.حافظه کش منسجم واحد سرعت بخش اتم دستگاه است و 4 برابر پهنای باند خواندن موثر را از طریق چندرسانه سازی تنسور ارائه می دهد.
ذخیره سازی بر روی تراشه WGP به 384 کیلو بایت دو برابر شده است، که امکان FlashAttention کامل در حافظه و اقامت هسته MoE را فراهم می کند.شکل دادن پایه ی GPUs AI performance edge.
پارتیشن سازی و مجازی سازی گرافیک
طراحی دو FCD از حالت های انعطاف پذیر NPS NUMA پشتیبانی می کند: حافظه کامل GPU یکپارچه از طریق NPS1 ، یا دو دامنه منزوی با تاخیر کم با حافظه حافظه خصوصی L2 از طریق NPS2.بخش بندی فضایی 1/2/4/8 راه قابل تنظیم و مجازی سازی SR-IOV امکان پذیر است، استفاده از گرافیک چند مستاجر جدا شده از سخت افزار.
پلت فرم AMD Helios Rack-Scale
هلیوس از شاسی گسترده OCP Open Rack AMD استفاده می کند که دارای 72 GPU MI455X در 18 تراشه محاسباتی و 6 سویچ است.با کابل های کور پشت برای تعمیرات بدون ابزار.
طراحی سینی محاسبات
هر سینی 4 GPU MI455X را با یک پردازنده 96 هسته ای 5GHz Venice SP7 برای اتصال یک پردازنده-GPU منسجم 1:4 از طریق Infinity Fabric جفت می کند.سخت افزار SP7 سوکت شده از ارتقاء به پردازنده های استاندارد 256 هسته ای یا بهینه سازی شده برای کش Venice-X پشتیبانی می کند، با حداکثر 4TB DRAM و 1.6TB/s پهنای باند حافظه در هر سینی.
سه شبکه مستقل در هر سینی کار می کنند: یک DPU Salina 400G برای دسترسی به مرکز داده های فرنتند؛ 3 NIC 800G Vulcano در هر GPU برای پهنای باند مقیاس 2400Gb / s که توسط CPU دور زده می شود؛و 36 پیوند UALoE در هر GPU برای 3.6TB/s پهنای باند افزوده حافظه مشترک در سراسر راک
پارچه سوئیچ و قابلیت اطمینان
هلیوس از 12 سوئیچ Broadcom Tomahawk 6 استفاده می کند یک سوم تعداد NVSwitch NVIDIA ارائه پهنای باند مقیاس کامل در هر GPU 3.6TB / s از طریق استاندارد L2 Ethernet.توپولوژی تک لایه همه به همه تضمین تاخیر کم یکنواخت در تمام GPU ها.
پارچه ی 12 طبقه ای از کاهش عملکرد و تغییر مسیر اتوماتیک ترافیک در هنگام خرابی های سخت افزاری پشتیبانی می کندپوشه های مجازی AES-256 رمزگذاری شده (vPods) امکان تقسیم بندی چند مستاجر انعطاف پذیر را فراهم می کنند، محدود کردن خرابی ها به گچ های فردی و پشتیبانی از حالت های استقرار از آموزش کامل تا برش GPU خرد.
استیک مدیریت
AMD Fabric Manager (AFM) ارائه می دهد ارائه قفسه صفر لمس، orkestra vPod و بازیابی خطا از طریق کنترل کننده های توزیع شده اضافی.ساخته شده بر روی معماری کوبرنتس و سیستم عامل SONiC باز با پشتیبانی UALoE، این قابلیت مشاهده کامل و ادغام استاندارد API را با برنامه نویس های خوشه ای فراهم می کند.
هلیوس در مقابل NVIDIA Vera Rubin NVL72
هیلیوس NVL72 را با HBM 50٪ بالاتر (31TB در مقابل 20.7TB) ، پهنای باند مقیاس بندی 50٪ سریع تر در هر GPU و سرعت مقیاس گذاری معادل با قطعات سوئیچ کمتر از NVL72 رد می کند.تست AMD 10 ٪15٪ از هر GPU و تا 30٪ از هر دلار در باره بار کاری Kimi K2.
تعادل های معماری این دو سیستم عامل را تعریف می کند: NIC های مستقیم GPU-Helios® تاخیر انتقال CPU را از بین می برند ، در حالی که NVIDIA® NIC ها به پیوندهای Vera CPU C2C تکیه می کنند ، که باعث اختلاف پهنای باند می شود.NVIDIA در ذخیره سازی GPUDirect بومی و نرم افزار DOCA کاربر پسند پیشرو است، در حالی که DPU قابل برنامه ریزی P4 AMD، توسعه شبکه های سفارشی در مقیاس بالا را ترجیح می دهد.
بزرگترین مزیت هلیوس این است که می تواند به طور کامل در CPU ها، حافظه، شبکه و بودجه های انرژی، در مقایسه با پیکربندی سوپرچیپ ثابت NVIDIA تنظیم شود.
اکوسیستم نرم افزار DPU و ROCm.AI
400G Salina DPU SDN قابل برنامه ریزی، تخلیه امنیتی و مجازی سازی NVMe-over-Fabrics را فراهم می کند.KV cache offload منحصر به فرد آن، کمبود GPUDirect Storage را با ریختن بیش از حد AI cache به فضای ذخیره سازی خارجی در سرعت خط، جبران می کند..
ROCm.AI که در ماه اوت راه اندازی شد، 3.3x نتیجه گیری و 2.4x دستاوردهای آموزشی را در مقایسه با ROCm 7 از طریق ابزارهای توسعه دهنده AI، بهینه سازی مستقل Hyperloom و کنترل سطح پایین FlyDSL ارائه می دهد.آمريكا در حال انتشار مقايسه هاي دنياى واقعي به 50 درصد از اوج FP4 MI455X رسیده است.
MXFP4 و NVFP4 مکانیسم های مقیاس بندی متفاوتی را اتخاذ می کنند که باعث می شود مقایسه FLOPS اوج فروشنده نسبت به خروجی توکن در سطح برنامه کمتر قابل اعتماد باشد.با فضای کافی برای بهینه سازی بیشتر ROCm در پیاده سازی تولید.
نتیجه گیری
هلیوس AMD را به عنوان رقیب مستقیم سیستم های ریک هوش مصنوعی پرچمدار NVIDIA ایجاد می کند، که ظرفیت HBM پیشرو در صنعت را ارائه می دهد، شبکه های مقیاس برتر،سخت افزار باز مقرون به صرفه و قابلیت سفارشی سازی کامل مشتریبا پشتیبانی از پذیرش هایپر اسکیلر، یک نقشه راه 2027-2028 GPU و نرم افزار ROCm بالغ،AMD زیرساخت رقابتی AI را برای چالش کشیدن تسلط طولانی مدت NVIDIA در مقیاس قفسه ساخته است.
شرکت فناوری چینجینگ جیوتونگ پکن، لمیتد
سندي يانگ، مدير استراتژي جهاني
واتساپ / وی چت: +86 13426366826
ایمیل: yangyd@qianxingdata.com
وب سایت: www.qianxingdata.com/www.storagesserver.com
تمرکز کسب و کار:
توزیع محصولات ICT / ادغام سیستم و خدمات / راه حل های زیرساخت
با 20+ سال تجربه توزیع فناوری اطلاعات، ما با مارک های پیشرو جهانی همکاری می کنیم تا محصولات قابل اعتماد و خدمات حرفه ای را ارائه دهیم.
استفاده از تکنولوژی برای ساختن یک جهان هوشمند، ارائه دهنده خدمات قابل اعتماد محصولات ICT شما
سندي يانگ، مدير استراتژي جهاني
واتساپ / وی چت: +86 13426366826
ایمیل: yangyd@qianxingdata.com
وب سایت: www.qianxingdata.com/www.storagesserver.com
تمرکز کسب و کار:
توزیع محصولات ICT / ادغام سیستم و خدمات / راه حل های زیرساخت
با 20+ سال تجربه توزیع فناوری اطلاعات، ما با مارک های پیشرو جهانی همکاری می کنیم تا محصولات قابل اعتماد و خدمات حرفه ای را ارائه دهیم.
استفاده از تکنولوژی برای ساختن یک جهان هوشمند، ارائه دهنده خدمات قابل اعتماد محصولات ICT شما



