NetApp DataPelago، خالق موتور پردازش داده جهانی هسته (UDPE) را که محاسبات ناهمگن را برای تجزیه و تحلیل و هوش مصنوعی مولد سرعت می بخشد، خریداری خواهد کرد.
Nucleus که بر روی گلوتن منبع باز، Velox و Substrait ساخته شده است، Spark و Trino را به شدت سرعت میبخشد تا عملکردی مقرون به صرفه داشته باشد. بدون انتقال داده یا قفل شدن فروشنده به طور یکپارچه به خانههای موجود، SQL، Python، Airflow، Tableau، Power BI و موارد دیگر متصل میشود. DataPelago که در سال 2021 توسط مدیرعامل Rajan Goyal و CPO Anand Iyer تأسیس شد، در اکتبر 2024 از مخفی کاری خارج شد و در مجموع بیش از 75 میلیون دلار، از جمله دور تأمین مالی 47 میلیون دلاری در سال 2024، جمع آوری کرد.
جورج کوریان، مدیر عامل NetApp اظهار داشت که پیشرفت سختافزار هوش مصنوعی نیازمند زیرساخت دادهای به همان اندازه توانمند برای باز کردن ارزش دادههای سازمانی است و این خرید توانایی NetApp را برای ارائه پردازش دادههای چابک برای تمایز رقابتی تقویت میکند.
یک وبلاگ DataPelago اشاره کرد که Nucleus به صورت بومی در پلتفرم داده NetApp تعبیه شده است و امکان پذیرش سازمانی بسیار گسترده تر از آنچه استارتاپ می تواند به طور مستقل به آن دست یابد، می دهد. در اوایل سال جاری، DataPelago در فهرست نوآورترین شرکت های جهان در سال 2026 شرکت Fast در رتبه چهارم علم داده قرار گرفت.
برخلاف معماریهای سنتی که مجموعه دادهها را به خوشههای CPU/GPU خارجی تغییر میدهند، Nucleus محاسبات تسریعشده را مستقیماً در لایه ذخیرهسازی اجرا میکند. بنچمارکها در برابر Nvidia cuDF تا 10.5 برابر پیشبینیهای سریعتر، 10.1 برابر فیلترهای سریعتر و 4.3 برابر تجمعهای سریعتر را نشان میدهند. پشته آن که بین موتورهای پرس و جو (Spark، Trino، Flink) و چارچوب های Python (Ray، Dask) قرار دارد، دارای سه لایه مدولار است:
1.DataApp: ماژول ادغام قابل اتصال برای تزریق شتاب به موتورهای اسپارک، ترینو و دیگر.
2.DataOS: لایه ارکستراسیون به صورت پویا وظایف داده را به شتاب دهنده های ترکیبی برای تنظیم عملکرد مقیاس پذیر نگاشت می کند.
3.DataVM: ماشین مجازی سفارشی با ISA اختصاصی دامنه، ارائه انتزاع اجرای یکپارچه برای CPU، GPU، FPGA و سیلیکون سفارشی.
جریان اجرای داده های اصلی
1. دسترسی به داده ها از طریق کانکتورهای فریمورک: به عنوان پلاگین های Spark JAR سازگار با اتصال دهنده های داده استاندارد، پشتیبانی از پارکت، ORC، Iceberg، Delta Lake، JSON و اهداف ذخیره سازی از جمله S3، GCS، ADLS، HDFS و آرایه های اولیه استفاده می شود. شتاب به ادغامهای ذخیرهسازی گسترش مییابد در حالی که معنای پرس و جوی بومی را از طریق لایههای ورودی/خروجی موتور استاندارد حفظ میکند.
2. برنامه ریزی و بهینه سازی پرس و جو: موتور میزبان یک طرح فیزیکی تولید می کند. DataApp آن را از طریق Gluten/Substrait به یک نمایش متوسط تبدیل می کند. یک بهینه ساز هوشمند نمودارهای جریان داده بهینه را می سازد و منابع CPU/GPU را برای اجرای DataOS/DataVM تخصیص می دهد.
3. بهینه سازی انتقال داده بین سخت افزاری: ادغام اپراتور/هسته و اجرای جریان، مادیت کامل میانی را برای کاهش سربار ورودی/خروجی حذف می کند. حافظه مشترک صفر کپی، تکرار داده های CPU-GPU را کاهش می دهد، در حالی که ISA DataVM از LLVM، CUDA و ROCm برای هدایت وظایف به سخت افزار بهینه از طریق پردازش ستونی بردار استفاده می کند. این ترفندها استفاده از GPU را به 80 تا 90 درصد با به حداقل رساندن به هم زدن داده های متقابل دامنه افزایش می دهد.
Nucleus در مرحله اولیه و در سراسر ابرهای عمومی اصلی کار می کند. شتاب دهنده اسپارک آن 3 تا 4 برابر افزایش توان عملیاتی را در مقابل Databricks Photon ارائه می دهد. همچنین با سرعت بخشیدن به پردازش قالب جدول باز و خطوط لوله بالادست/پایین دست Spark/Trino که انبار را تغذیه می کنند، با Snowflake ادغام می شود. DataPelago بیان می کند که Nucleus هزینه های زیرساخت را تا 80٪ کاهش می دهد و عملکردی 10 برابر سریعتر از خطوط لوله قدیمی ارائه می دهد. با حذف تکثیر دادههای اجباری بین سیستمهای عملیاتی و هوش مصنوعی، گلوگاه اولیه که سرعت انتشار هوش مصنوعی سازمانی را کاهش میدهد، با استقرار زنده در شرکتهای بزرگ جهانی در سراسر عمودی حذف میشود.
راجان گویال، مدیرعامل DataPelago گفت که ماموریت اصلی این شرکت حل و فصل گلوگاه های پردازش داده است که مانع از نوآوری هوش مصنوعی می شود. ادغام با NetApp، فناوری شتاب موفقیت آمیز آن را با مجموعه زیرساخت داده گسترده NetApp جفت می کند. کسبوکارها سرمایهگذاری هنگفتی روی پردازندههای گرافیکی و مدلها انجام دادهاند، اما از سیلوهای داده تکهتکهای رنج میبرند که باعث میشود سختافزار مورد استفاده قرار نگیرد، و پشته ترکیبی استقرار هوش مصنوعی در مقیاس بزرگ را سادهتر میکند.
NetApp این خرید را بهعنوان یک ارتقاء نمونه کار برجسته توصیف میکند، و پردازش تسریعشده توسط GPU را مستقیماً به جریانهای کاری ذخیرهسازی میآورد تا فعالسازی دادههای سازمانی بدون کپی واقعی را برای هوش مصنوعی ارائه دهد. مبادلات مالی فاش نشده باقی می ماند. با توجه به کشش سازمانی Nucleus، هم افزایی شدید با NetApp AIDE و افزایش تقاضای هوش مصنوعی عاملی، ارزش خرید احتمالاً 4 تا 5 برابر کل بودجه 75 میلیون دلاری DataPelago است. DataPelago به عنوان یک شرکت تابعه NetApp با مالکیت کامل فعالیت خواهد کرد.
تمایز کلیدی: Nucleus در مقابل KV Cache در مقابل NetApp AIDE
1. تمایز حافظه نهان هسته و KV: Nucleus قبل از اینکه داده ها به سرورهای GPU برسند، داده های قبل از استنتاج، جذب، تبدیل و پرس و جو را بهینه می کند. KV Cache انویدیا یک بهینهسازی حافظه درون GPU است که فقط پس از ورود اطلاعات به سختافزار GPU فعال است تا کارایی تولید توکن را افزایش دهد. هسته تحویل داده ها را برای محاسبه سرعت می بخشد. KV Cache زمان اجرا مدل را پس از فرود داده ها روی شتاب دهنده ها بهینه می کند.
2.NetApp AIDE در مقابل Nucleus UDPE: AIDE یک پیش پردازش هوش مصنوعی قفل شده با ONTAP/AFX برای LLM ها و عامل ها است که به عنوان ETL اختصاصی با پایگاه داده برداری داخلی، فهرست نویسی ابرداده، سرویس RAG و یکپارچه سازی Nvidia AI Enterprise vector (از جمله سرویس های میکروسرویس NIM) کار می کند. Nucleus ذخیره سازی آگنوستیک است و بار کاری عمومی Spark/Trino را تسریع می کند. ادغام Nucleus با AIDE خطوط لوله انتقال، آموزش، تنظیم دقیق و استنتاج را تقویت میکند و بارهای کاری Lakehouse را به طور مستقیم در ذخیرهسازی NetApp AFX امکانپذیر میکند. یک راه حل انتها به انتها AIDE+Nucleus قابل پیش بینی است.
سیام نیر CPO NetApp اظهار داشت که Nucleus شتاب نرمافزاری تعریفشده را در ذخیرهسازی ارائه میدهد و امکان آمادهسازی دادههای بدون کپی، نظارت و فعالسازی هوش مصنوعی را در CPU و GPU فراهم میکند. NetApp بیش از هر رقیب دیگری دادههای چند محیطی سازمانی را مدیریت میکند و موج بعدی رقابتپذیری هوش مصنوعی به پردازش دادهها در منبع آن بستگی دارد - تیم مهندسی DataPelago این نقشه راه استراتژیک را تسریع میکند.
پکن Qianxing Jietong Technology Co., Ltd.
سندی یانگ / مدیر استراتژی جهانی
WhatsApp / WeChat: +86 13426366826
ایمیل: yangyd@qianxingdata.com
وب سایت: www.qianxingdata.com/www.storagesserver.com
تمرکز تجاری:
توزیع محصول ICT/یکپارچه سازی سیستم و خدمات/راه حل های زیرساخت
با بیش از 20 سال تجربه توزیع فناوری اطلاعات، ما با برندهای پیشرو جهانی برای ارائه محصولات قابل اعتماد و خدمات حرفه ای همکاری می کنیم.
«استفاده از فناوری برای ساختن جهانی هوشمند» ارائهدهنده خدمات مورد اعتماد شما در زمینه فناوری اطلاعات و ارتباطات!