پذیرش هوش مصنوعی در حال حاضر به دلیل هزینه های بالای توکن و عدم وضوح قیمت گذاری مقدماتی برای درخواست های هوش مصنوعی، که منجر به هزینه بیش از حد غیرقابل کنترل توکن می شود، مانع می شود.این خطر به شدت توسط عوامل هوش مصنوعی تقویت می شود.، که در حال حاضر بدون محدودیت هزینه های رمزگذاری شده کار می کنند و می توانند انفجار هزینه های شدید را ایجاد کنند.
این مقاله توضیح می دهد که توکن های هوش مصنوعی چیست، قیمت گذاری توکن چگونه کار می کند و استراتژی های عملی برای جلوگیری از هزینه های فاجعه بار توکن.یک مورد کسب و کار که به خوبی مستند شده بود، نشان داد که یک سازمان 500 دلار,000به طور جداگانه، تیم مهندسی اوبر گزارش می دهد که کل بودجه هوش مصنوعی 2026 خود را قبل از زمان برنامه ریزی کرده است.توکن ها واحدهای اساسی هستند که مدل های زبان بزرگ (LLM) و چت بات ها برای تجزیه درخواست های زبان انسان و تولید خروجی هوش مصنوعی منسجم استفاده می کنند.
به عنوان مثال، پرس و جو ورودی "به من در مورد رسوب بگویید" به اجزای توکن جداگانه تقسیم می شود:
-بگو
-من
-در حدود
- رسوب
-تعلیم
این تجزیه پنج توکن برای کلمه ی واحد "زنجش" به LLM ها کمک می کند تا ساختار و معنای کلمات را به درستی تفسیر کنند.تقسیم ریشه و پسوند اجازه می دهد تا مدل استفاده مداوم پسوند را در بسیاری از اسم ها تشخیص دهد.این رویکرد محدوده جستجوی مدل را در پایگاه داده خود محدود می کند.کاهش زمان پردازش به جای اسکن کردن هر کلمه حاوی پسوند به صورت جداگانه.
به عنوان واحدهای داده اصلی، توکن ها به ورودی های بردار تبدیل می شوند که معنی معنایی را کدگذاری می کنند و در شاخص های مدل ذخیره می شوند. به عنوان مثال کلمه cat را در نظر بگیرید:مدل چندین بردار برای نشان دادن ویژگی های چند بعدی خود تولید می کند.، مانند ارگانیسم زنده، حیوان خانگی، ویژگی های گربه، اندازه فیزیکی و غیره. این مجموعه های ناقل منحصر به فرد cat را از اشیاء بی جان، سایر گونه های حیوانی مانند سگ ها و ببرها متمایز می کنند،و اسباب بازی های مصنوعی گربه.
یک جاسازی متری پنج بعدی فرضی برای اصطلاح cat می تواند به صورت [1.5، -0.4،72، 196، 20.2).
تمام داده های بردار در یک فضای بردار متحد وجود دارد، که به مدل ها امکان می دهد محتوای مشابه معنایی را با اندازه گیری نزدیکی فضایی بین نقاط بردار شناسایی کنند.
هنگامی که به بردار تبدیل می شوند، توکن ها در سرورهای گران قیمت GPU مجهز به حافظه پهنای باند بالا پردازش می شوند.یک NVIDIA DGX SuperPOD با 32 گره و 256 GPU در مجموع بین 12 میلیون دلار و 20 میلیون دلار هزینه داردیک معماری مرجع پیشرفته تر با 140 گره DGX H100، شبکه InfiniBand Quantum-2، زیرساخت های ذخیره سازی و شبکه کامل و سیستم های پشتیبانی می تواند بیش از 100 میلیون دلار باشد.این هزینه های زیربنایی قابل توجه به طور مستقیم در طرح های قیمت گذاری نشانه ای مدل های پایه اصلی منعکس می شود.
ارائه دهندگان برجسته LLM و چت بات از جمله OpenAI و Anthropic مدل های صورتحساب مبتنی بر توکن را با قوانین قابل پیش بینی تبدیل توکن برای محتوای متن اتخاذ می کنند.یک توکن انگلیسی معادل حدود چهار کاراکتر یا 0 است.75 کلمه، به این معنی که 750 کلمه به حدود 1000 توکن مطابقت دارد. به طور خاص، هر دو درخواست ورودی و پاسخ های خروجی تولید شده، توکن ها را مصرف می کنند. به عنوان مثال، یک درخواست ورودی 750 کلمه با یک 2,تولید هوش مصنوعی هزار کلمه ای تقریباً ۳۶۶۷ توکن را در مجموع مصرف می کند.
مصرف بیشتر توکن به طور مستقیم تاخیر پاسخ هوش مصنوعی را افزایش می دهد. تمام توکن های یک جلسه پاسخ فوری در یک پنجره زمینه ای با ظرفیت محدود قرار دارند.پنجره زمینه 000 توکن می تواند حدود 751000 کلمه انگلیسی، معادل یک کتاب 300 صفحه ای.
ظرفیت پنجره زمینه ای ناکافی باعث می شود که LLM اطلاعات زمینه ای را از دست دهد، که منجر به خروجی های AI ناقص یا نادرست می شود. با تکامل مدل های پایه، اندازه پنجره زمینه ای همچنان در حال گسترش است:GPT-4o تا 128 را پشتیبانی می کند،000 توکن، Claude 3.5 Sonnet به 200,000 توکن می رسد، و کاربران شرکت Gemini 1.5 Pro را انتخاب کنید می توانند به پنجره زمینه ای 2 میلیون توکن دسترسی داشته باشند.
قیمت گذاری توکن ها در بین فروشندگان مدل متفاوت است. تجزیه و تحلیل قیمت گذاری Intuition Labs ChatGPT مکانیسم صورتحساب صنعت را روشن می کند:
بر اساس آزمایشگاه های شهودی، API ChatGPT OpenAI بر روی یک ساختار صورتحساب مبتنی بر توکن خالص کار می کند. هر مدل قیمت های ثابت واحد را برای توکن های ورودی و توکن های خروجی به طور جداگانه تنظیم می کند،با توکن های خروجی که معمولا هزینه بیشتری دارند. قیمت گذاری نیز بر اساس وضعیت پاسخ کش شده نوسان می کند. هر تماس API دو هزینه متمایز دارد: یکی برای توکن های ورودی فوری و یکی برای توکن های خروجی تولید شده توسط هوش مصنوعی. به عنوان یک مثال عملی،استفاده از یک مدل با قیمت 10 دلار در هر میلیون توکن خروجی برای 100 توکن ورودی و 400 توکن خروجی منجر به هزینه های ورودی 10 × 100/1 می شود,000و هزینه های خروجی 10 × 400/1000،000) ، با کل هزینه برابر با مجموع این دو رقم است.
شرکت ها می توانند کنترل های حکومتی هدفمند را برای محدود کردن هزینه های توکن، از جمله سهمیه های هر کاربر یا هر صندلی، محدود کردن ترافیک مبتنی بر استفاده، محدودیت هزینه های هر پروژه،و محدودیت های سطح مدلاین زمینه مدیریت به سرعت در حال تکامل است، زیرا فروشندگان هوش مصنوعی برای بهینه سازی کیفیت خدمات، تعادل جریان درآمد و رقابت با مدل های منبع باز هوش مصنوعی رقابت می کنند.
عوامل هوش مصنوعی یک لایه کاملا جدید از ریسک هزینه های توکن را معرفی می کنند. بدون محافظ عملیاتی دقیق، عوامل مستقل می توانند مصرف عظیم و برنامه ریزی نشده توکن را ایجاد کنند.کارشناسان صنعت توصیه می کنند که با عوامل هوش مصنوعی به عنوان کارمندان دیجیتال رفتار شود، با تیم های FinOps که نظارت دقیق و 24 ساعته بر هزینه ها را برای جلوگیری از فاجعه های هزینه اجرا می کنند.
شرکت فناوری چینجینگ جیوتونگ پکن، لمیتد
سندي يانگ، مدير استراتژي جهاني
واتساپ / وی چت: +86 13426366826
ایمیل: yangyd@qianxingdata.com
وب سایت: www.qianxingdata.com/www.storagesserver.com
تمرکز کسب و کار:
توزیع محصولات ICT / ادغام سیستم و خدمات / راه حل های زیرساخت
با 20+ سال تجربه توزیع فناوری اطلاعات، ما با مارک های پیشرو جهانی همکاری می کنیم تا محصولات قابل اعتماد و خدمات حرفه ای را ارائه دهیم.
استفاده از تکنولوژی برای ساختن یک جهان هوشمند، ارائه دهنده خدمات قابل اعتماد محصولات ICT شما