Private AI زمانی معنی پیدا میکند که سازمان فقط مالک سرور نباشد، بلکه روی محل استقرار مدل، مسیر داده، دسترسی کاربران، نسخه مدل و چرخه عمر سرویس نیز کنترل داشته باشد. VCF Private AI Services 9.1 تلاش Broadcom برای تبدیل همین کنترلها به یک سرویس پلتفرمی در VMware Cloud Foundation است؛ یعنی فاصله میان «چند GPU در دیتاسنتر» و «یک سرویس هوش مصنوعی قابل مصرف برای تیمهای نرمافزار و داده» را کم میکند.
نسخه 9.1 صرفاً یک بهروزرسانی سختافزاری نیست. پشتیبانی مدیریتشده از MCP، اتصال به اسناد Google Workspace، اجرای مدل روی CPU با llama.cpp، Direct Path برای GPU، نسل Blackwell و مشاهدهپذیری دقیقتر مدلها، این نسخه را برای پروژههای واقعیتر آماده کرده است. بااینحال، Private AI Services یک دکمه جادویی برای ساخت هوش مصنوعی امن نیست؛ شبکه، دیتابیس برداری، رجیستری مدل، مجوزهای NVIDIA و کنترل حاکمیتی هنوز باید آگاهانه طراحی شوند.
VCF Private AI Services دقیقاً چیست؟
VCF Private AI Services یا PAIS لایهای از سرویسهای آماده برای ساخت، ارائه و اداره برنامههای هوش مصنوعی خصوصی روی VCF است. این مجموعه روی vSphere Supervisor فعال میشود و تجربه مصرف آن میتواند از رابطهای اختصاصی، API، CLI و در سناریوهای یکپارچه از VCF Automation در اختیار تیمها قرار گیرد.
اجزای اصلی آن عبارتاند از:
- Model Gallery/Model Store: نگهداری و نسخهبندی مدلها در یک رجیستری مبتنی بر OCI مانند Harbor.
- Model Runtime: ایجاد Model Endpoint برای ارائه مدل تکمیل متن یا Embedding از طریق API.
- API Gateway: احراز هویت، مجوزدهی و توزیع درخواستها در ورودی Endpointها.
- Data Indexing and Retrieval: دریافت اسناد، Chunking، ساخت Embedding، ایندکسگذاری و بازیابی داده برای RAG.
- Agent Builder: ترکیب مدل، Knowledge Base و دستورهای اجرایی برای ساخت Agent.
- MCP Tools Registry: ثبت و حاکمیت ابزارهایی که Agent از طریق Model Context Protocol فراخوانی میکند.
این اجزا با یکدیگر یک مسیر کاملتر میسازند: مدل از Model Gallery انتخاب میشود، Model Runtime آن را به Endpoint تبدیل میکند، داده سازمانی در Knowledge Base ایندکس میشود، Agent Builder مدل و داده را کنار هم میگذارد و API Gateway دسترسی برنامهها را کنترل میکند.
سه نام شبیه، سه لایه متفاوت
یکی از منابع خطا در طراحی و خرید، یکسان فرضکردن چند نام نزدیک به هم است:
نام | نقش | نکته قراردادی |
|---|---|---|
VMware Cloud Foundation | زیرساخت و پلتفرم ابر خصوصی شامل Compute، Storage، Networking، Automation و Operations | مبنای استقرار PAIS است. |
| VCF Private AI Services | سرویسهای مدل، Endpoint، RAG، Agent و MCP روی VCF | Broadcom اعلام کرده این سرویسها در اشتراک VCF قرار میگیرند؛ Entitlement دقیق باید در قرارداد همان مشتری بررسی شود. |
| VMware Private AI Foundation with NVIDIA | راهکار مشترک و اعتبارسنجیشده VMware و NVIDIA برای زیرساخت و نرمافزار AI | نباید آن را مترادف صرف PAIS دانست. |
| NVIDIA AI Enterprise | مجموعه نرمافزارها، Containerها، چارچوبها و پشتیبانی NVIDIA | حق استفاده، Credentials و دسترسی NGC به قرارداد NVIDIA وابسته است و از نام VCF نتیجهگیری نمیشود. |
بنابراین جمله «Private AI در VCF هست، پس همه نرمافزارهای NVIDIA هم بدون هزینه یا مجوز جداگانه قابل استفادهاند» دقیق نیست. پیش از طراحی BOM باید SKU، Entitlement، پشتیبانی OEM، Compatibility Guide و قرارداد NVIDIA بررسی شود.
معماری VCF Private AI Services 9.1
Control Plane روی Supervisor
فعالسازی PAIS باعث استقرار Operator آن روی vSphere Supervisor میشود. تنظیمات در سطح vSphere Namespace بهشکل Declarative تعریف میشوند و Operator اجزای مدیریتی مانند API، Backend رابط کاربری و Workerهای ایندکسگذاری را ایجاد میکند. نکته ظرفیت این است که اندازه Supervisor را میتوان افزایش داد، اما کاهش اندازه آن پشتیبانی نمیشود؛ پس Sizing اولیه تصمیمی قابل چشمپوشی نیست.
Data Plane روی VKS
Model Endpointها در Podهای یک کلاستر VMware vSphere Kubernetes Service اجرا میشوند. GPU به VMهای Worker متصل است و موتورهایی مانند vLLM یا Infinity در Pod مربوط به Endpoint کار میکنند. این تفکیک باعث میشود تیم زیرساخت سیاست و ظرفیت را کنترل کند، درحالیکه تیم برنامه یک API مصرفپذیر تحویل میگیرد. برای شناخت لایه Kubernetes این معماری، مقاله VKS 3.6 در VCF 9.1 مکمل مستقیم این مطلب است.
داده و رجیستری خارج از Operator
Operator همه پیشنیازها را از صفر ایجاد نمیکند. Model Gallery به رجیستری سازگار با OCI مانند Harbor نیاز دارد و قابلیت Data Indexing and Retrieval به یک PostgreSQL/Vector Database خارجی وابسته است. دیتابیس برداری بخشی از معماری است، اما اپراتور PAIS آن را بهجای شما Provision نمیکند. DNS، NTP، Certificate، Load Balancer، مسیر دسترسی به رجیستری و ظرفیت ذخیرهسازی نیز باید از قبل آماده باشند.
چه چیزهایی در نسخه 9.1 تازه است؟
Agentهای متصل به ابزارها با MCP
مهمترین تغییر کاربردی 9.1، پشتیبانی از Model Context Protocol همراه با سازوکار حاکمیت است. Agent میتواند بهجای تولید پاسخ صرفاً متنی، ابزارهای ثبتشده را فراخوانی کند؛ برای نمونه منبع دادهای در PostgreSQL را بخواند، رکورد ServiceNow را بررسی کند یا با GitHub و Slack تعامل داشته باشد. Broadcom از ابزارهای مرتبط با Oracle، Microsoft SQL Server، ServiceNow، GitHub، Slack و PostgreSQL نام برده است.
ارزش MCP در «اتصال بیشتر» خلاصه نمیشود؛ Registry مرکزی باید مشخص کند کدام ابزار مجاز است، چه Credentialsی دارد، چه دادهای را میبیند و چه عملی را میتواند انجام دهد. Agent بدون Least Privilege، Audit و مدیریت Secret میتواند مرز خطای یک Chatbot را به مرز یک تغییر عملیاتی توسعه دهد.
منابع داده بیشتر برای RAG
نسخه 9.1 علاوه بر فایلهای Word، PowerPoint، PDF و CSV، اسناد، Sheetها و Slideهای Google Workspace را نیز وارد جریان Data Indexing میکند. این قابلیت برای سازمانی ارزش دارد که دانش پراکنده را به Knowledge Base قابل جستوجو تبدیل میکند؛ اما کیفیت پاسخ هنوز به کیفیت Chunking، مدل Embedding، ACL اسناد و سیاست بهروزرسانی ایندکس وابسته است.
DirectPath و سختافزار نسل Blackwell
VCF Private AI Services 9.1 از DirectPath برای GPU پشتیبانی میکند؛ در این حالت یک GPU بهصورت انحصاری در اختیار یک VM قرار میگیرد. این انتخاب برای بیشینهکردن دسترسی مستقیم و عملکرد مناسب است، اما مزایای اشتراکگذاری vGPU و بخشی از انعطاف عملیاتی Virtualization را کاهش میدهد. تصمیم میان vGPU و DirectPath باید براساس اندازه مدل، الگوی مصرف، نیاز چندمستاجری و الزامات Lifecycle گرفته شود.
پشتیبانی اعلامشده 9.1 شامل NVIDIA RTX PRO 6000 Blackwell Server Edition، HGX B200 و RTX PRO 4500 Blackwell Server Edition است. Broadcom همچنین از HGX با NVLink Switch، کارتهای ConnectX-7 و BlueField-3 برای Enhanced DirectPath I/O نام برده است. HGX B300 در اعلام رسمی بهعنوان برنامه آینده مطرح شده و نباید آن را قابلیت جاری 9.1 فرض کرد.
Inference روی CPU
یکپارچگی Model Runtime با llama.cpp امکان ارائه مدلهای مناسب روی CPU را فراهم میکند. این گزینه برای مدلهای کوچک، آزمایش، Endpoint کمبار یا محیطی که GPU کمیاب است مفید است. CPU Inference جایگزین عمومی GPU برای هر مدل و هر SLA نیست؛ Benchmark باید با همان مدل، Quantization، طول Context و تعداد کاربران واقعی انجام شود.
مشاهدهپذیری مدل و GPU
داشبورد AI Metrics Observability در 9.1 معیارهایی مانند Cache Utilization، تعداد Token در هر درخواست، Token Throughput، زمان دریافت اولین Token یا TTFT و End-to-End Latency را کنار معیارهای GPU مانند Utilization، دما، توان مصرفی، دمای حافظه و Clock نشان میدهد. این داشبورد به Grafana نیاز دارد و صرف فعالبودن Operations بهتنهایی معادل آمادهبودن همه این نماها نیست.
مقایسه مسیر 8، 9 و 9.1
موضوع | نسل VCF 5.x/زیرساخت vSphere 8 | VCF 9.0 | VCF 9.1 |
|---|---|---|---|
تمرکز | Private AI Foundation، DLVM، Automation، GPU و RAG اولیه | معرفی PAIS بهعنوان سرویسهای Supervisor | گسترش Agent، MCP، سختافزار و Observability |
Model Lifecycle | بیشتر وابسته به Blueprint و ابزارهای Foundation | Model Gallery/Store و Model Runtime | همان پایه با دامنه مصرف و سختافزار گستردهتر |
RAG | Vector Database و نمونههای راهکار | Data Indexing/Retrieval و Agent Builder | منابع Google Workspace و حاکمیت MCP |
شتابدهنده | GPUهای نسلهای قبلی، vGPU و DirectPath طبق ماتریس همان نسخه | پلتفرم PAIF روی VCF 9 | Blackwellهای مشخص، HGX B200 و DirectPath در PAIS |
Inference بدون GPU | وابسته به پیادهسازی کاربر | Endpointهای غیرGPU برای مدلهای مناسب | یکپارچگی اعلامشده با llama.cpp |
| Agent Tooling | خارج از پلتفرم یا سفارشی | Agent Builder | MCP Tools Registry و Governance |
این جدول مقایسه قابلیتهای کلان است، نه ماتریس سازگاری. برای Upgrade یا خرید سختافزار باید Release Notes، Compatibility Guide و BOM همان Build بررسی شوند.
VPC یا VDS؛ انتخابی معماری، نه یک تیک ساده
Supervisor میتواند با دو Stack شبکهای اصلی میزبان PAIS باشد:
معیار | VCF Networking با VPC | VDS Networking |
|---|---|---|
چندمستاجری و Self-Service | غنیتر؛ VPC، NAT، Load Balancing و Distributed Firewall | وابستهتر به VLAN Port Group و فرآیند شبکه خارجی |
Load Balancer | یکپارچه با طراحی NSX/VCF Networking | به Load Balancer خارجی نیاز دارد |
VCF Automation | تجربه یکپارچهتر برای مصرف سرویس | بدون Automation، فعالسازی و استقرار با CLI، YAML و kubectl دستیتر است |
سادگی Brownfield | ممکن است نیازمند طراحی VPC باشد | برای محیط VLANمحور آشناتر است |
تغییر Stack | گذار VDS به VPC یا برعکس، تغییر تنظیم ساده نیست و به بازاستقرار برنامهریزیشده Supervisor نیاز دارد. | |
در VCF 9.1، VPC میتواند از اتصال Distributed VLAN استفاده کند؛ در این طراحی الزام Edge Node حذف میشود. این قابلیت هزینه و پیچیدگی بعضی سناریوها را کم میکند، اما طراحی نهایی هنوز به North-South Connectivity، Load Balancing و سیاست امنیتی وابسته است.
پیشنیازهای یک استقرار قابل پشتیبانی
- BOM و Compatibility: نسخه دقیق VCF، vSphere، VKS، Driver، NVIDIA GPU Operator، Firmware، GPU، NIC و سرور OEM را با ماتریس رسمی تطبیق دهید.
- Supervisor و Namespace: ظرفیت Control Plane، Storage Policy، Content Library، DNS، NTP، Certificate و Load Balancer را پیش از فعالسازی آماده کنید.
- رجیستری: Harbor یا Registry سازگار با OCI برای Imageها و مدلها لازم است.
- دیتابیس: PostgreSQL/pgvector یا گزینه پشتیبانیشده را بهصورت خارجی Provision و Backup کنید.
- ظرفیت AI: اندازه مدل، Precision/Quantization، KV Cache، Context Length، Concurrent Request و SLA را به vCPU، RAM، GPU Memory و Throughput تبدیل کنید.
- مجوز و دسترسی: Entitlement در Broadcom Support Portal، Download Token، مجوز NVIDIA AI Enterprise و Credentials مربوط به NGC یا مخزن مدل را بررسی کنید.
- Operations: ظرفیت، Log، Alert، داشبورد Grafana، Backup دیتابیس و Runbook بازیابی را از روز اول تعریف کنید.
سناریوی واقعی: دستیار دانش در یک بانک یا هلدینگ
فرض کنید سازمان میخواهد دستیار داخلی برای آییننامهها، دستورالعملهای امنیتی و قراردادها بسازد. مدل تکمیل متن و مدل Embedding پس از ارزیابی وارد Model Gallery میشوند. Model Runtime برای هرکدام Endpoint میسازد. اسناد از SharePoint، Google Workspace یا فایلهای داخلی دریافت، Chunk و در پایگاه برداری ایندکس میشوند. Agent Builder، مدل تکمیل متن و Knowledge Base را ترکیب میکند و API Gateway دسترسی برنامه Chat را محدود میسازد.
در مرحله دوم، یک MCP Tool فقط با دسترسی Read-Only به سامانه تیکتینگ افزوده میشود. Agent میتواند وضعیت رخداد را بخواند، اما اجازه بستن تیکت یا تغییر پیکربندی ندارد. پاسخ، شناسه منبع و لاگ فراخوانی ابزار ثبت میشود. اینجا «Private» به مجموعهای از کنترلهای واقعی تبدیل شده است: محل اجرای مدل، مسیر داده، ACL سند، دسترسی ابزار، ثبت رویداد و نسخه Endpoint.
امنیت: ماندن داده در دیتاسنتر کافی نیست
استقرار On-Premises سطح کنترل را بالا میبرد، اما امنیت را خودکار نمیکند. حداقل باید این موارد طراحی شوند:
- تفکیک Namespace، Tenant، Registry Project و دیتابیس هر دامنه حساس؛
- هماهنگی ACL منبع سند با مجوز جستوجو در Knowledge Base؛
- مدیریت Secret و Token برای MCP، NGC، Registry و Data Source؛
- کنترل Egress برای جلوگیری از ارتباط ناخواسته مدل یا ابزار با اینترنت؛
- ثبت Prompt، پاسخ، Citation، نسخه مدل و فراخوانی ابزار با رعایت حریم خصوصی؛
- اسکن Image و مدل، امضای Artifact و کنترل زنجیره تأمین؛
- مقابله با Prompt Injection، Data Poisoning و Exfiltration از مسیر RAG یا MCP.
همچنین اعلام رسمی اکتبر 2025 گفته بود پشتیبانی FIPS برای VCF Private AI Services در یک نسخه آینده ارائه خواهد شد؛ بنابراین صرف FIPSبودن اجزای دیگر VCF نباید بهعنوان اثبات FIPS کامل PAIS تلقی شود، مگر اینکه Release Notes و اسناد 9.1 همان Build آن را صریحاً تأیید کنند.
محدودیتها و نکات عملی 9.1
- GPU Operator پیشفرض PAIF 9.1 نسخه 25.3.1 است و Broadcom برای تداوم پشتیبانی پس از VCF 9.1، مسیر ارتقا به 26.3.1 را در KB 439984 توضیح داده است.
- در 9.1 نمونههای پشتیبانینشده NVIDIA RAG و TensorFlow حذف/Deprecated شدهاند؛ نمونههای اعلامشده شامل CUDA، DCGM Exporter، PyTorch و Triton Inference Server است.
- در VCF Automation 9.0.x تا 9.1.1، رشته Property Group در رابط کاربری محدودیت 1024 کاراکتر دارد؛ API همان محدودیت را ندارد.
- DirectPath دسترسی انحصاری میدهد؛ برای تراکم بیشتر یا اشتراک GPU، vGPU ممکن است انتخاب مناسبتری باشد.
- داشبورد AI Metrics به Grafana نیاز دارد.
- تغییر Network Stack از VDS به VPC یک Migration ساده نیست.
- یک مدل «پشتیبانیشده» لزوماً برای SLA شما سریع یا دقیق نیست؛ Benchmark و ارزیابی کیفیت ضروری است.
پیادهسازی آفلاین و ملاحظات ایران
برای محیط Air-Gapped، Broadcom ابزار Mirror و BOM نسخهمحور ارائه کرده است. طبق KB 388470، Registry محلی Harbor باید Container Imageها، Helm Chartها و فایلهای مدل را نگه دارد. محیط اجرای Mirror حداقل به 4 CPU، هشت گیگابایت RAM و حدود 180 گیگابایت فضای دیسک نیاز دارد؛ با بستهبندی Container فضای بیشتری لازم است. خود پروژه Harbor نیز باید دستکم حدود 180 گیگابایت ظرفیت داشته باشد.
این اعداد حداقل عملیاتی ابزار Mirror هستند، نه ظرفیت کل پروژه AI. حجم مدلها، نسخههای متعدد، Cache و Retention رجیستری میتواند بسیار بزرگتر شود. BOM پیشفرض به آخرین شاخه 9.1.x اشاره میکند و Broadcom هشدار میدهد Resourceهای نسخههای قدیمی ممکن است از منبع عمومی حذف شوند؛ بنابراین Mirror، Hash، Manifest و Backup باید قبل از تغییر نسخه نگهداری شوند.
در ایران، مسئله اصلی معمولاً فقط پهنای باند نیست. دسترسی به Broadcom Support Portal، Download Token، NGC، Entitlement و پشتیبانی تجاری باید پیش از خرید سختافزار آزموده شود. استفاده از Cache یا انتقال فایل بدون اثبات مجوز، جایگزین Entitlement معتبر نیست. برای یک محیط کاملاً آفلاین، Update Window، Repository داخلی، اسکن امنیتی، نگهداری Driver/Firmware و مسیر اضطراری دریافت Patch باید در Runbook ثبت شود.
این موضوع در مسیر آموزش VMware کجا قرار میگیرد؟
VCF Private AI Services نقطه شروع مناسبی برای کسی نیست که هنوز vSphere، شبکه، Storage Policy یا Kubernetes را نمیشناسد. در یک مسیر اصولی آموزش VMware و آموزش مجازی سازی ابرکلاس، ابتدا پایههای vSphere و VCF، سپس VKS، VCF Automation و Operations و بعد Private AI قرار میگیرد. برای مدیر زیرساخت، VCF Automation 9.1 و برای تیم پلتفرم، مقاله VKS 3.6 پیشنیازهای مستقیمتری هستند.
در آموزش VCF باید PAIS بهعنوان یک سرویس چندلایه بررسی شود، نه صرفاً نصب یک Appliance. آموزش VVF نیز برای شناخت پایه Compute و Operations مفید است، اما معماری کامل PAIS به قابلیتهایی فراتر از VVF و به اکوسیستم VCF متکی است. برای درک مرز محصولات و مجوزها، مقاله مقایسه VVF و VCF در VMware 9.1 را نیز ببینید.
جمعبندی فنی
VCF Private AI Services 9.1 یک لایه PaaS برای چرخه مدل، RAG، Agent و API روی VCF ایجاد میکند. ارزش اصلی آن در کنار هم قراردادن زیرساخت GPU، Kubernetes، رجیستری مدل، داده خصوصی و کنترل مصرف است. MCP، Google Workspace، Blackwell، DirectPath، llama.cpp و AI Metrics دامنه 9.1 را جدیتر کردهاند؛ اما موفقیت پروژه همچنان به تصمیمهای معماری وابسته است.
اگر هدف فقط اجرای یک مدل آزمایشی است، یک VM مجهز به GPU سادهتر خواهد بود. اگر چند تیم، چند مدل، داده حساس، Endpoint پایدار، حاکمیت ابزار و عملیات روز دوم دارید، PAIS معنا پیدا میکند. قبل از اجرا سه خروجی باید روشن باشد: ماتریس پشتیبانی و مجوز، معماری شبکه و داده، و مدل عملیاتی شامل امنیت، مشاهدهپذیری و بازیابی.
پرسشهای متداول
آیا VCF Private AI Services 9.1 یک محصول مستقل است؟
PAIS مجموعهای از سرویسهای AI یکپارچه با VCF است. Broadcom آن را در اشتراک VCF معرفی کرده، اما Entitlement دقیق و اجزای NVIDIA باید بر اساس قرارداد و SKU مشتری کنترل شوند.
آیا برای استفاده از PAIS حتماً GPU لازم است؟
خیر. 9.1 با llama.cpp از CPU Inference برای مدلهای مناسب پشتیبانی میکند. بااینحال، برای مدلهای بزرگ یا Throughput و Latency سختگیرانه معمولاً GPU لازم است.
تفاوت Model Gallery و Model Runtime چیست؟
Model Gallery محل نگهداری و نسخهبندی Artifact مدل است؛ Model Runtime همان مدل را با موتور Inference اجرا و بهصورت Endpoint/API ارائه میکند.
آیا دیتابیس برداری همراه Operator ساخته میشود؟
خیر. طبق معماری رسمی، PostgreSQL/Vector Database یک پیشنیاز خارجی است و باید جداگانه Provision، ایمن، Backup و پایش شود.
VPC برای PAIS بهتر است یا VDS؟
VPC برای چندمستاجری، Self-Service و سیاست شبکهای غنیتر مناسبتر است؛ VDS میتواند در محیط VLANمحور سادهتر باشد، ولی Load Balancer خارجی و عملیات دستی بیشتری میخواهد. تغییر بعدی میان این دو به بازاستقرار برنامهریزیشده Supervisor نیاز دارد.
آیا DirectPath همیشه بهترین عملکرد را میدهد؟
DirectPath دسترسی انحصاری VM به GPU را فراهم میکند، اما اشتراکگذاری و بخشی از انعطاف Virtualization را از دست میدهد. تصمیم باید با Benchmark و نیاز Lifecycle گرفته شود.
برای محیط Air-Gapped چه چیزهایی باید Mirror شوند؟
Container Imageها، Helm Chartها و فایلهای مدل باید طبق BOM نسخه در Harbor داخلی Mirror شوند. Tokenها، Hashها، Driverها و Artifactهای نسخه نیز باید پیش از قطع دسترسی آرشیو شوند.