کارت گرافیک 4x RTX 5090 32GB GDDR7
- گرافیک:تاریخ عرضه: 30 ژانویه 2025 (عرضه رسمی NVIDIA GeForce RTX 5090) نسل: NVIDIA Blackwell (GeForce RTX 50 Series، نسل جدید GPUهای مبتنی بر معماری Blackwell) نسل قبلی: NVIDIA GeForce RTX 4090 (معماری Ada Lovelace) وضعیت تولید: فعال (Active) قیمت عرضه: حدود 1,999 دلار آمریکا (هر کارت، MSRP رسمی NVIDIA) رابط اتصال: PCIe 5.0 x16 پشتیبانی NVLink: ندارد (هر کارت بهصورت مستقل روی یک اسلات PCIe کار میکند و در پیکربندی چهارکارتی، ارتباط بین GPUها از طریق PCIe Gen5 و فریمورکهای نرمافزاری مانند CUDA Multi-GPU، NCCL، Tensor Parallelism، Pipeline Parallelism، DeepSpeed و PyTorch Distributed انجام میشود.) توان پردازشی این پیکربندی: قدرت یک کارت RTX 5090: حدود 104.8 ترافلاپس FP32 حدود 3,352 TOPS در پردازش AI با FP4 و Sparsity 32 گیگابایت حافظه GDDR7 21,760 هسته CUDA 680 هسته Tensor نسل پنجم مجموع چهار کارت RTX 5090 در این سرور AI: 419.2 ترافلاپس FP32 حدود 13,408 TOPS توان پردازش AI در FP4 Sparse 128 گیگابایت حافظه GDDR7 87,040 هسته CUDA 2,720 هسته Tensor نسل پنجم 680 هسته Ray Tracing نسل چهارم
- ارسال: ۱ تا ۲ روز کاری
- وضعیت: نو / پلمپ کارخانه
- گارانتی: یک ماه گارانتی
مشخصات فنی کامل
۱۴ مورد- گرافیک
- تاریخ عرضه: 30 ژانویه 2025 (عرضه رسمی NVIDIA GeForce RTX 5090)
- نسل: NVIDIA Blackwell (GeForce RTX 50 Series، نسل جدید GPUهای مبتنی بر معماری Blackwell)
- نسل قبلی: NVIDIA GeForce RTX 4090 (معماری Ada Lovelace)
- وضعیت تولید: فعال (Active)
- قیمت عرضه: حدود 1,999 دلار آمریکا (هر کارت، MSRP رسمی NVIDIA)
- رابط اتصال: PCIe 5.0 x16
- پشتیبانی NVLink: ندارد (هر کارت بهصورت مستقل روی یک اسلات PCIe کار میکند و در پیکربندی چهارکارتی، ارتباط بین GPUها از طریق PCIe Gen5 و فریمورکهای نرمافزاری مانند CUDA Multi-GPU، NCCL، Tensor Parallelism، Pipeline Parallelism، DeepSpeed و PyTorch Distributed انجام میشود.)
- توان پردازشی این پیکربندی:
- قدرت یک کارت RTX 5090:
- حدود 104.8 ترافلاپس FP32
- حدود 3,352 TOPS در پردازش AI با FP4 و Sparsity
- 32 گیگابایت حافظه GDDR7
- 21,760 هسته CUDA
- 680 هسته Tensor نسل پنجم
- مجموع چهار کارت RTX 5090 در این سرور AI:
- 419.2 ترافلاپس FP32
- حدود 13,408 TOPS توان پردازش AI در FP4 Sparse
- 128 گیگابایت حافظه GDDR7
- 87,040 هسته CUDA
- 2,720 هسته Tensor نسل پنجم
- 680 هسته Ray Tracing نسل چهارم
- ابعاد
- طول: حدود 304 میلیمتر (12 اینچ) (بسته به مدل سازنده)
- عرض: حدود 137 میلیمتر تا بیش از 150 میلیمتر (بسته به طراحی کولر)
- عرض اسلات: Dual-slot تا 3.5-slot
- فضای موردنیاز در پیکربندی چهارکارتی: حداقل کیس Full Tower یا شاسی GPU Server با تعداد اسلات PCIe کافی، فاصله مناسب بین کارتها و گردش هوای حرفهای
- حافظه
- ظرفیت: 32 گیگابایت (هر کارت) — مجموعاً 128 گیگابایت حافظه فیزیکی GDDR7 در پیکربندی چهارکارتی
- نوع: GDDR7
- قابلیت ECC: ندارد (برخلاف کارتهای RTX PRO و Data Center، حافظه RTX 5090 نسخه GeForce فاقد ECC سختافزاری است)
- گذرگاه حافظه: 512 بیت (هر کارت)
- پهنای باند: حدود 1,792 گیگابایت بر ثانیه (هر کارت)
- مجموع پهنای باند چهار کارت: حدود 7,168 گیگابایت بر ثانیه (≈7.1 ترابایت بر ثانیه)
- پهنای باند I/O اندازهگیریشده در تستهای عملی: وابسته به نوع مادربرد، PCIe، درایور و معماری ارتباط چند GPU
- توضیح حافظه در سرور AI چهارکارتی:
- هر کارت RTX 5090 دارای 32GB حافظه اختصاصی خود است و این 128GB حافظه بهصورت یکپارچه در اختیار یک مدل قرار نمیگیرد. برای اجرای مدلهای بزرگتر از حافظه یک GPU باید از روشهایی مانند Tensor Parallelism، Pipeline Parallelism، ZeRO Optimization، Quantization و Offloading استفاده شود.
- سرعت پردازنده
- فرکانس پایه: حدود 2017 مگاهرتز
- فرکانس Boost: حدود 2407 مگاهرتز
- فرکانس حافظه: 1750 مگاهرتز (سرعت مؤثر 28 گیگابیت بر ثانیه)
- صفحه نمایش و خروجی تصویر
- کانکتورهای نمایش: 3 پورت DisplayPort 2.1b + 1 پورت HDMI 2.1b (بسته به مدل سازنده کارت)
- حداکثر نمایشگرهای همزمان: 4 نمایشگر مستقل برای هر کارت
- در پیکربندی چهارکارتی: تا 16 نمایشگر مستقل (در صورت پشتیبانی مادربرد و سیستمعامل)
- رزولوشن پشتیبانیشده: 4 نمایشگر 4K با نرخ بالا / نمایشگرهای 8K با نرخ 60 هرتز / پشتیبانی از HDR، Display Stream Compression (DSC)، HDMI 2.1b، DisplayPort 2.1b و مدیریت چند نمایشگر حرفهای
- طراحی برد و توان مصرفی
- عرض اسلات: معمولاً Dual-slot تا 3.5-slot (بسته به مدل Founders Edition یا Custom)
- توان مصرفی (TDP): حدود 575 وات (هر کارت)
- مجموع توان مصرفی چهار کارت: حدود 2300 وات فقط برای GPUها
- پاور پیشنهادی سیستم: حداقل 1600 وات برای یک کارت / برای پیکربندی چهارکارتی پیشنهاد میشود از پاورهای سروری یا چند پاور مجموعاً در محدوده 3000 تا 4000 وات استفاده شود
- کانکتور تغذیه: 1 عدد کانکتور 16-pin PCIe 5.0 (12V-2x6) برای هر کارت
- مجموع کانکتور تغذیه: 4 عدد کانکتور 16-pin برای چهار کارت
- فرم فاکتور: Full Height, Full Length، مناسب کیسهای Workstation Tower بزرگ، شاسیهای GPU Server و سیستمهای دارای جریان هوای بسیار قدرتمند
- سیستم خنککننده: بسته به مدل کارت، شامل طراحی Founders Edition یا خنککنندههای سفارشی سهفن، با نیاز به Airflow بسیار بالا برای کارکرد مداوم در بارهای AI
- عملکرد نظری
- نرخ پیکسل: حدود 424.4 گیگاپیکسل بر ثانیه (هر کارت)
- مجموع چهار کارت: حدود 1,697.6 گیگاپیکسل بر ثانیه
- نرخ تکسچر: حدود 1,637 گیگاتکسل بر ثانیه (≈1.63 تراتکسل بر ثانیه، هر کارت)
- مجموع چهار کارت: حدود 6.55 تراتکسل بر ثانیه
- FP32 (تکدقتی): حدود 104.8 ترافلاپس (هر کارت)
- مجموع چهار کارت: حدود 419.2 ترافلاپس FP32
- FP64 (دودقتی): حدود 1.64 ترافلاپس (هر کارت) (نسبت حدود 1:64 نسبت به FP32)
- مجموع چهار کارت: حدود 6.56 ترافلاپس FP64
- عملکرد RT Core: حدود 318 ترافلاپس (هر کارت، بر اساس نسل چهارم RT Core)
- مجموع چهار کارت: حدود 1.27 پتافلاپس در پردازش Ray Tracing
- AI TOPS (FP4 با Sparsity): حدود 3,352 TOPS (هر کارت)
- مجموع چهار کارت: حدود 13,408 TOPS توان پردازش هوش مصنوعی FP4 Sparse
- FP8 Tensor Core: حدود 1,676 TOPS (Sparse) / حدود 838 TOPS (Dense) (هر کارت)
- مجموع چهار کارت: حدود 6,704 TOPS Sparse / حدود 3,352 TOPS Dense
- BF16 / FP16 Tensor Core: حدود 838 TFLOPS (Sparse) / حدود 419 TFLOPS (Dense) (هر کارت)
- مجموع چهار کارت: حدود 3,352 TFLOPS Sparse / حدود 1,676 TFLOPS Dense
- TF32 Tensor Core: حدود 419 TFLOPS (Sparse) / حدود 209 TFLOPS (Dense) (هر کارت)
- مجموع چهار کارت: حدود 1,676 TFLOPS Sparse / حدود 836 TFLOPS Dense
- INT8 Tensor (Dense): حدود 838 TOPS (هر کارت)
- مجموع چهار کارت: حدود 3,352 TOPS INT8 Dense
- (اعداد Sparse بر پایه فعالسازی فناوری Fine-Grained Structured Sparsity در نسل پنجم Tensor Coreهای Blackwell محاسبه شدهاند.)
- فناوریها و ویژگیهای پشتیبانیشده
- رابط PCI Express Gen5 x16 با پهنای باند بالا برای ارتباط سریع میان GPU و پردازنده مرکزی در سیستمهای AI Workstation و GPU Server
- 32 گیگابایت حافظه GDDR7 با پهنای باند بسیار بالا برای اجرای مدلهای هوش مصنوعی، تولید محتوا و پردازشهای سنگین GPU
- مجموع چهار کارت با 128 گیگابایت حافظه GDDR7 برای اجرای مدلهای بزرگ با استفاده از تکنیکهای Model Parallelism و Quantization
- معماری NVIDIA Blackwell با Streaming Multiprocessor بازطراحیشده و افزایش چشمگیر بهرهوری نسبت به نسل Ada Lovelace
- هستههای Tensor نسل پنجم با پشتیبانی از FP4، FP6، FP8، BF16، FP16، TF32، INT8 و INT4 برای شتابدهی مدلهای زبانی بزرگ و مدلهای مولد
- Transformer Engine نسل جدید برای افزایش سرعت آموزش و استنتاج مدلهای Transformer، LLM و Generative AI
- پشتیبانی از Fine-Grained Structured Sparsity برای افزایش عملکرد Tensor Core در مدلهای هوش مصنوعی بدون کاهش محسوس دقت
- پشتیبانی از فناوری Neural Rendering برای ترکیب پردازش گرافیکی سنتی با شبکههای عصبی
- هستههای Ray Tracing نسل چهارم با فناوری RTX Mega Geometry، Shader Execution Reordering و بهبود رهگیری پرتو در صحنههای پیچیده
- موتورهای NVENC نسل نهم و NVDEC نسل ششم با پشتیبانی از AV1، H.264، HEVC و پردازش همزمان چند استریم ویدئویی
- پشتیبانی از NVIDIA CUDA، CUDA-X AI، cuDNN، TensorRT، TensorRT-LLM، NCCL، RAPIDS، Triton Inference Server و NGC Containers
- پشتیبانی از اجرای مدلهای هوش مصنوعی متنباز مانند Llama، Qwen، DeepSeek، Mistral، Gemma و مدلهای Vision Language
- پشتیبانی از NVIDIA OptiX برای رندرینگ GPU Accelerated
- پشتیبانی از NVIDIA Omniverse، Blender AI Tools، Unreal Engine، Unity و نرمافزارهای تولید محتوای حرفهای
- پشتیبانی از DLSS 4 و Multi Frame Generation برای پردازشهای گرافیکی نسل جدید
- قابلیت اجرای همزمان چندین مدل AI، مدلهای زبانی، مدلهای تصویری و سرویسهای استنتاج روی یک سرور GPU
- محدوده مناسب این پیکربندی
- پیکربندی 4× NVIDIA GeForce RTX 5090 32GB GDDR7 یک سرور AI بسیار قدرتمند برای توسعه، تحقیق و اجرای مدلهای هوش مصنوعی است که مجموعاً 128 گیگابایت حافظه GDDR7، بیش از 87 هزار هسته CUDA، 2,720 هسته Tensor نسل پنجم و بیش از 13,000 TOPS توان پردازش AI FP4 Sparse ارائه میدهد.
- این سیستم برای Training و Fine-Tuning مدلهای Deep Learning، اجرای LLMهای بزرگ، تولید تصویر و ویدئو با AI، Vision AI، Multimodal AI، پردازشهای علمی و ساخت سرویسهای Inference گزینهای بسیار قدرتمند است.
- در مقایسه با کارتهای Enterprise مانند RTX PRO 6000، این پیکربندی حافظه ECC، vGPU رسمی، MIG و قابلیتهای دیتاسنتری NVIDIA را ندارد، اما در مقابل با چهار GPU Blackwell، قدرت خام پردازشی بسیار بالایی ارائه میدهد و برای پروژههای تحقیقاتی، شرکتهای توسعه هوش مصنوعی، آزمایشگاههای ML و سرورهای خصوصی AI یکی از قدرتمندترین راهکارهای مبتنی بر GPU مصرفی محسوب میشود.
- مدلهای هوش مصنوعی قابل اجرا روی این پیکربندی
- با ظرفیت 32 گیگابایت VRAM در هر کارت (و مجموعاً 128 گیگابایت حافظه فیزیکی GDDR7 در پیکربندی چهارکارتی، بدون یکپارچگی حافظه از طریق NVLink)، این سرور AI مبتنی بر 4× NVIDIA RTX 5090 Blackwell یکی از قدرتمندترین سیستمهای GPU Compute غیر Enterprise محسوب میشود.
- این پیکربندی با داشتن 87,040 هسته CUDA، 2,720 هسته Tensor نسل پنجم، حدود 419 ترافلاپس FP32 و بیش از 13,000 TOPS توان پردازش AI در FP4 Sparse برای اجرای مدلهای هوش مصنوعی مولد، مدلهای زبانی بزرگ، Fine-Tuning، Inference، پردازش تصویر، تولید ویدئو، بینایی ماشین و تحقیقات Deep Learning طراحی شده است.
- به دلیل نبود NVLink و محدود بودن حافظه هر GPU به 32GB، اجرای مدلهای بسیار بزرگ نیازمند استفاده از روشهایی مانند Tensor Parallelism، Pipeline Parallelism، Quantization، LoRA، QLoRA، ZeRO Optimization و CPU Offloading است.
- مدلهای زبانی بزرگ (LLM) با معماری Transformer:
- روی یک کارت (32GB):
- مدلهایی تا حدود 13B پارامتر با دقت کامل BF16/FP16
- مدلهایی تا حدود 30B پارامتر با FP8
- مدلهایی تا حدود 70B پارامتر با کوانتایز 4 بیتی (INT4 / GPTQ / AWQ / GGUF)
- روی چهار کارت (128GB VRAM مجموع):
- با استفاده از Tensor Parallelism و Pipeline Parallelism از طریق فریمورکهایی مانند TensorRT-LLM، vLLM، DeepSpeed، Megatron-LM، Hugging Face Accelerate و PyTorch Distributed:
- مدلهایی تا حدود 70B پارامتر با دقت BF16/FP16
- مدلهایی تا حدود 100B تا 150B پارامتر با FP8
- مدلهایی در محدوده 300B تا 400B+ پارامتر با کوانتایز 4 بیتی
- نمونه مدلهای قابل اجرا:
- Llama 3.1 8B
- Llama 3.1 70B
- Llama 3.3 70B
- Llama 4 Scout
- Llama 4 Maverick (Quantized)
- Llama 3.1 405B (نسخههای بسیار فشرده و Quantized با محدودیت سرعت)
- Mistral 7B
- Mistral Small
- Mistral Medium
- Mixtral 8x7B
- Mixtral 8x22B
- Mixtral Large (Quantized)
- Qwen2.5 7B
- Qwen2.5 14B
- Qwen2.5 32B
- Qwen2.5 72B
- Qwen3 30B
- Qwen3 235B (Quantized)
- Gemma 2 9B
- Gemma 2 27B
- Gemma 3
- DeepSeek-R1
- DeepSeek-R1 Distill
- DeepSeek-V2
- DeepSeek-V3 (Quantized)
- Phi-3
- Phi-4
- Command R
- Command R+
- DBRX
- Falcon 40B
- Falcon 180B (Quantized)
- Yi-34B
- InternLM
- InternLM2
- ChatGLM
- Baichuan
- Jamba
- OpenChat
- Vicuna
- WizardLM
- Nous Hermes
- Code Llama
- DeepSeek Coder
- Qwen Coder
- StarCoder
- StarCoder2
- Codestral
- Granite
- Nemotron
- مدلهای تصویری مولد (Generative Image Models):
- Stable Diffusion 1.5
- Stable Diffusion XL
- Stable Diffusion XL Turbo
- Stable Diffusion 3
- Stable Diffusion 3.5
- FLUX.1 Schnell
- FLUX.1 Dev
- FLUX.1 Pro (Quantized)
- FLUX Kontext
- AuraFlow
- PixArt Alpha
- PixArt Sigma
- Hunyuan DiT
- Lumina Image
- Kandinsky
- DreamShaper
- Juggernaut XL
- RealVisXL
- Playground v2.5
- SANA
- Black Forest Labs FLUX
- این پیکربندی چهارکارته برای تولید تعداد بسیار زیادی تصویر، Batch Generation، آموزش مدلهای Diffusion و توسعه سرویسهای Generative Image AI مناسب است.
- مدلهای تولید ویدئو (Generative Video Models):
- Stable Video Diffusion
- CogVideoX
- Wan 2.x
- Hunyuan Video
- LTX Video
- AnimateDiff
- VideoCrafter
- DynamiCrafter
- ModelScope Text-to-Video
- ZeroScope
- Open-Sora
- Step-Video
- MimicMotion
- این سیستم میتواند برای تولید ویدئوهای AI، پردازش فریمهای بالا، آموزش مدلهای Video Diffusion و ساخت سرویسهای تولید محتوای ویدئویی استفاده شود.
- فاینتیون و آموزش مدلها:
- Fine-tuning کامل مدلهای کوچک و متوسط تا حدود 30B پارامتر
- Fine-tuning مدلهای بزرگتر با تقسیم بین چهار GPU
- LoRA Training روی مدلهای 70B و بالاتر
- QLoRA Training روی مدلهای بسیار بزرگتر
- Instruction Tuning
- Supervised Fine-Tuning (SFT)
- DPO (Direct Preference Optimization)
- ORPO
- PPO
- RLHF
- Reward Model Training
- Continual Learning
- Domain Adaptation
- Embedding Training
- Vision Fine-tuning
- Multimodal Fine-tuning
- Training مدلهای اختصاصی سازمانی
- مدلهای چندوجهی (Multimodal) و Vision-Language:
- LLaVA
- LLaVA-NeXT
- Qwen2-VL
- Qwen2.5-VL
- Qwen3-VL
- InternVL
- MiniCPM-V
- DeepSeek VL
- PaliGemma
- Florence-2
- BLIP-2
- InstructBLIP
- Kosmos
- Idefics
- Fuyu
- Video-LLaVA
- Gemini Open Models
- CLIP
- OpenCLIP
- این پیکربندی برای ساخت دستیارهای هوشمند چندوجهی، سیستمهای تحلیل تصویر، Document AI و Agentهای هوش مصنوعی مناسب است.
- مدلهای بینایی ماشین (Computer Vision):
- YOLOv8
- YOLOv9
- YOLOv10
- YOLO11
- RT-DETR
- DETR
- Grounding DINO
- SAM
- SAM2
- FastSAM
- Mask R-CNN
- Detectron2
- OpenPose
- MediaPipe
- CLIP
- DINOv2
- Vision Transformer (ViT)
- Swin Transformer
- ConvNeXt
- EfficientNet
- ResNet
- SegFormer
- PaddleOCR
- TrOCR
- EasyOCR
- OCR صنعتی
- Object Detection
- Image Segmentation
- Video Analytics
- مدلهای گفتار و صوت:
- Whisper
- Whisper Large V3
- SeamlessM4T
- XTTS
- Bark
- VALL-E
- CosyVoice
- Fish Speech
- Parler TTS
- StyleTTS
- SpeechT5
- AudioCraft
- MusicGen
- این پیکربندی توانایی اجرای همزمان چندین مدل Speech-to-Text، Text-to-Speech و پردازش صوتی را دارد.
- رندرینگ، طراحی و Digital Content Creation:
- NVIDIA Omniverse
- Blender Cycles
- NVIDIA OptiX
- Chaos V-Ray GPU
- Redshift
- OctaneRender
- D5 Render
- Lumion
- Unreal Engine 5 Path Tracer
- Unity HDRP Ray Tracing
- Adobe Premiere Pro
- DaVinci Resolve Studio
- Adobe After Effects
- Adobe Substance 3D
- Cinema 4D
- Autodesk Maya
- Autodesk 3ds Max
- SideFX Houdini
- محاسبات علمی و HPC:
- CUDA Computing
- CUDA-X AI
- cuDNN
- TensorRT
- TensorRT-LLM
- NCCL
- RAPIDS
- cuBLAS
- cuFFT
- cuSPARSE
- cuSOLVER
- PyTorch
- TensorFlow
- JAX
- ONNX Runtime
- OpenMM
- GROMACS
- LAMMPS
- ANSYS
- MATLAB GPU Computing
- COMSOL Multiphysics
- ParaView
- استنتاج (Inference) در مقیاس سازمانی:
- اجرای همزمان چندین مدل LLM متوسط و بزرگ
- راهاندازی سرویسهای AI داخلی
- استقرار Chatbotهای سازمانی
- اجرای RAG Pipeline
- پردازش همزمان مدلهای Text، Image، Audio و Video
- پشتیبانی از NVIDIA Triton Inference Server
- اجرای چندین Endpoint هوش مصنوعی روی یک سرور
- مناسب برای شرکتهای AI، آزمایشگاههای تحقیقاتی، مراکز توسعه مدل و سرویسهای هوش مصنوعی خصوصی
- مجازیسازی و زیرساخت سازمانی:
- Docker GPU Runtime
- NVIDIA Container Toolkit
- Kubernetes GPU Operator
- Kubeflow
- Ray
- Slurm
- NGC Containers
- PyTorch Distributed
- DeepSpeed
- Megatron-LM
- Hugging Face Accelerate
- ویژگیهای گرافیکی
- DirectX: 12 Ultimate (12_2)
- OpenGL: 4.6
- OpenCL: 3.0
- Vulkan: 1.4
- Shader Model: 6.8
- CUDA Capability: 12.0
- پردازنده گرافیکی (GPU)
- نام تراشه: GB202
- معماری: NVIDIA Blackwell
- سازنده تراشه: TSMC، فرآیند ساخت 4N (نسخه سفارشی NVIDIA از فرآیند پیشرفته TSMC)
- تعداد ترانزیستور: حدود 92.2 میلیارد ترانزیستور
- مساحت تراشه: حدود 750 میلیمتر مربع
- تعداد SM فعال: 170 عدد Streaming Multiprocessor
- نسل هستههای Ray Tracing: نسل چهارم (با پشتیبانی از RTX Mega Geometry، Neural Rendering، Shader Execution Reordering و فناوریهای جدید رهگیری پرتو Blackwell)
- نسل هستههای Tensor: نسل پنجم (با پشتیبانی از FP4، FP6، FP8، BF16، FP16، TF32، INT8، INT4 و Transformer Engine نسل جدید)
- نسل NVENC: نسل نهم
- نسل NVDEC: نسل ششم
- پشتیبانی Video Codec: AV1 Encode/Decode، H.264، HEVC و پردازش حرفهای چندرسانهای
- واحدهای FP64: حدود 340 هسته FP64 با نسبت عملکرد محدود نسبت به FP32 (طراحیشده برای سازگاری نرمافزاری، نه محاسبات علمی سنگین HPC)
- پشتیبانی نرمافزار مجازیسازی (VGPU)
- پشتیبانی از vGPU: ندارد (RTX 5090 نسخه GeForce بوده و مانند کارتهای RTX PRO و Data Center دارای لایسنس رسمی NVIDIA vGPU نیست.)
- نرمافزارهای پشتیبانیشده: NVIDIA CUDA، NVIDIA Container Toolkit، Docker GPU Runtime، PyTorch، TensorFlow، JAX، ONNX Runtime، TensorRT، TensorRT-LLM، DeepSpeed، vLLM و فریمورکهای Multi-GPU AI
- پشتیبانی Multi-GPU: دارد (از طریق CUDA Multi-GPU، NCCL، PCIe Peer-to-Peer، Tensor Parallelism و Pipeline Parallelism)
- پشتیبانی MIG: ندارد (Multi-Instance GPU مختص کارتهای دیتاسنتری Hopper، Ada Enterprise و Blackwell Enterprise است.)
- نرمافزار پیشنهادی: NVIDIA CUDA Toolkit، NVIDIA TensorRT، TensorRT-LLM، PyTorch Distributed، DeepSpeed و NVIDIA NGC Containers
- پیکربندی رندر
- تعداد CUDA Core (Shading Units): 21,760 (هر کارت)
- مجموع چهار کارت: 87,040 هسته CUDA
- تعداد TMU: 680 (هر کارت)
- مجموع چهار کارت: 2,720 واحد TMU
- تعداد ROP: 176 (هر کارت)
- مجموع چهار کارت: 704 واحد ROP
- تعداد SM: 170 (هر کارت)
- مجموع چهار کارت: 680 عدد SM
- تعداد Tensor Core: 680 (نسل پنجم، هر کارت)
- مجموع چهار کارت: 2,720 هسته Tensor نسل پنجم
- تعداد RT Core: 170 (نسل چهارم، هر کارت)
- مجموع چهار کارت: 680 هسته RT نسل چهارم
- حافظه L1 Cache: 128 کیلوبایت بهازای هر SM
- حافظه L2 Cache: 96 مگابایت
