پی سی لند

کارت گرافیک 4x RTX 5090 32GB GDDR7

  • گرافیک:تاریخ عرضه: 30 ژانویه 2025 (عرضه رسمی NVIDIA GeForce RTX 5090) نسل: NVIDIA Blackwell (GeForce RTX 50 Series، نسل جدید GPUهای مبتنی بر معماری Blackwell) نسل قبلی: NVIDIA GeForce RTX 4090 (معماری Ada Lovelace) وضعیت تولید: فعال (Active) قیمت عرضه: حدود 1,999 دلار آمریکا (هر کارت، MSRP رسمی NVIDIA) رابط اتصال: PCIe 5.0 x16 پشتیبانی NVLink: ندارد (هر کارت به‌صورت مستقل روی یک اسلات PCIe کار می‌کند و در پیکربندی چهارکارتی، ارتباط بین GPUها از طریق PCIe Gen5 و فریم‌ورک‌های نرم‌افزاری مانند CUDA Multi-GPU، NCCL، Tensor Parallelism، Pipeline Parallelism، DeepSpeed و PyTorch Distributed انجام می‌شود.) توان پردازشی این پیکربندی: قدرت یک کارت RTX 5090: حدود 104.8 ترافلاپس FP32 حدود 3,352 TOPS در پردازش AI با FP4 و Sparsity 32 گیگابایت حافظه GDDR7 21,760 هسته CUDA 680 هسته Tensor نسل پنجم مجموع چهار کارت RTX 5090 در این سرور AI: 419.2 ترافلاپس FP32 حدود 13,408 TOPS توان پردازش AI در FP4 Sparse 128 گیگابایت حافظه GDDR7 87,040 هسته CUDA 2,720 هسته Tensor نسل پنجم 680 هسته Ray Tracing نسل چهارم
  • ارسال: ۱ تا ۲ روز کاری
  • وضعیت: نو / پلمپ کارخانه
  • گارانتی: یک ماه گارانتی

مشخصات فنی کامل

۱۴ مورد
گرافیک
  • تاریخ عرضه: 30 ژانویه 2025 (عرضه رسمی NVIDIA GeForce RTX 5090)
  • نسل: NVIDIA Blackwell (GeForce RTX 50 Series، نسل جدید GPUهای مبتنی بر معماری Blackwell)
  • نسل قبلی: NVIDIA GeForce RTX 4090 (معماری Ada Lovelace)
  • وضعیت تولید: فعال (Active)
  • قیمت عرضه: حدود 1,999 دلار آمریکا (هر کارت، MSRP رسمی NVIDIA)
  • رابط اتصال: PCIe 5.0 x16
  • پشتیبانی NVLink: ندارد (هر کارت به‌صورت مستقل روی یک اسلات PCIe کار می‌کند و در پیکربندی چهارکارتی، ارتباط بین GPUها از طریق PCIe Gen5 و فریم‌ورک‌های نرم‌افزاری مانند CUDA Multi-GPU، NCCL، Tensor Parallelism، Pipeline Parallelism، DeepSpeed و PyTorch Distributed انجام می‌شود.)
  • توان پردازشی این پیکربندی:
  • قدرت یک کارت RTX 5090:
  • حدود 104.8 ترافلاپس FP32
  • حدود 3,352 TOPS در پردازش AI با FP4 و Sparsity
  • 32 گیگابایت حافظه GDDR7
  • 21,760 هسته CUDA
  • 680 هسته Tensor نسل پنجم
  • مجموع چهار کارت RTX 5090 در این سرور AI:
  • 419.2 ترافلاپس FP32
  • حدود 13,408 TOPS توان پردازش AI در FP4 Sparse
  • 128 گیگابایت حافظه GDDR7
  • 87,040 هسته CUDA
  • 2,720 هسته Tensor نسل پنجم
  • 680 هسته Ray Tracing نسل چهارم
ابعاد
  • طول: حدود 304 میلی‌متر (12 اینچ) (بسته به مدل سازنده)
  • عرض: حدود 137 میلی‌متر تا بیش از 150 میلی‌متر (بسته به طراحی کولر)
  • عرض اسلات: Dual-slot تا 3.5-slot
  • فضای موردنیاز در پیکربندی چهارکارتی: حداقل کیس Full Tower یا شاسی GPU Server با تعداد اسلات PCIe کافی، فاصله مناسب بین کارت‌ها و گردش هوای حرفه‌ای
حافظه
  • ظرفیت: 32 گیگابایت (هر کارت) — مجموعاً 128 گیگابایت حافظه فیزیکی GDDR7 در پیکربندی چهارکارتی
  • نوع: GDDR7
  • قابلیت ECC: ندارد (برخلاف کارت‌های RTX PRO و Data Center، حافظه RTX 5090 نسخه GeForce فاقد ECC سخت‌افزاری است)
  • گذرگاه حافظه: 512 بیت (هر کارت)
  • پهنای باند: حدود 1,792 گیگابایت بر ثانیه (هر کارت)
  • مجموع پهنای باند چهار کارت: حدود 7,168 گیگابایت بر ثانیه (≈7.1 ترابایت بر ثانیه)
  • پهنای باند I/O اندازه‌گیری‌شده در تست‌های عملی: وابسته به نوع مادربرد، PCIe، درایور و معماری ارتباط چند GPU
  • توضیح حافظه در سرور AI چهارکارتی:
  • هر کارت RTX 5090 دارای 32GB حافظه اختصاصی خود است و این 128GB حافظه به‌صورت یکپارچه در اختیار یک مدل قرار نمی‌گیرد. برای اجرای مدل‌های بزرگ‌تر از حافظه یک GPU باید از روش‌هایی مانند Tensor Parallelism، Pipeline Parallelism، ZeRO Optimization، Quantization و Offloading استفاده شود.
سرعت پردازنده
  • فرکانس پایه: حدود 2017 مگاهرتز
  • فرکانس Boost: حدود 2407 مگاهرتز
  • فرکانس حافظه: 1750 مگاهرتز (سرعت مؤثر 28 گیگابیت بر ثانیه)
صفحه نمایش و خروجی تصویر
  • کانکتورهای نمایش: 3 پورت DisplayPort 2.1b + 1 پورت HDMI 2.1b (بسته به مدل سازنده کارت)
  • حداکثر نمایشگرهای هم‌زمان: 4 نمایشگر مستقل برای هر کارت
  • در پیکربندی چهارکارتی: تا 16 نمایشگر مستقل (در صورت پشتیبانی مادربرد و سیستم‌عامل)
  • رزولوشن پشتیبانی‌شده: 4 نمایشگر 4K با نرخ بالا / نمایشگرهای 8K با نرخ 60 هرتز / پشتیبانی از HDR، Display Stream Compression (DSC)، HDMI 2.1b، DisplayPort 2.1b و مدیریت چند نمایشگر حرفه‌ای
طراحی برد و توان مصرفی
  • عرض اسلات: معمولاً Dual-slot تا 3.5-slot (بسته به مدل Founders Edition یا Custom)
  • توان مصرفی (TDP): حدود 575 وات (هر کارت)
  • مجموع توان مصرفی چهار کارت: حدود 2300 وات فقط برای GPUها
  • پاور پیشنهادی سیستم: حداقل 1600 وات برای یک کارت / برای پیکربندی چهارکارتی پیشنهاد می‌شود از پاورهای سروری یا چند پاور مجموعاً در محدوده 3000 تا 4000 وات استفاده شود
  • کانکتور تغذیه: 1 عدد کانکتور 16-pin PCIe 5.0 (12V-2x6) برای هر کارت
  • مجموع کانکتور تغذیه: 4 عدد کانکتور 16-pin برای چهار کارت
  • فرم فاکتور: Full Height, Full Length، مناسب کیس‌های Workstation Tower بزرگ، شاسی‌های GPU Server و سیستم‌های دارای جریان هوای بسیار قدرتمند
  • سیستم خنک‌کننده: بسته به مدل کارت، شامل طراحی Founders Edition یا خنک‌کننده‌های سفارشی سه‌فن، با نیاز به Airflow بسیار بالا برای کارکرد مداوم در بارهای AI
عملکرد نظری
  • نرخ پیکسل: حدود 424.4 گیگاپیکسل بر ثانیه (هر کارت)
  • مجموع چهار کارت: حدود 1,697.6 گیگاپیکسل بر ثانیه
  • نرخ تکسچر: حدود 1,637 گیگاتکسل بر ثانیه (≈1.63 ترا‌تکسل بر ثانیه، هر کارت)
  • مجموع چهار کارت: حدود 6.55 ترا‌تکسل بر ثانیه
  • FP32 (تک‌دقتی): حدود 104.8 ترافلاپس (هر کارت)
  • مجموع چهار کارت: حدود 419.2 ترافلاپس FP32
  • FP64 (دو‌دقتی): حدود 1.64 ترافلاپس (هر کارت) (نسبت حدود 1:64 نسبت به FP32)
  • مجموع چهار کارت: حدود 6.56 ترافلاپس FP64
  • عملکرد RT Core: حدود 318 ترافلاپس (هر کارت، بر اساس نسل چهارم RT Core)
  • مجموع چهار کارت: حدود 1.27 پتافلاپس در پردازش Ray Tracing
  • AI TOPS (FP4 با Sparsity): حدود 3,352 TOPS (هر کارت)
  • مجموع چهار کارت: حدود 13,408 TOPS توان پردازش هوش مصنوعی FP4 Sparse
  • FP8 Tensor Core: حدود 1,676 TOPS (Sparse) / حدود 838 TOPS (Dense) (هر کارت)
  • مجموع چهار کارت: حدود 6,704 TOPS Sparse / حدود 3,352 TOPS Dense
  • BF16 / FP16 Tensor Core: حدود 838 TFLOPS (Sparse) / حدود 419 TFLOPS (Dense) (هر کارت)
  • مجموع چهار کارت: حدود 3,352 TFLOPS Sparse / حدود 1,676 TFLOPS Dense
  • TF32 Tensor Core: حدود 419 TFLOPS (Sparse) / حدود 209 TFLOPS (Dense) (هر کارت)
  • مجموع چهار کارت: حدود 1,676 TFLOPS Sparse / حدود 836 TFLOPS Dense
  • INT8 Tensor (Dense): حدود 838 TOPS (هر کارت)
  • مجموع چهار کارت: حدود 3,352 TOPS INT8 Dense
  • (اعداد Sparse بر پایه فعال‌سازی فناوری Fine-Grained Structured Sparsity در نسل پنجم Tensor Coreهای Blackwell محاسبه شده‌اند.)
فناوری‌ها و ویژگی‌های پشتیبانی‌شده
  • رابط PCI Express Gen5 x16 با پهنای باند بالا برای ارتباط سریع میان GPU و پردازنده مرکزی در سیستم‌های AI Workstation و GPU Server
  • 32 گیگابایت حافظه GDDR7 با پهنای باند بسیار بالا برای اجرای مدل‌های هوش مصنوعی، تولید محتوا و پردازش‌های سنگین GPU
  • مجموع چهار کارت با 128 گیگابایت حافظه GDDR7 برای اجرای مدل‌های بزرگ با استفاده از تکنیک‌های Model Parallelism و Quantization
  • معماری NVIDIA Blackwell با Streaming Multiprocessor بازطراحی‌شده و افزایش چشمگیر بهره‌وری نسبت به نسل Ada Lovelace
  • هسته‌های Tensor نسل پنجم با پشتیبانی از FP4، FP6، FP8، BF16، FP16، TF32، INT8 و INT4 برای شتاب‌دهی مدل‌های زبانی بزرگ و مدل‌های مولد
  • Transformer Engine نسل جدید برای افزایش سرعت آموزش و استنتاج مدل‌های Transformer، LLM و Generative AI
  • پشتیبانی از Fine-Grained Structured Sparsity برای افزایش عملکرد Tensor Core در مدل‌های هوش مصنوعی بدون کاهش محسوس دقت
  • پشتیبانی از فناوری Neural Rendering برای ترکیب پردازش گرافیکی سنتی با شبکه‌های عصبی
  • هسته‌های Ray Tracing نسل چهارم با فناوری RTX Mega Geometry، Shader Execution Reordering و بهبود رهگیری پرتو در صحنه‌های پیچیده
  • موتورهای NVENC نسل نهم و NVDEC نسل ششم با پشتیبانی از AV1، H.264، HEVC و پردازش هم‌زمان چند استریم ویدئویی
  • پشتیبانی از NVIDIA CUDA، CUDA-X AI، cuDNN، TensorRT، TensorRT-LLM، NCCL، RAPIDS، Triton Inference Server و NGC Containers
  • پشتیبانی از اجرای مدل‌های هوش مصنوعی متن‌باز مانند Llama، Qwen، DeepSeek، Mistral، Gemma و مدل‌های Vision Language
  • پشتیبانی از NVIDIA OptiX برای رندرینگ GPU Accelerated
  • پشتیبانی از NVIDIA Omniverse، Blender AI Tools، Unreal Engine، Unity و نرم‌افزارهای تولید محتوای حرفه‌ای
  • پشتیبانی از DLSS 4 و Multi Frame Generation برای پردازش‌های گرافیکی نسل جدید
  • قابلیت اجرای هم‌زمان چندین مدل AI، مدل‌های زبانی، مدل‌های تصویری و سرویس‌های استنتاج روی یک سرور GPU
محدوده مناسب این پیکربندی
  • پیکربندی 4× NVIDIA GeForce RTX 5090 32GB GDDR7 یک سرور AI بسیار قدرتمند برای توسعه، تحقیق و اجرای مدل‌های هوش مصنوعی است که مجموعاً 128 گیگابایت حافظه GDDR7، بیش از 87 هزار هسته CUDA، 2,720 هسته Tensor نسل پنجم و بیش از 13,000 TOPS توان پردازش AI FP4 Sparse ارائه می‌دهد.
  • این سیستم برای Training و Fine-Tuning مدل‌های Deep Learning، اجرای LLMهای بزرگ، تولید تصویر و ویدئو با AI، Vision AI، Multimodal AI، پردازش‌های علمی و ساخت سرویس‌های Inference گزینه‌ای بسیار قدرتمند است.
  • در مقایسه با کارت‌های Enterprise مانند RTX PRO 6000، این پیکربندی حافظه ECC، vGPU رسمی، MIG و قابلیت‌های دیتاسنتری NVIDIA را ندارد، اما در مقابل با چهار GPU Blackwell، قدرت خام پردازشی بسیار بالایی ارائه می‌دهد و برای پروژه‌های تحقیقاتی، شرکت‌های توسعه هوش مصنوعی، آزمایشگاه‌های ML و سرورهای خصوصی AI یکی از قدرتمندترین راهکارهای مبتنی بر GPU مصرفی محسوب می‌شود.
مدل‌های هوش مصنوعی قابل اجرا روی این پیکربندی
  • با ظرفیت 32 گیگابایت VRAM در هر کارت (و مجموعاً 128 گیگابایت حافظه فیزیکی GDDR7 در پیکربندی چهارکارتی، بدون یکپارچگی حافظه از طریق NVLink)، این سرور AI مبتنی بر 4× NVIDIA RTX 5090 Blackwell یکی از قدرتمندترین سیستم‌های GPU Compute غیر Enterprise محسوب می‌شود.
  • این پیکربندی با داشتن 87,040 هسته CUDA، 2,720 هسته Tensor نسل پنجم، حدود 419 ترافلاپس FP32 و بیش از 13,000 TOPS توان پردازش AI در FP4 Sparse برای اجرای مدل‌های هوش مصنوعی مولد، مدل‌های زبانی بزرگ، Fine-Tuning، Inference، پردازش تصویر، تولید ویدئو، بینایی ماشین و تحقیقات Deep Learning طراحی شده است.
  • به دلیل نبود NVLink و محدود بودن حافظه هر GPU به 32GB، اجرای مدل‌های بسیار بزرگ نیازمند استفاده از روش‌هایی مانند Tensor Parallelism، Pipeline Parallelism، Quantization، LoRA، QLoRA، ZeRO Optimization و CPU Offloading است.
  • مدل‌های زبانی بزرگ (LLM) با معماری Transformer:
  • روی یک کارت (32GB):
  • مدل‌هایی تا حدود 13B پارامتر با دقت کامل BF16/FP16
  • مدل‌هایی تا حدود 30B پارامتر با FP8
  • مدل‌هایی تا حدود 70B پارامتر با کوانتایز 4 بیتی (INT4 / GPTQ / AWQ / GGUF)
  • روی چهار کارت (128GB VRAM مجموع):
  • با استفاده از Tensor Parallelism و Pipeline Parallelism از طریق فریم‌ورک‌هایی مانند TensorRT-LLM، vLLM، DeepSpeed، Megatron-LM، Hugging Face Accelerate و PyTorch Distributed:
  • مدل‌هایی تا حدود 70B پارامتر با دقت BF16/FP16
  • مدل‌هایی تا حدود 100B تا 150B پارامتر با FP8
  • مدل‌هایی در محدوده 300B تا 400B+ پارامتر با کوانتایز 4 بیتی
  • نمونه مدل‌های قابل اجرا:
  • Llama 3.1 8B
  • Llama 3.1 70B
  • Llama 3.3 70B
  • Llama 4 Scout
  • Llama 4 Maverick (Quantized)
  • Llama 3.1 405B (نسخه‌های بسیار فشرده و Quantized با محدودیت سرعت)
  • Mistral 7B
  • Mistral Small
  • Mistral Medium
  • Mixtral 8x7B
  • Mixtral 8x22B
  • Mixtral Large (Quantized)
  • Qwen2.5 7B
  • Qwen2.5 14B
  • Qwen2.5 32B
  • Qwen2.5 72B
  • Qwen3 30B
  • Qwen3 235B (Quantized)
  • Gemma 2 9B
  • Gemma 2 27B
  • Gemma 3
  • DeepSeek-R1
  • DeepSeek-R1 Distill
  • DeepSeek-V2
  • DeepSeek-V3 (Quantized)
  • Phi-3
  • Phi-4
  • Command R
  • Command R+
  • DBRX
  • Falcon 40B
  • Falcon 180B (Quantized)
  • Yi-34B
  • InternLM
  • InternLM2
  • ChatGLM
  • Baichuan
  • Jamba
  • OpenChat
  • Vicuna
  • WizardLM
  • Nous Hermes
  • Code Llama
  • DeepSeek Coder
  • Qwen Coder
  • StarCoder
  • StarCoder2
  • Codestral
  • Granite
  • Nemotron
  • مدل‌های تصویری مولد (Generative Image Models):
  • Stable Diffusion 1.5
  • Stable Diffusion XL
  • Stable Diffusion XL Turbo
  • Stable Diffusion 3
  • Stable Diffusion 3.5
  • FLUX.1 Schnell
  • FLUX.1 Dev
  • FLUX.1 Pro (Quantized)
  • FLUX Kontext
  • AuraFlow
  • PixArt Alpha
  • PixArt Sigma
  • Hunyuan DiT
  • Lumina Image
  • Kandinsky
  • DreamShaper
  • Juggernaut XL
  • RealVisXL
  • Playground v2.5
  • SANA
  • Black Forest Labs FLUX
  • این پیکربندی چهارکارته برای تولید تعداد بسیار زیادی تصویر، Batch Generation، آموزش مدل‌های Diffusion و توسعه سرویس‌های Generative Image AI مناسب است.
  • مدل‌های تولید ویدئو (Generative Video Models):
  • Stable Video Diffusion
  • CogVideoX
  • Wan 2.x
  • Hunyuan Video
  • LTX Video
  • AnimateDiff
  • VideoCrafter
  • DynamiCrafter
  • ModelScope Text-to-Video
  • ZeroScope
  • Open-Sora
  • Step-Video
  • MimicMotion
  • این سیستم می‌تواند برای تولید ویدئوهای AI، پردازش فریم‌های بالا، آموزش مدل‌های Video Diffusion و ساخت سرویس‌های تولید محتوای ویدئویی استفاده شود.
  • فاین‌تیون و آموزش مدل‌ها:
  • Fine-tuning کامل مدل‌های کوچک و متوسط تا حدود 30B پارامتر
  • Fine-tuning مدل‌های بزرگ‌تر با تقسیم بین چهار GPU
  • LoRA Training روی مدل‌های 70B و بالاتر
  • QLoRA Training روی مدل‌های بسیار بزرگ‌تر
  • Instruction Tuning
  • Supervised Fine-Tuning (SFT)
  • DPO (Direct Preference Optimization)
  • ORPO
  • PPO
  • RLHF
  • Reward Model Training
  • Continual Learning
  • Domain Adaptation
  • Embedding Training
  • Vision Fine-tuning
  • Multimodal Fine-tuning
  • Training مدل‌های اختصاصی سازمانی
  • مدل‌های چندوجهی (Multimodal) و Vision-Language:
  • LLaVA
  • LLaVA-NeXT
  • Qwen2-VL
  • Qwen2.5-VL
  • Qwen3-VL
  • InternVL
  • MiniCPM-V
  • DeepSeek VL
  • PaliGemma
  • Florence-2
  • BLIP-2
  • InstructBLIP
  • Kosmos
  • Idefics
  • Fuyu
  • Video-LLaVA
  • Gemini Open Models
  • CLIP
  • OpenCLIP
  • این پیکربندی برای ساخت دستیارهای هوشمند چندوجهی، سیستم‌های تحلیل تصویر، Document AI و Agentهای هوش مصنوعی مناسب است.
  • مدل‌های بینایی ماشین (Computer Vision):
  • YOLOv8
  • YOLOv9
  • YOLOv10
  • YOLO11
  • RT-DETR
  • DETR
  • Grounding DINO
  • SAM
  • SAM2
  • FastSAM
  • Mask R-CNN
  • Detectron2
  • OpenPose
  • MediaPipe
  • CLIP
  • DINOv2
  • Vision Transformer (ViT)
  • Swin Transformer
  • ConvNeXt
  • EfficientNet
  • ResNet
  • SegFormer
  • PaddleOCR
  • TrOCR
  • EasyOCR
  • OCR صنعتی
  • Object Detection
  • Image Segmentation
  • Video Analytics
  • مدل‌های گفتار و صوت:
  • Whisper
  • Whisper Large V3
  • SeamlessM4T
  • XTTS
  • Bark
  • VALL-E
  • CosyVoice
  • Fish Speech
  • Parler TTS
  • StyleTTS
  • SpeechT5
  • AudioCraft
  • MusicGen
  • این پیکربندی توانایی اجرای هم‌زمان چندین مدل Speech-to-Text، Text-to-Speech و پردازش صوتی را دارد.
  • رندرینگ، طراحی و Digital Content Creation:
  • NVIDIA Omniverse
  • Blender Cycles
  • NVIDIA OptiX
  • Chaos V-Ray GPU
  • Redshift
  • OctaneRender
  • D5 Render
  • Lumion
  • Unreal Engine 5 Path Tracer
  • Unity HDRP Ray Tracing
  • Adobe Premiere Pro
  • DaVinci Resolve Studio
  • Adobe After Effects
  • Adobe Substance 3D
  • Cinema 4D
  • Autodesk Maya
  • Autodesk 3ds Max
  • SideFX Houdini
  • محاسبات علمی و HPC:
  • CUDA Computing
  • CUDA-X AI
  • cuDNN
  • TensorRT
  • TensorRT-LLM
  • NCCL
  • RAPIDS
  • cuBLAS
  • cuFFT
  • cuSPARSE
  • cuSOLVER
  • PyTorch
  • TensorFlow
  • JAX
  • ONNX Runtime
  • OpenMM
  • GROMACS
  • LAMMPS
  • ANSYS
  • MATLAB GPU Computing
  • COMSOL Multiphysics
  • ParaView
  • استنتاج (Inference) در مقیاس سازمانی:
  • اجرای هم‌زمان چندین مدل LLM متوسط و بزرگ
  • راه‌اندازی سرویس‌های AI داخلی
  • استقرار Chatbotهای سازمانی
  • اجرای RAG Pipeline
  • پردازش هم‌زمان مدل‌های Text، Image، Audio و Video
  • پشتیبانی از NVIDIA Triton Inference Server
  • اجرای چندین Endpoint هوش مصنوعی روی یک سرور
  • مناسب برای شرکت‌های AI، آزمایشگاه‌های تحقیقاتی، مراکز توسعه مدل و سرویس‌های هوش مصنوعی خصوصی
  • مجازی‌سازی و زیرساخت سازمانی:
  • Docker GPU Runtime
  • NVIDIA Container Toolkit
  • Kubernetes GPU Operator
  • Kubeflow
  • Ray
  • Slurm
  • NGC Containers
  • PyTorch Distributed
  • DeepSpeed
  • Megatron-LM
  • Hugging Face Accelerate
ویژگی‌های گرافیکی
  • DirectX: 12 Ultimate (12_2)
  • OpenGL: 4.6
  • OpenCL: 3.0
  • Vulkan: 1.4
  • Shader Model: 6.8
  • CUDA Capability: 12.0
پردازنده گرافیکی (GPU)
  • نام تراشه: GB202
  • معماری: NVIDIA Blackwell
  • سازنده تراشه: TSMC، فرآیند ساخت 4N (نسخه سفارشی NVIDIA از فرآیند پیشرفته TSMC)
  • تعداد ترانزیستور: حدود 92.2 میلیارد ترانزیستور
  • مساحت تراشه: حدود 750 میلی‌متر مربع
  • تعداد SM فعال: 170 عدد Streaming Multiprocessor
  • نسل هسته‌های Ray Tracing: نسل چهارم (با پشتیبانی از RTX Mega Geometry، Neural Rendering، Shader Execution Reordering و فناوری‌های جدید رهگیری پرتو Blackwell)
  • نسل هسته‌های Tensor: نسل پنجم (با پشتیبانی از FP4، FP6، FP8، BF16، FP16، TF32، INT8، INT4 و Transformer Engine نسل جدید)
  • نسل NVENC: نسل نهم
  • نسل NVDEC: نسل ششم
  • پشتیبانی Video Codec: AV1 Encode/Decode، H.264، HEVC و پردازش حرفه‌ای چندرسانه‌ای
  • واحدهای FP64: حدود 340 هسته FP64 با نسبت عملکرد محدود نسبت به FP32 (طراحی‌شده برای سازگاری نرم‌افزاری، نه محاسبات علمی سنگین HPC)
پشتیبانی نرم‌افزار مجازی‌سازی (VGPU)
  • پشتیبانی از vGPU: ندارد (RTX 5090 نسخه GeForce بوده و مانند کارت‌های RTX PRO و Data Center دارای لایسنس رسمی NVIDIA vGPU نیست.)
  • نرم‌افزارهای پشتیبانی‌شده: NVIDIA CUDA، NVIDIA Container Toolkit، Docker GPU Runtime، PyTorch، TensorFlow، JAX، ONNX Runtime، TensorRT، TensorRT-LLM، DeepSpeed، vLLM و فریم‌ورک‌های Multi-GPU AI
  • پشتیبانی Multi-GPU: دارد (از طریق CUDA Multi-GPU، NCCL، PCIe Peer-to-Peer، Tensor Parallelism و Pipeline Parallelism)
  • پشتیبانی MIG: ندارد (Multi-Instance GPU مختص کارت‌های دیتاسنتری Hopper، Ada Enterprise و Blackwell Enterprise است.)
  • نرم‌افزار پیشنهادی: NVIDIA CUDA Toolkit، NVIDIA TensorRT، TensorRT-LLM، PyTorch Distributed، DeepSpeed و NVIDIA NGC Containers
پیکربندی رندر
  • تعداد CUDA Core (Shading Units): 21,760 (هر کارت)
  • مجموع چهار کارت: 87,040 هسته CUDA
  • تعداد TMU: 680 (هر کارت)
  • مجموع چهار کارت: 2,720 واحد TMU
  • تعداد ROP: 176 (هر کارت)
  • مجموع چهار کارت: 704 واحد ROP
  • تعداد SM: 170 (هر کارت)
  • مجموع چهار کارت: 680 عدد SM
  • تعداد Tensor Core: 680 (نسل پنجم، هر کارت)
  • مجموع چهار کارت: 2,720 هسته Tensor نسل پنجم
  • تعداد RT Core: 170 (نسل چهارم، هر کارت)
  • مجموع چهار کارت: 680 هسته RT نسل چهارم
  • حافظه L1 Cache: 128 کیلوبایت به‌ازای هر SM
  • حافظه L2 Cache: 96 مگابایت