
NVLink jest technologią interfejsu NVIDIA do przesyłania danych między GPU a innymi procesorami w systemach przyspieszonych obliczeń. Jego głównym celem jest redukcja wąskich gardeł komunikacyjnych, gdy kilka procesorów musi wymieniać duże ilości danych podczas wspólnego działania.
W systemach wieloprocesorowych wydajność może być ograniczona przez szybkość, z jaką dane przemieszczają się między urządzeniami. NVLink zapewnia ścieżkę komunikacyjną o wysokiej przepustowości i niskiej latencji, która redukuje opóźnienia transferu i pomaga podłączonym procesorom wymieniać dane w sposób bardziej efektywny.

Rysunek 2. Ścieżka komunikacji GPU do GPU przez NVLink
NVLink tworzy wysokoprędkościową ścieżkę komunikacyjną między kompatybilnymi GPU i innymi procesorami. Gdy dwa GPU muszą wymienić dane, dostęp peer-to-peer może pozwolić na bezpośrednie przesyłanie danych między ich przestrzeniami pamięci, zamiast wysyłania każdego transferu przez pamięć CPU.
NVLink wspiera dwukierunkową komunikację, więc dane mogą przemieszczać się w obu kierunkach między podłączonymi procesorami. Wielokrotne połączenia NVLink mogą także współpracować, zapewniając szerszą ścieżkę dla transferów danych między procesorami.
NVLink zapewnia fizyczną ścieżkę dla tej komunikacji, podczas gdy oprogramowanie decyduje, jak i kiedy ta ścieżka jest używana. CUDA, sterowniki urządzeń, NCCL oraz aplikacja zarządzają transferami. Gdy dostęp peer jest wspierany i włączony, jeden GPU może czytać z pamięci innego GPU, zapisywać do niej lub kopiować dane przez dostępne połączenie NVLink.
Przepustowość NVLink wzrosła wraz z każdą główną architekturą GPU NVIDIA. Pierwsza generacja NVLink pojawiła się z procesorem Tesla P100 opartym na architekturze Pascal, który wspierał cztery połączenia NVLink i do 160 GB/s całkowitej dwukierunkowej przepustowości na GPU. Volta V100 zwiększyła to do sześciu połączeń i 300 GB/s na GPU.
Trzecia generacja NVLink dotarła wraz z Ampere A100. A100 wspiera 12 połączeń NVLink i do 600 GB/s całkowitej dwukierunkowej przepustowości na GPU. Hopper H100 zwiększył liczbę połączeń do 18, podnosząc przepustowość czwartej generacji NVLink do 900 GB/s na GPU.
Piąta generacja NVLink pojawiła się z Blackwell, zwiększając całkowitą dwukierunkową przepustowość do 1,8 TB/s na GPU. Szósta generacja NVLink, związana z platformą Rubin, zwiększa maksymalne połączenia do 36 i do 3,6 TB/s na GPU.
| Generacja NVLink |
Architektura NVIDIA |
Przykład GPU lub platforma |
Maksymalna liczba łączy na GPU |
Maksymalna dwukierunkowa przepustowość na GPU |
| NVLink 1 |
Pascal |
P100 |
4 |
160 GB/s |
| NVLink 2 |
Volta |
V100 |
6 |
300 GB/s |
| NVLink 3 |
Ampere |
A100 |
12 |
600 GB/s |
| NVLink 4 |
Hopper |
H100 |
18 |
900 GB/s |
| NVLink 5 |
Blackwell |
GPU Blackwell |
18 |
1.8 TB/s |
| NVLink 6 |
Rubin |
Platforma Rubin |
36 |
3.6 TB/s |
Przepustowość na linku i całkowita przepustowość na GPU opisują różne wartości. GPU mogą mieć kilka połączeń NVLink, więc całkowita przepustowość na GPU łączy przepustowość dostępną ze wszystkich obsługiwanych łączy.
Na przykład, H100 ma 18 połączeń NVLink 4. Każde łącze zapewnia 50 GB/s dwukierunkowej przepustowości, co daje maksymalną całkowitą przepustowość 900 GB/s na GPU. Blackwell używa 18 połączeń NVLink 5 przy 100 GB/s dwukierunkowej przepustowości na łącze, co daje do 1.8 TB/s na GPU.
Te liczby reprezentują maksymalną przepustowość interfejsu. Rzeczywista przepustowość między dwoma GPU może być niższa, zależnie od liczby aktywnych łączy między nimi, topologii systemu i konfiguracji sprzętowej. Przy odczycie specyfikacji NVLink zawsze sprawdzaj, czy wartość odnosi się do jednego łącza, jednego GPU, czy całej tkaniny NVLink.

Rysunek 3. Porównanie NVLink, PCIe i NVSwitch
NVLink, PCIe i NVSwitch przesyłają dane w systemach GPU, ale pełnią różne role. PCIe to interfejs ogólnego przeznaczenia, który łączy GPU i inne urządzenia z systemem głównym. NVLink zapewnia komunikację wysokiej prędkości między obsługiwanymi procesorami NVIDIA, podczas gdy NVSwitch współpracuje z NVLink, aby połączyć większe grupy GPU poprzez wspólną tkaninę przełączającą.
| Cechy |
NVLink |
PCIe |
NVSwitch |
| Czym jest |
Interfejs wysokiej prędkości dla procesorów |
Interfejs systemowy ogólnego przeznaczenia |
Tkanina przełączająca używana z NVLink |
| Główne przeznaczenie |
Szybka komunikacja między obsługiwanymi GPU i procesorami |
Łączenie GPU, SSD, NIC i innych urządzeń z systemem |
Łączenie wielu GPU obsługujących NVLink poprzez jedną tkaninę |
| Komunikacja między GPU |
Zapewnia komunikację między sobą o wysokiej przepustowości |
Obsługuje transfery między GPU, ale wydajność zależy od topologii PCIe |
Przekierowuje ruch NVLink między wieloma GPU |
| Ścieżka danych |
Bezpośrednie połączenia procesorów lub połączenia przez NVSwitch |
Ruch przechodzi przez złożone jednostki PCIe i przełączniki |
Zapewnia przełączone ścieżki między GPU połączonymi z NVLink |
| Opóźnienie |
Zaprojektowany z myślą o niskim opóźnieniu w komunikacji procesorów |
Odpowiedni do ogólnych operacji wejścia/wyjścia, ale ścieżki między GPU mogą wymagać bardziej złożonej infrastruktury systemowej |
Dodaje przełączanie, zachowując jednocześnie łączność GPU poprzez wysokoprzepustowe ścieżki NVLink |
| Topologia |
Bezpośrednie połączenia punkt-punkt lub połączenia do NVSwitch |
Złożone jednostki CPU i przełączniki PCIe |
Przełączana, wysoko połączona tkanina GPU |
| Kompatybilność |
Wymaga obsługiwanego sprzętu NVIDIA |
Szerokie wsparcie standardu przemysłowego |
Wymaga obsługiwanych platform NVIDIA NVLink |
| Najlepiej dopasowane do |
Systemów multi-GPU o dużym obciążeniu komunikacyjnym |
Systemów z pojedynczym GPU lub zadań z ograniczonym ruchem między GPU |
Dużych systemów, w których wiele GPU potrzebuje częstej komunikacji |
| Główne ograniczenie |
Ograniczone do kompatybilnego sprzętu i platform NVIDIA |
Może stać się wąskim gardłem w przypadku intensywnych obciążeń między GPU |
Zwiększa koszty sprzętu i złożoność systemu |
Mówiąc prosto, PCIe łączy urządzenia z systemem, NVLink zapewnia wysokowydajną komunikację między procesorami, a NVSwitch rozszerza NVLink na większe konfiguracje GPU. NVSwitch nie jest zamiennikiem NVLink, ponieważ zależy od połączeń NVLink do przesyłania ruchu GPU.
PCIe może być wystarczające, gdy komunikacja między GPU jest ograniczona. NVLink staje się bardziej użyteczny, gdy GPU wymieniają dane często, podczas gdy NVSwitch jest głównie używany, gdy wiele GPU obsługujących NVLink wymaga skalowalnej komunikacji w tym samym systemie.
NVLink nie łączy automatycznie VRAM kilku GPU w jedną większą pulę pamięci fizycznej. Dwa GPU z 80 GB pamięci każde wciąż mają oddzielne przestrzenie pamięci 80 GB, a nie stają się jednym GPU z 160 GB lokalnej VRAM.
Gdy sprzęt i topologia to wspierają, dostęp do pamięci przez CUDA peer-to-peer pozwala jednej karcie GPU na dostęp do pamięci innej karty GPU. Karta GPU może odczytywać, zapisywać lub kopiować dane do pamięci sąsiadującej bez wcześniejszego przesuwania danych przez pamięć CPU. NVLink zapewnia wysokoprzepustową ścieżkę dla tych transferów, gdy karty GPU są podłączone przez ten interfejs.
Niemniej jednak pamięć zdalnego GPU pozostaje fizycznie przypisana do innej karty GPU. Oprogramowanie nadal decyduje, gdzie dane są przechowywane, która karta GPU uzyskuje do nich dostęp i czy dane powinny być kopiowane lub uzyskiwane zdalnie. CUDA Unified Memory może uprościć dostęp do pamięci w różnych urządzeniach, ale nie eliminuje fizycznego rozdzielenia między pamięcią GPU.
Z tego powodu umiejscowienie pamięci nadal ma znaczenie w systemach z wieloma GPU. Częsty dostęp do pamięci zdalnego GPU może wpłynąć na wydajność, nawet gdy NVLink zapewnia szybsze połączenie.

Rysunek 4. Połączenie NVLink-C2C między CPU a GPU
NVLink-C2C rozszerza NVIDIA NVLink z połączeń procesorów na poziomie płyty do krótkich połączeń chip-to-chip wewnątrz pakietu lub super-chip. Może łączyć CPU, GPU i inne kompatybilne układy scalone, pozwalając im wymieniać dane za pomocą ściśle zintegrowanego połączenia.
Na wspieranych platformach NVLink-C2C z koherencją, podłączone procesory mogą również utrzymywać spójny widok pamięci. Na przykład, Grace Hopper wykorzystuje NVLink-C2C między procesorem Grace a GPU Hopper, co pozwala obu procesorom na dostęp do pamięci wzdłuż połączenia, podczas gdy ich fizyczna pamięć pozostaje oddzielna.
Główna różnica polega na tym, gdzie każda technologia jest używana. Standardowy NVLink zwykle łączy osobne karty GPU lub łączy GPU z NVSwitch na poziomie płyty lub systemu. NVLink-C2C przybliża ten sam koncepcję szybkiego połączenia do samych procesorów, co czyni go odpowiednim do połączeń CPU-do-GPU, CPU-do-CPU i innych ściśle zintegrowanych połączeń chip-to-chip.
NVLink jest najbardziej przydatny, gdy kilka kart GPU pracuje nad tym samym obciążeniem i często musi wymieniać dane. W tych systemach wydajność zależy nie tylko od szybkości obliczeń GPU, ale także od tego, jak szybko dane poruszają się między przyspieszaczami.
W trakcie szkolenia AI karty GPU mogą wymieniać gradienty, parametry, aktywacje i wyniki pośrednie. NVIDIA NCCL obsługuje wiele z tych transferów poprzez operacje takie jak AllReduce, AllGather, ReduceScatter, Broadcast i komunikację punkt-punkt.
Równoległość tensorów wymaga częstej komunikacji, ponieważ części tego samego obliczenia działają na różnych kartach GPU, a częściowe wyniki muszą być wymieniane przed kontynuacją przetwarzania. Równoległość modelu również przenosi dane między kartami GPU, gdy różne części modelu są przetwarzane.
Wnioskowanie w modelach LLM z wieloma GPU ma podobne wymagania, gdy duży model jest podzielony pomiędzy kilka kart GPU. Jeśli jedna karta GPU musi czekać na dane z innej, opóźnienia w komunikacji mogą zmniejszyć ogólną przepustowość.
Obciążenia HPC, takie jak symulacje naukowe, dynamika płynów obliczeniowych i modelowanie molekularne, również wymieniają dane brzegowe, częściowe wyniki i informacje synchronizacyjne między kartami GPU. Szybsze transfery GPU-do-GPU mogą skrócić czas oczekiwania i pomóc w bardziej efektywnym działaniu obciążenia.
W przypadku obciążeń z dużą ilością komunikacji, NVLink może skrócić czas, który karty GPU spędzają na wymianie danych i pomóc systemom z wieloma GPU skalować się bardziej efektywnie.
NVLink jest dobrym rozwiązaniem, gdy kilka kart GPU pracuje nad tym samym zadaniem i często wymienia dane. Może pomóc, gdy komunikacja GPU-do-GPU spowalnia obciążenie, a system wspiera NVLink.
• Kilka kart GPU współpracuje nad jednym obciążeniem
• Duże ilości danych przemieszcza się między kartami GPU
• Komunikacja GPU ogranicza wydajność
• Karty GPU i platforma wspierają NVLink
• Oprogramowanie może wykorzystać komunikację między wieloma GPU
• System używa tylko jednej karty GPU
• Wiele kart GPU obsługuje oddzielne zadania
• Ruch GPU-do-GPU jest niski
• PCIe już spełnia wymagane parametry wydajności
• Niższy koszt i szersze wsparcie sprzętowe są bardziej istotne
Koszt i projekt systemu również mają znaczenie. Systemy obsługujące NVLink mogą wymagać wspieranych kart GPU, odpowiedniej topologii systemu, dodatkowego przełączania oraz większej mocy i chłodzenia w większych konfiguracjach.
Ogólnie rzecz biorąc, NVLink jest najbardziej przydatny, gdy komunikacja między kartami GPU jest wyraźnym ograniczeniem wydajności. Jeśli karty GPU rzadko wymieniają dane lub PCIe już zapewnia wystarczającą przepustowość, NVLink może wprowadzać dodatkowe koszty i złożoność bez wyraźnych zysków wydajnościowych.
O NAS
Satysfakcja klienta za każdym razem. Wzajemne zaufanie i wspólne interesy.
Przewodnik po SerDes (Serializer/Deserializer): Jak to działa, projektowanie, zastosowania i testowanie
2026-07-31
Choke ferrytowy vs Koralik ferrytowy: Jak wybrać odpowiedni komponent
2026-07-30
Zwykle nie w dużym stopniu. NVLink przynosi największą wartość, gdy GPU wymieniają dane często. Jeśli każde GPU obsługuje głównie oddzielne zadania, interkonektor nie musi być głównym ograniczeniem wydajności.
Topologia określa, jak GPU są połączone i ile ścieżek NVLink jest dostępnych między nimi. GPU z bardziej bezpośrednimi połączeniami mogą wymieniać dane szybciej, podczas gdy ruch, który przechodzi przez mniej linków lub dodatkowe przełączniki, może mieć inną przepustowość i opóźnienie.
Nie. Wyższa przepustowość pomaga tylko wtedy, gdy transfer danych między GPU ogranicza obciążenie. Jeśli prędkość obliczeń, pamięć GPU, przechowywanie lub efektywność oprogramowania jest głównym wąskim gardłem, dodatkowa przepustowość NVLink może mieć niewielki wpływ.
CUDA może korzystać z dostępu peer-to-peer, gdy GPU, topologia, sterowniki, i konfiguracja oprogramowania to wspierają. Jednak aplikacja lub biblioteka komunikacyjna wciąż decyduje, jak dane są przesyłane, więc posiadanie sprzętu NVLink nie gwarantuje, że każde przesyłanie będzie z niego korzystać. 5. Jaka jest różnica między lokalną a zdalną pamięcią GPU przez NVLink?
pamięć zdalna jest podłączona do innego GPU. NVLink może zapewnić szybszą drogę do pamięci zdalnej, ale zdalny dostęp wciąż różni się od dostępu do lokalnej pamięci VRAM, więc rozmieszczenie pamięci może wpływać na wydajność.
E-mail: Info@ariat-tech.comTel. HK: +852 30501966Adres: Pok. 2703 27F Ho King Comm Center 2-16,
ul. Fa Yuen, MongKok, Kowloon, Hongkong.