Czym jest NVLink? Jak działa, przepustowość i zastosowania GPU
2026-07-31 312

Nowoczesne systemy wielo-GPU zależą od czegoś więcej niż tylko surowej wydajności GPU. Szybkość, z jaką procesory wymieniają dane, uzyskują dostęp do pamięci i współpracują, może mieć znaczący wpływ na ogólną prędkość. Ten artykuł wyjaśnia przepustowość i generacje NVLink, porównuje NVLink z PCIe i NVSwitch, omawia dostęp do pamięci GPU oraz NVLink-C2C, a także pokazuje, jak NVLink jest wykorzystywany w obciążeniach AI i HPC. Pomaga również zdecydować, kiedy NVLink może poprawić wydajność, a kiedy PCIe może być już wystarczające.

Katalog

Figure 1. NVIDIA NVLink High-Speed Interconnect

Rysunek 1. Wysokoprędkościowy interfejs NVIDIA NVLink

Czym jest NVLink?

NVLink jest technologią interfejsu NVIDIA do przesyłania danych między GPU a innymi procesorami w systemach przyspieszonych obliczeń. Jego głównym celem jest redukcja wąskich gardeł komunikacyjnych, gdy kilka procesorów musi wymieniać duże ilości danych podczas wspólnego działania.

W systemach wieloprocesorowych wydajność może być ograniczona przez szybkość, z jaką dane przemieszczają się między urządzeniami. NVLink zapewnia ścieżkę komunikacyjną o wysokiej przepustowości i niskiej latencji, która redukuje opóźnienia transferu i pomaga podłączonym procesorom wymieniać dane w sposób bardziej efektywny.

Jak działa NVLink?

Figure 2. NVLink GPU-to-GPU Communication Path

Rysunek 2. Ścieżka komunikacji GPU do GPU przez NVLink

NVLink tworzy wysokoprędkościową ścieżkę komunikacyjną między kompatybilnymi GPU i innymi procesorami. Gdy dwa GPU muszą wymienić dane, dostęp peer-to-peer może pozwolić na bezpośrednie przesyłanie danych między ich przestrzeniami pamięci, zamiast wysyłania każdego transferu przez pamięć CPU.

NVLink wspiera dwukierunkową komunikację, więc dane mogą przemieszczać się w obu kierunkach między podłączonymi procesorami. Wielokrotne połączenia NVLink mogą także współpracować, zapewniając szerszą ścieżkę dla transferów danych między procesorami.

NVLink zapewnia fizyczną ścieżkę dla tej komunikacji, podczas gdy oprogramowanie decyduje, jak i kiedy ta ścieżka jest używana. CUDA, sterowniki urządzeń, NCCL oraz aplikacja zarządzają transferami. Gdy dostęp peer jest wspierany i włączony, jeden GPU może czytać z pamięci innego GPU, zapisywać do niej lub kopiować dane przez dostępne połączenie NVLink.

Generacje NVLink i przepustowość

Przepustowość NVLink wzrosła wraz z każdą główną architekturą GPU NVIDIA. Pierwsza generacja NVLink pojawiła się z procesorem Tesla P100 opartym na architekturze Pascal, który wspierał cztery połączenia NVLink i do 160 GB/s całkowitej dwukierunkowej przepustowości na GPU. Volta V100 zwiększyła to do sześciu połączeń i 300 GB/s na GPU.

Trzecia generacja NVLink dotarła wraz z Ampere A100. A100 wspiera 12 połączeń NVLink i do 600 GB/s całkowitej dwukierunkowej przepustowości na GPU. Hopper H100 zwiększył liczbę połączeń do 18, podnosząc przepustowość czwartej generacji NVLink do 900 GB/s na GPU.

Piąta generacja NVLink pojawiła się z Blackwell, zwiększając całkowitą dwukierunkową przepustowość do 1,8 TB/s na GPU. Szósta generacja NVLink, związana z platformą Rubin, zwiększa maksymalne połączenia do 36 i do 3,6 TB/s na GPU.

Generacja NVLink
Architektura NVIDIA
Przykład GPU lub platforma
Maksymalna liczba łączy na GPU
Maksymalna dwukierunkowa przepustowość na GPU
NVLink 1
Pascal
P100
4
160 GB/s
NVLink 2
Volta
V100
6
300 GB/s
NVLink 3
Ampere
A100
12
600 GB/s
NVLink 4
Hopper
H100
18
900 GB/s
NVLink 5
Blackwell
GPU Blackwell
18
1.8 TB/s
NVLink 6
Rubin
Platforma Rubin
36
3.6 TB/s

Przepustowość na linku vs całkowita przepustowość NVLink

Przepustowość na linku i całkowita przepustowość na GPU opisują różne wartości. GPU mogą mieć kilka połączeń NVLink, więc całkowita przepustowość na GPU łączy przepustowość dostępną ze wszystkich obsługiwanych łączy.

Na przykład, H100 ma 18 połączeń NVLink 4. Każde łącze zapewnia 50 GB/s dwukierunkowej przepustowości, co daje maksymalną całkowitą przepustowość 900 GB/s na GPU. Blackwell używa 18 połączeń NVLink 5 przy 100 GB/s dwukierunkowej przepustowości na łącze, co daje do 1.8 TB/s na GPU.

Te liczby reprezentują maksymalną przepustowość interfejsu. Rzeczywista przepustowość między dwoma GPU może być niższa, zależnie od liczby aktywnych łączy między nimi, topologii systemu i konfiguracji sprzętowej. Przy odczycie specyfikacji NVLink zawsze sprawdzaj, czy wartość odnosi się do jednego łącza, jednego GPU, czy całej tkaniny NVLink.

NVLink vs PCIe vs NVSwitch

Rysunek 3. Porównanie NVLink, PCIe i NVSwitch

NVLink, PCIe i NVSwitch przesyłają dane w systemach GPU, ale pełnią różne role. PCIe to interfejs ogólnego przeznaczenia, który łączy GPU i inne urządzenia z systemem głównym. NVLink zapewnia komunikację wysokiej prędkości między obsługiwanymi procesorami NVIDIA, podczas gdy NVSwitch współpracuje z NVLink, aby połączyć większe grupy GPU poprzez wspólną tkaninę przełączającą.

Cechy
NVLink
PCIe
NVSwitch
Czym jest
Interfejs wysokiej prędkości dla procesorów
Interfejs systemowy ogólnego przeznaczenia
Tkanina przełączająca używana z NVLink
Główne przeznaczenie
Szybka komunikacja między obsługiwanymi GPU i procesorami
Łączenie GPU, SSD, NIC i innych urządzeń z systemem
Łączenie wielu GPU obsługujących NVLink poprzez jedną tkaninę
Komunikacja między GPU
Zapewnia komunikację między sobą o wysokiej przepustowości
Obsługuje transfery między GPU, ale wydajność zależy od topologii PCIe
Przekierowuje ruch NVLink między wieloma GPU
Ścieżka danych
Bezpośrednie połączenia procesorów lub połączenia przez NVSwitch
Ruch przechodzi przez złożone jednostki PCIe i przełączniki
Zapewnia przełączone ścieżki między GPU połączonymi z NVLink
Opóźnienie
Zaprojektowany z myślą o niskim opóźnieniu w komunikacji procesorów
Odpowiedni do ogólnych operacji wejścia/wyjścia, ale ścieżki między GPU mogą wymagać bardziej złożonej infrastruktury systemowej
Dodaje przełączanie, zachowując jednocześnie łączność GPU poprzez wysokoprzepustowe ścieżki NVLink
Topologia
Bezpośrednie połączenia punkt-punkt lub połączenia do NVSwitch
Złożone jednostki CPU i przełączniki PCIe
Przełączana, wysoko połączona tkanina GPU
Kompatybilność
Wymaga obsługiwanego sprzętu NVIDIA
Szerokie wsparcie standardu przemysłowego
Wymaga obsługiwanych platform NVIDIA NVLink
Najlepiej dopasowane do
Systemów multi-GPU o dużym obciążeniu komunikacyjnym
Systemów z pojedynczym GPU lub zadań z ograniczonym ruchem między GPU
Dużych systemów, w których wiele GPU potrzebuje częstej komunikacji
Główne ograniczenie
Ograniczone do kompatybilnego sprzętu i platform NVIDIA
Może stać się wąskim gardłem w przypadku intensywnych obciążeń między GPU
Zwiększa koszty sprzętu i złożoność systemu

Mówiąc prosto, PCIe łączy urządzenia z systemem, NVLink zapewnia wysokowydajną komunikację między procesorami, a NVSwitch rozszerza NVLink na większe konfiguracje GPU. NVSwitch nie jest zamiennikiem NVLink, ponieważ zależy od połączeń NVLink do przesyłania ruchu GPU.

PCIe może być wystarczające, gdy komunikacja między GPU jest ograniczona. NVLink staje się bardziej użyteczny, gdy GPU wymieniają dane często, podczas gdy NVSwitch jest głównie używany, gdy wiele GPU obsługujących NVLink wymaga skalowalnej komunikacji w tym samym systemie.

Czy NVLink łączy pamięć GPU?

NVLink nie łączy automatycznie VRAM kilku GPU w jedną większą pulę pamięci fizycznej. Dwa GPU z 80 GB pamięci każde wciąż mają oddzielne przestrzenie pamięci 80 GB, a nie stają się jednym GPU z 160 GB lokalnej VRAM.

Gdy sprzęt i topologia to wspierają, dostęp do pamięci przez CUDA peer-to-peer pozwala jednej karcie GPU na dostęp do pamięci innej karty GPU. Karta GPU może odczytywać, zapisywać lub kopiować dane do pamięci sąsiadującej bez wcześniejszego przesuwania danych przez pamięć CPU. NVLink zapewnia wysokoprzepustową ścieżkę dla tych transferów, gdy karty GPU są podłączone przez ten interfejs.

Niemniej jednak pamięć zdalnego GPU pozostaje fizycznie przypisana do innej karty GPU. Oprogramowanie nadal decyduje, gdzie dane są przechowywane, która karta GPU uzyskuje do nich dostęp i czy dane powinny być kopiowane lub uzyskiwane zdalnie. CUDA Unified Memory może uprościć dostęp do pamięci w różnych urządzeniach, ale nie eliminuje fizycznego rozdzielenia między pamięcią GPU.

Z tego powodu umiejscowienie pamięci nadal ma znaczenie w systemach z wieloma GPU. Częsty dostęp do pamięci zdalnego GPU może wpłynąć na wydajność, nawet gdy NVLink zapewnia szybsze połączenie.

Jak NVLink-C2C rozszerza NVLink na połączenia chip-to-chip

Figure 4. NVLink-C2C Connection Between CPU and GPU

Rysunek 4. Połączenie NVLink-C2C między CPU a GPU

NVLink-C2C rozszerza NVIDIA NVLink z połączeń procesorów na poziomie płyty do krótkich połączeń chip-to-chip wewnątrz pakietu lub super-chip. Może łączyć CPU, GPU i inne kompatybilne układy scalone, pozwalając im wymieniać dane za pomocą ściśle zintegrowanego połączenia.

Na wspieranych platformach NVLink-C2C z koherencją, podłączone procesory mogą również utrzymywać spójny widok pamięci. Na przykład, Grace Hopper wykorzystuje NVLink-C2C między procesorem Grace a GPU Hopper, co pozwala obu procesorom na dostęp do pamięci wzdłuż połączenia, podczas gdy ich fizyczna pamięć pozostaje oddzielna.

Główna różnica polega na tym, gdzie każda technologia jest używana. Standardowy NVLink zwykle łączy osobne karty GPU lub łączy GPU z NVSwitch na poziomie płyty lub systemu. NVLink-C2C przybliża ten sam koncepcję szybkiego połączenia do samych procesorów, co czyni go odpowiednim do połączeń CPU-do-GPU, CPU-do-CPU i innych ściśle zintegrowanych połączeń chip-to-chip.

NVLink dla obciążeń AI i Multi-GPU

NVLink jest najbardziej przydatny, gdy kilka kart GPU pracuje nad tym samym obciążeniem i często musi wymieniać dane. W tych systemach wydajność zależy nie tylko od szybkości obliczeń GPU, ale także od tego, jak szybko dane poruszają się między przyspieszaczami.

W trakcie szkolenia AI karty GPU mogą wymieniać gradienty, parametry, aktywacje i wyniki pośrednie. NVIDIA NCCL obsługuje wiele z tych transferów poprzez operacje takie jak AllReduce, AllGather, ReduceScatter, Broadcast i komunikację punkt-punkt.

Równoległość tensorów wymaga częstej komunikacji, ponieważ części tego samego obliczenia działają na różnych kartach GPU, a częściowe wyniki muszą być wymieniane przed kontynuacją przetwarzania. Równoległość modelu również przenosi dane między kartami GPU, gdy różne części modelu są przetwarzane.

Wnioskowanie w modelach LLM z wieloma GPU ma podobne wymagania, gdy duży model jest podzielony pomiędzy kilka kart GPU. Jeśli jedna karta GPU musi czekać na dane z innej, opóźnienia w komunikacji mogą zmniejszyć ogólną przepustowość.

Obciążenia HPC, takie jak symulacje naukowe, dynamika płynów obliczeniowych i modelowanie molekularne, również wymieniają dane brzegowe, częściowe wyniki i informacje synchronizacyjne między kartami GPU. Szybsze transfery GPU-do-GPU mogą skrócić czas oczekiwania i pomóc w bardziej efektywnym działaniu obciążenia.

W przypadku obciążeń z dużą ilością komunikacji, NVLink może skrócić czas, który karty GPU spędzają na wymianie danych i pomóc systemom z wieloma GPU skalować się bardziej efektywnie.

Kiedy potrzebujesz NVLink?

NVLink jest dobrym rozwiązaniem, gdy kilka kart GPU pracuje nad tym samym zadaniem i często wymienia dane. Może pomóc, gdy komunikacja GPU-do-GPU spowalnia obciążenie, a system wspiera NVLink.

NVLink jest lepszym wyborem, gdy:

• Kilka kart GPU współpracuje nad jednym obciążeniem

• Duże ilości danych przemieszcza się między kartami GPU

• Komunikacja GPU ogranicza wydajność

• Karty GPU i platforma wspierają NVLink

• Oprogramowanie może wykorzystać komunikację między wieloma GPU

PCIe może być wystarczający, gdy:

• System używa tylko jednej karty GPU

• Wiele kart GPU obsługuje oddzielne zadania

• Ruch GPU-do-GPU jest niski

• PCIe już spełnia wymagane parametry wydajności

• Niższy koszt i szersze wsparcie sprzętowe są bardziej istotne

Koszt i projekt systemu również mają znaczenie. Systemy obsługujące NVLink mogą wymagać wspieranych kart GPU, odpowiedniej topologii systemu, dodatkowego przełączania oraz większej mocy i chłodzenia w większych konfiguracjach.

Ogólnie rzecz biorąc, NVLink jest najbardziej przydatny, gdy komunikacja między kartami GPU jest wyraźnym ograniczeniem wydajności. Jeśli karty GPU rzadko wymieniają dane lub PCIe już zapewnia wystarczającą przepustowość, NVLink może wprowadzać dodatkowe koszty i złożoność bez wyraźnych zysków wydajnościowych.

O NAS Satysfakcja klienta za każdym razem. Wzajemne zaufanie i wspólne interesy. ARIAT TECH nawiązał długoterminowe i stabilne relacje współpracy z wieloma producentami i agentami." Traktując klientów z rzetelnością i stawiając obsługę w centrum uwagi", cała jakość będzie sprawdzana bez zastrzeżeń i poddawana profesjonalnym
testom funkcjonalnym. Produkty o najwyższej opłacalności oraz najlepsza obsługa to nasze niezmienne zobowiązanie.

Często Zadawane Pytania [FAQ]

1. Czy NVLink może poprawić wydajność, jeśli GPU nie wymieniają danych często?

Zwykle nie w dużym stopniu. NVLink przynosi największą wartość, gdy GPU wymieniają dane często. Jeśli każde GPU obsługuje głównie oddzielne zadania, interkonektor nie musi być głównym ograniczeniem wydajności.

2. Dlaczego topologia NVLink wpływa na wydajność GPU do GPU?

Topologia określa, jak GPU są połączone i ile ścieżek NVLink jest dostępnych między nimi. GPU z bardziej bezpośrednimi połączeniami mogą wymieniać dane szybciej, podczas gdy ruch, który przechodzi przez mniej linków lub dodatkowe przełączniki, może mieć inną przepustowość i opóźnienie.

3. Czy wyższa przepustowość NVLink zawsze oznacza szybszą wydajność aplikacji?

Nie. Wyższa przepustowość pomaga tylko wtedy, gdy transfer danych między GPU ogranicza obciążenie. Jeśli prędkość obliczeń, pamięć GPU, przechowywanie lub efektywność oprogramowania jest głównym wąskim gardłem, dodatkowa przepustowość NVLink może mieć niewielki wpływ.

4. Czy CUDA może automatycznie używać NVLink między obsługiwanymi GPU?

CUDA może korzystać z dostępu peer-to-peer, gdy GPU, topologia, sterowniki, i konfiguracja oprogramowania to wspierają. Jednak aplikacja lub biblioteka komunikacyjna wciąż decyduje, jak dane są przesyłane, więc posiadanie sprzętu NVLink nie gwarantuje, że każde przesyłanie będzie z niego korzystać. 5. Jaka jest różnica między lokalną a zdalną pamięcią GPU przez NVLink?

Pamięć lokalna jest fizycznie podłączona do używającego jej GPU, podczas gdy

pamięć zdalna jest podłączona do innego GPU. NVLink może zapewnić szybszą drogę do pamięci zdalnej, ale zdalny dostęp wciąż różni się od dostępu do lokalnej pamięci VRAM, więc rozmieszczenie pamięci może wpływać na wydajność.

E-mail: Info@ariat-tech.comTel. HK: +852 30501966Adres: Pok. 2703 27F Ho King Comm Center 2-16,
ul. Fa Yuen, MongKok, Kowloon, Hongkong.