Відеокарти MSI REF вже в наявності у COMPX!

Київ, провулок Херсонський 1В

м. Львів, вул. Газова, 26. Офiс 102

м. Одеса, вул. Італійська, 23

м. Харків, просп. Науки, 23

м. Дніпро, вул. Князя Володимира Великого, 15А

м. Чернівці, просп. Незалежності, 52А

м. Івано-Франківськ, вул. Бельведерська, 40

м. Черкаси, вул. Смілянська, 40

м. Полтава, вул. Соборності, 34

Пн-Пт: 10:00-20:00

Сб-Нд: 11:00-18:00

Конфігуратор ПК

Каталог

Кейс налаштування NVIDIA H200 для AI: чому недостатньо просто купити топову відеокарту

True story. До нас звернувся клієнт, який півроку тому купив відеокарту NVIDIA H200 і півроку безуспішно намагався запустити її у своєму сервері. Коли за роботу взялися наші спеціалісти, вони з’ясували, що йому не вдавалося активувати критично важливі режими Cocoon (CC) та TDX. І розв’язали поставлену задачу за пару днів. Наразі сервер вже проходить тестування та готується виконувати реальну роботу в AI-пайплайні.

Ця ситуація дуже показова для всіх, хто планує працювати зі штучним інтелектом чи іншими технологіями, які вимагають використання топових датацентрових відеокарт. Чому? Про це читайте далі.

Не можна просто так взяти і поставити H200 в сервер

NVIDIA H200 — що це за монстр?

NVIDIA H200 — це спеціалізований GPU-прискорювач для штучного інтелекту, для серверів, AI-станцій і датацентрових платформ. Його головна фішка — 141 ГБ пам’яті HBM3e з пропускною здатністю 4,8 ТБ/с.

NVIDIA H200 NVL

Для AI це критично: якщо велика мовна модель не вміщується у власну пам’ять відеокарти, система починає підтягувати частину інформації через накопичувач і оперативну пам’ять. Вона постійно ганяє дані між GPU, CPU, RAM і SSD, впираючись у вузькі місця на кожному етапі. І чим більше швидкої пам’яті доступно AI-прискорювачу, тим менше ризику сповільнення процесу, і тим більше реальної продуктивності.

Тому H200 потрібна там, де відеокарта має тримати в пам’яті дуже багато даних. Зазвичай її беруть для:

  • роботи та навчання великих мовних моделей (LLM);
  • корпоративних AI-сервісів;
  • RAG-пошуку по великих базах даних;
  • наукових обчислень;
  • машинного зору та відеоаналітики;
  • генерації зображень;
  • аналізу сигналів у складних електронних системах.

Окрема тема — мілітарі-застосування NVIDIA H200. Карти такого типу вже успішно працюють у стаціонарних засобах радіоелектронної боротьби (РЕБ) та розвідки (РЕР). Вони навчають дрони та наземні роботизовані комплекси розпізнавати об’єкти та діяти автономно в умовах слабкого чи відсутнього зв’язку з оператором. З ними оборонна інфраструктура стає сильнішою і, що ще важливіше, розумнішою.

NVIDIA H200 є перевіреним рішенням, навколо якого побудований великий стек програм, інструментів і типових задач. Формально вона належить до попереднього покоління (Hopper) — у багатьох датацентрах вже використовуються новіші моделі B200 (Blackwell), а також їх конкуренти — AMD Instinct MI300X та Intel Gaudi 3. Але в цьому є свої переваги — вона дешевша та зручніша для використання у серверах без датацентрових масштабів.

Хоча все пізнається в порівнянні. По-перше, дешевша — це все ще близько 1,7 мільйона гривень. По-друге, зручніша для серверів — це все ще 600–700 Вт енергоспоживання та потреба у відповідній системі охолодження. І, по-третє, перевірене рішення — це все ще не означає «поставив і поїхали».

Це чудово показує наш кейс, де проблема була не в самій H200. Карта була робоча. Проблема була в тому, що сервер не давав активувати режими CC та TDX. А без них клієнт не міг використати карту так, як планував для свого AI-сценарію.

Чому NVIDIA H200 без CC та TDX — просто дуже дорога цегла?

Купити NVIDIA H200 може бути нелегко — великий бізнес вичищає склади AI-прискорювачів і бронює виробництво на роки вперед. Але пошук і замовлення — лише перший рівень складності, після якого починається справжній челендж для технарів і бізнесу.

Проблема полягає в тому, що без відповідних налаштувань відеокарта за ціною 3-кімнатної квартири в Шепетівці — просто цеглина, яка приносить однакову користь у серверному корпусі чи у стіні будинку. У нашому кейсі ключовими були два режими: CC та TDX. Без них клієнт не міг запустити H200 саме в тому сценарії, для якого її купував.

Cocoon (CC) — це Confidential Computing на рівні GPU, тобто режим захищених обчислень. Він потрібен, щоб модель, дані, проміжні результати та сам процес обробки лишалися конфіденційними навіть під час роботи. Для AI це критично. Великі моделі часто працюють із приватними датасетами, комерційною інформацією, медичними даними, фінансовими даними, військовими сценаріями або внутрішніми корпоративними знаннями. У таких задачах мало зашифрувати файл на диску чи передати його через захищений канал. Дані треба захищати ще й тоді, коли вони вже обробляються GPU.

Confidential Computing: захист даних at rest, in transit, in use

Без активного CC сервер не може гарантувати потрібний рівень захисту для AI. Тобто H200 може бути справною, драйвер може бачити карту, система може навіть запускати частину тестів. Але потрібний захищений сценарій не стартує або не проходить перевірку довіри.

TDX — це Intel Trust Domain Extensions. Це технологія, яка створює ізольоване середовище для віртуальної машини. Умовно кажучи, вона відділяє захищену VM від решти сервера: гіпервізора, хостової системи, адміністратора платформи та інших процесів, які не повинні мати доступу до її даних.

Trust Compute Boundary (Intel TDX)

Для звичайного користувача це звучить як щось із параноїдального кіберпанку. Для AI-інфраструктури — це нормальна вимога. Якщо модель навчається або запускається в захищеній віртуальній машині, платформа має довести, що середовище справді ізольоване, а дані не можуть бути прочитані ззовні.

CC і TDX працюють у парі. TDX захищає середовище, у якому запускається задача. CC захищає роботу GPU з даними всередині цього середовища. Якщо один режим не активується, весь ланцюг довіри ламається.

Саме тому проблема клієнта була настільки критичною. Сервер бачив дорогу карту, але не давав увімкнути режими, без яких її не можна було використовувати за призначенням. Для простенького рендера це було б неприємно. Для конфіденційного AI — епічний фейл.

У таких задачах недостатньо мати сильний GPU. Потрібно, щоб процесор підтримував потрібні інструкції, материнська плата коректно працювала з цими режимами, BIOS/UEFI мав правильні налаштування, прошивки не конфліктували між собою, а ОС, драйвери NVIDIA, CUDA та середовище віртуалізації складалися в одну робочу систему. У цьому узгодженні полягає відмінність між набором дорогих компонентів і працюючим AI-сервером.

Тому клієнт півроку не міг самостійно довести сервер до робочого стану. І саме тому задача перейшла до спеціалістів CompX, які розбираються не тільки в комплектуючих, а й у серверній логіці, режимах безпеки та реальному запуску AI-заліза.

Що ми зробили: коротко про порятунок NVIDIA H200

Якби мова йшла про відеокарту рівня RTX 5080 чи хоча б RTX PRO 5000, рішення обмежувалося б перевстановленням драйвера й перезавантаженням комп’ютера. Але H200 — звір іншої породи. Тут потрібно було розібратися, чому платформа бачить GPU, але не дає активувати критичні режими CC та TDX для захищеного AI-сценарію.

Ми почали з діагностики серверної платформи: перевірили підтримку TDX на рівні процесора, BIOS/UEFI, ядра Linux і модуля kvm_intel. Після правильного налаштування система підтвердила активацію TDX: у логах з’явилися TDX module initialized, виділена пам’ять під PAMT і приватний діапазон KeyID.

Термінал: перевірка TDX у dmesg

Після цього наші спеціалісти взялися за GPU-частину. Для перевірки та керування Confidential Computing ми використовували офіційний інструмент NVIDIA GPU Admin Tools. І це теж показовий момент. Усі команди зібрані в пакет і розміщені на гітхабі, але дуже важливо розуміти, як саме їх застосовувати. Через інструменти адміна ми увімкнули CC mode для NVIDIA H200 і підтвердили, що режим активний.

Термінал: NVIDIA GPU Admin Tools

Окремо перевірили, як карта визначається системою після налаштувань. nvidia-smi показав NVIDIA H200 NVL, драйвер 595.71.05, CUDA 13.2, доступний обсяг пам’яті 143 771 MiB і power cap 600 Вт. Тобто сервер вже коректно визначив її як датацентровий GPU з потрібними параметрами.

Термінал: nvidia-smi, H200

І як вишенька на торті — фінальна перевірка підтвердила роботу відеокарти у режимі CC.

Термінал: CC mode is on

Уся робота зайняла не пів року експериментів, а два дні діагностики й налаштування. Так експертиза вирішила долю всього проєкту. І якби історія починалася з неї, сьогодні проєкт вже б не просто запускався, а переходив зі стадії MVP до зрілого продукту.

Отже, ви вирішили запустити AI

Збірка потужного сервера буде для вас лише першим кроком — і навіть не найскладнішим, як показує наш кейс. Відеокарта у ньому може бути справною та готовою до роботи, але без правильних налаштувань вона залишиться мертвим вантажем, що лежатиме на балансі вашого бізнесу.

Як завжди, ключова деталь успіху — люди, які розуміють, що вони роблять та як розв’язувати проблеми. Саме тому топові AI-компанії витрачають мільярди доларів на рекрутинг технарів, програмістів, художників і навіть філософів. Без людини, яка правильно навчить LLM і поставить їй правильну задачу, штучний інтелект є дорогою іграшкою, яка споживає гігавати електрики.

Тому якщо ви плануєте збирати систему під навчання моделей, RAG, інференс, комп’ютерний зір, аналітику даних або датацентрову інфраструктуру, краще одразу заходити в проєкт з правильною технічною командою. У CompX ви можете замовити AI-сервер чи робочу станцію під ключ. Ми підберемо комплектуючі під ваші конкретні задачі, складемо та протестуємо машину, а також допоможемо із налаштуванням та запуском. Наші спеціалісти готові взяти на себе й постпродажне обслуговування — від чищення й локального ремонту до комплексного апгрейду.