Коротка відповідь: центр обробки даних зі штучним інтелектом — це з високою щільністю, де живлення, охолодження, тканина та сховище зосереджені на навчанні та обслуговуванні моделей, а не серверна кімната з додатковими графічними процесорами. Чіпи отримують популярність; будівля вирішує , чи вони працюють. Якщо зображення не можуть бути передані, модернізуйте невелику комірку; більшості команд слід орендувати приміщення.
Ключові висновки:
Чіпи проти збірки: живлення, охолодження, тканина та сховище визначають, чи працюватимуть прискорювачі.
Місця, а не палаци: модернізуйте дві стійки, коли дані не можуть бути вивезені; не купуйте кампус.
Середнє значення проти медіани: після восьми прогонів медіана починається з початку; використовуйте 18-годинне середнє значення.
Захист від неправильного використання: Не вказуйте PUE для двох стійок у змішаному залі.
Ілюстративні результати: вісім прогонів – це невелика карта, а не 50% економії виробництва.

Статті, які вам, можливо, буде цікаво прочитати після цієї:
🔗 Чи надійний ШІ? Відео та вікторина
Дізнайтеся про надійність ШІ за допомогою захопливого відео та інтерактивної вікторини.
🔗 Як використовувати ШІ у повсякденному житті.
Відкрийте для себе практичні способи, як ШІ може спростити повсякденні завдання та розпорядок дня.
🔗 Як використовувати ШІ на роботі.
Дізнайтеся практичні способи використання ШІ для розумнішої продуктивності на робочому місці.
🔗 Чи може штучний інтелект мислити самостійно?
Зрозумійте, чи може штучний інтелект справді мислити самостійно чи міркувати.
Чим він відрізняється від «звичайного» центру обробки даних
Традиційні зали оптимізовані для змішаних робочих навантажень та часу безвідмовної роботи багатьох дрібних сервісів. Звичайно, вас цікавить резервування, а також концепція PUE – додаткова енергія, яку будівля спалює для забезпечення одного вата обчислювальної потужності. Зазвичай ви не проектуєте кожен коридор навколо стійки, яка поводиться як портативна обігрівальна ферма.
Сайти зі штучним інтелектом змінюють пропорції. Щільність зростає. Мережа стає тканиною, без якої навчальна робота не може функціонувати. Сховище має підтримувати рух контрольних точок, або прискорювачі простоюють без діла, як скакові коні в заторі.
Існує також культурна різниця. Корпоративні операції мислять заявками та вікнами змін. Операції зі штучним інтелектом думають про черги завдань та неприємне відчуття, коли вузол вимикається наприкінці довгострокової перспективи. Гадаю, ви все ще можете називати обидва "центрами обробки даних", бо вони ними є. Назва просто приховує сантехніку.
| Тип | Для чого його побудували | Видатне обладнання | Характеристики живлення / охолодження | Кому це підходить | Чому воно існує |
|---|---|---|---|---|---|
| Традиційний центр обробки даних підприємства | Змішані ІТ: бази даних, віртуальні машини, електронна пошта, файли | Процесори, звичайні сервери, звичні сховища | Повітряний; помірна щільність; PUE як тема для обговорення | Компанії, що використовують повсякденні системи | Підтримуйте роботу бізнес-додатків |
| Кластер навчання ШІ | Тривалі, тісно пов'язані навчальні завдання | Щільні стійки прискорювачів; з'єднання графічних процесорів | Висока щільність; рідинне охолодження або [теплообмінники на задніх дверцятах] (https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) | Лабораторії та розробники моделей живуть у чергах на роботу | Завершіть пробіг, не вичерпавши чіпси |
| Засіб штучного виведення | Обслуговування моделей; відповіді в режимі реального часу та пакетні відповіді | Прискорювачі; балансувальники навантаження, які мають значення | Все ще гаряче, просто... менше театральності; затримка перевищує грубу щільність | Продукти, які мають відповісти зараз | Розмістіть модель поруч із користувачем |
| Гібридний зал зі штучним інтелектом | Навчання та служба під одним дахом; ну, так би мовити | Змішані стійки; огороджені басейни; спільна тканина | Дві круті особистості в одній кімнаті для рослин; стає незручно | Команди, які не можуть дозволити собі два кампуси | Капітал скінченний; життя безладне |
Не моральний рейтинг. Різні машини, одне й те саме прізвище.
Графічні процесори, прискорювачі та стійка, яка споживає енергію
Пройдіться традиційною фальшпідлогою, і стелажі виглядатимуть майже чемно. Пройдіться рядом зі штучним інтелектом, і вони виглядатимуть так, ніби хочуть проковтнути будівлю.
Видатним обладнанням є не розумний процесор. Це лоток прискорювача: графічні процесори або інші чіпи штучного інтелекту, упаковані в сервери, потім стійки, потім ряди, що мають спільну високошвидкісну структуру. Графічні процесори з'єднують чіпи в щось, що може претендувати на роль одного гігантського прискорювача; кластерна структура виконує той самий трюк у масштабі рядків. Паралельне навчання працює лише за умови, що ці зв'язки залишаються товстими та передбачуваними. Втратьте це, і ваш «кластер» перетвориться на купу дорогих робочих станцій, що мають спільний поштовий індекс.
Потужність іде за чіпами. Не громіздкий офісний БРЖ. Мегавати ІТ-навантаження, як тільки зал заповнюється — я не вигадуватиму цифру. Щільність на стійку — ось головний поворот сюжету. Менше стійок. Кожна з них — це невелика піч. Обмежувальним фактором часто є підстанція, а не список бажаних графічних процесорів. Ви знаєте, як це буває: відділ закупівель хоче більше прискорювачів; комунальне підприємство хоче довгої розмови та дуже великого чека.
Одна трохи безглузда метафора, від якої я не можу позбутися: диба — це голодна тварина. Можна вивести швидшу. Її все одно доведеться годувати і все одно вбирати спеку. Пропустиш будь-яку з цих двох, і вона стане дуже дорогим прес-пап'є.
Проблема живлення, тепла та охолодження
Електрика входить. Тепло виходить. У цьому вся релігія.
Стійки високої щільності скидають тепло таким чином, як повітря ніколи не мало потреби. Ви можете подавати повітря сильніше — теплообмінники на задніх дверцятах, гарячіші проходи, розумна ізоляція — і це працює до певної міри. Потім з'являється рідина:
-
Петлі охолоджувальної рідини, які роблять приміщення для машин схожим на хімічний завод
-
Занурення в кілька дизайнів, що досі вражає людей, які вважають, що вода та сервери не повинні ділити речення
Нічого з цього немає в гламурі. Все це залежить від продукту, бо акселератор, який регулює обороти двигуна, — це той, за який ви вже заплатили, і який не можете повноцінно використовувати.
PUE все ще має значення. Це співвідношення, а не індивідуальність. Оператори женуться за ним, бо кожен ват, витрачений на вентилятори та насоси, – це ват, який не пішов на графічний процесор. Я не наводитиму «типову» цифру; клімат і те, як ви проводите межі, впливають на неї, а фальшива точність гірша, ніж її відсутність. Вода також присутня в історії. Деякі рослини ковтають. Деякі ковтають. Випарне охолодження ефективне, доки річка або посуха не зроблять його політичним.
Нетворкінг: чому тканина важлива так само, як і чіпи
Люди фотографують графічні процесори. Вони повинні фотографувати комутатори.
Навчання – це розмова. Тисячі акселераторів обмінюються градієнтами, параметрами, фрагментами моделі в тісній синхронізації. Якщо тканина тремтить, вся робота чекає на найповільнішому стрибку. Ось чому зали штучного інтелекту одержимі високошвидкісними мережами, низькою затримкою та топологіями, які не складаються навпіл, коли з'єднання виходить з ладу. Тканини типу InfiniBand, Ethernet у тій самій ролі, з'єднання GPU всередині коробки, кабелі, які мають бути правильними з першого разу.
Висновок – це зовсім інша розмова. Обслуговування моделі зосереджене на затримці хвоста – повільній відповіді, а не середній. Пакетна робота проти роботи в режимі реального часу розділяє особистості. Навчальний кластер хоче повноцінного, колективного руху «всі до всіх». Обслуговуючий флот хоче багато менших запитів та ізоляції, без заторів на балансувальнику навантаження.
Промах, поки я тут: люди ставляться до мережі як до сантехніки, а до чіпів як до ресторану. У цій будівлі сантехніка — це ресторан. Промахнешся, і купиш кухню, яка не може приймати доставку.
Навчання проти логічного висновку: дві будівлі, іноді буквально
Навчання – це кампанія. Ви збираєте кластер, передаєте йому дані, релігійно встановлюєте контрольні точки, запускаєте його годинами або тижнями та молитеся, щоб інфраструктура залишалася без подій. Пакетно-навантажена, вимоглива до пропускної здатності, тихо терпляча – доки не виникне збійний вузол, який порушить роботу. Один непрацюючий акселератор у тісно пов'язаному завданні може зупинити весь хор.
Висновок – це вітрина магазину. Моделі вже навчені, тепер відповідають на запитання, класифікують зображення, генерують текст. Затримка має значення. Трохи старіший акселератор поруч із замовником може перевершити гламурний на іншому континенті.
Отже, ви отримуєте розкол. Навчальні кампуси женуться за владою, землею та щільністю. Місця логічного висновку женуться за затримкою та присутністю. Гібридні зали також існують, бо капітал не безкінечний. Ну, не завжди дві будівлі. Іноді одна зала з оксамитовим канатом та двома охолоджувальними петлями.
Саме тут також розгалужуються колокація, гіпермасштабовані кампуси та локальні розгалуження. Гіпермасштабовані кампуси створюють такі масштаби, що решта з нас виглядає так, ніби ми розставляємо меблі. Колокації продають щільність за стелажами. Локальні розгалуження все ще існують, коли дані не можуть бути передані.
Пропускна здатність сховища, контрольні точки та ненажерливі чіпи
Ніхто не розміщує паралельну файлову систему на обкладинці брошури.
Дані для навчання мають надходити достатньо швидко, щоб графічні процесори не тупали ногами. Контрольні точки мають бути встановлені, щоб збій не втратив тиждень. Ваги моделі мають бути завантажені до того, як обслуговувана репліка буде запущена. Пропускна здатність сховища, а не лише ємність, є тихим вузьким місцем. Ви можете витратити цілий статок на прискорювачі та «заморочити» їх за допомогою ввічливого масиву, розробленого для віртуальних машин.
Шаблон знайомий: блискучий кластер, черга завдань і очікування вводу-виводу, що дивляться назад, як грубий рахунок-фактура. Кластеризація обчислень без кластеризації шляху передачі даних – це спосіб отримати дуже дорогий простой. Підтримуйте роботу чіпів або визнайте, що купили скульптуру.
Програмне забезпечення, оркестрація та негламурний операційний рівень
Апаратне забезпечення — це знаменитість. Планувальники виконують роботу.
Центр обробки даних зі штучним інтелектом марний, якщо завдання не можуть знайти графічні процесори, якщо дві команди не можуть розділити кластер без бійки, якщо невдалий ранг неможливо замінити, якщо прошивка дрейфує, аж поки інфраструктура не вийде з ладу в уповільненій зйомці. Оркестрація, спостережуваність, обмеження потужності — негламурний операційний рівень, саме завдяки якому ви знаєте, що він важливий.
У мене слабкість до цього рівня. Також, коли неправильно налаштований мережевий адаптер уособлює проблему охолодження протягом цілого дня... ви переконуєтесь у цьому на власному гіркому досвіді.
Коли вузол помирає під час виконання
Вузол помирає. Вікна змін все ще конфліктують із навчальними запусками, яким байдуже до вашого календаря. Ви групово плануєте великі завдання, відгороджуєте пули виводів, пишете книги виконання для збоїв, які виглядають як «завдання повільне», доки не виглядають як «завдання мертве». Надмірність все ще має значення – живлення, охолодження, шляхи, сховище – але режим збоїв менш акуратний, ніж старий слайд «дев'яти хвилин безвідмовної роботи». Висновок: репліка, знеструмлення хворого вузла, продовжуйте відповідати. Навчання потребує контрольних точок, а не оптимізму.
Розташування, вода, електромережа та сусіди
Ви не кидаєте один з них поруч з котеджем заради краєвиду.
Підключення до мережі часто є вирішальним фактором вибору місця. Земля – це просте рішення порівняно з підстанцією та комунальним підприємством, у якого є інші клієнти. Вода для охолодження, якщо ви її використовуєте, стає проблемою для сусідів, щойно кількість опадів стає надмірною. Шум. Візуальний об'єм. Тепло біля огорожі. Комітети з планування дізнаються думки про «хмару» саме тоді, коли їй потрібні поле та річка.
Затримка тягне в інший бік. Висновок любить бути поруч із користувачами та з'єднаннями. Навчання може ховатися на дешевших ринках електроенергії та в холоднішому кліматі. Галузь говорить так, ніби існує одне ідеальне місце. Його не існує. Існує компроміс із прес-релізом.
Залишкове тепло та непрохана піч
Брошурам подобається ця частина. Направляти відпрацьоване тепло в будинки, басейни, теплиці; це чудове речення. Іноді районний цикл справжній. Іноді кампус розташований не в тому місці, і тепло все одно потрапляє в повітря. Я скептично ставлюся до версії брошури; я не скептично ставлюся до фізики.
Кому це потрібно (і кому варто орендувати)
Більшості людей не потрібно володіти одним із цих залів.
Прямий список:
-
Гіперскейлери, оскільки продуктом є флот
-
Лабораторії, коли вузьким місцем є час очікування в черзі або дані не можуть бути виведені
-
Банк, лікарняна група, уряд або виробник із секретним набором даних – локально або в приватній колокейджній системі – може бути раціональним рішенням, навіть якщо це невдача
Усім іншим варто орендувати приміщення. Колокейшн з щільністю, готовою до використання штучного інтелекту. Хмарне резервування. Керований кластер. Ви отримуєте прискорювачі, не стаючи при цьому оператором електростанції. Романтика зникає, як тільки хтось вперше запитує, хто чергує в контурі охолодження о 3-й ночі.
Зізнаюся, є певна гордість. Володіння кластером відчувається як володіння засобами прогнозування. Потім приходить рахунок за електроенергію, і гордість зникає.
Для чого призначена будівля
Отже, що таке центр обробки даних зі штучним інтелектом? Спеціалізований кампус високої щільності, де прискорювачі, живлення, охолодження, тканина та сховище даних організовані навколо моделей навчання та обслуговування – це не універсальні ІТ-системи з графічним процесором у кутку. Він виглядає як склад. Він поводиться як електростанція, яка виконує математичні обчислення.
Якщо ви нічого більше не пам'ятаєте: чіпи отримують славу; підстанція, теплоносій і мережа вирішують, чи були ці чіпи гарною ідеєю. Навчання та логічний висновок можуть мати спільний дах; вони все одно хочуть різних манер. Більшість організацій повинні орендувати. Дехто має будувати. Сусіди помітять це в будь-якому разі.
Хмара завжди мала будівлю. Тепер щодо будівлі існують різні думки.
Приклад з реального світу: Двостійкова навчальна камера, коли зображення не можуть виходити
Сценарій
Томос очолює інфраструктуру Kestrel Precision, виробника з 400 співробітниками у Вест-Мідлендсі. У них вже є невеликий локальний зал: ERP, спільні файли, віртуальні машини, змішаний район, з якого почалася ця стаття. Повітряне охолодження. Звичайний Ethernet. SAN, яка ідеально підходить для офісних дисків.
Команда машинного зору повинна навчити модель інспекції на заводських знімках. Знімки не можуть залишатися за межами об'єкта. Вони показують процес, який компанія не розмістить на хмарному диску, навіть приватному. Рішення відділу закупівель полягає в чотирьох серверах з двома прискорювачами та слайді під назвою «наш центр обробки даних зі штучним інтелектом». Сервери розміщуються у двох існуючих стійках, оскільки є місце, а простір здавався обмеженням.
Це не так. Протягом двох тижнів графічні процесори починають здаватися зайнятими, а потім тихо гальмують. Робота переривається, коли контрольна точка досягає мережі зберігання даних. Вузол вимикається об одинадцятій годині, і робота просто... зникає. Томос не забував купувати чіпи. Він купив купу дорогих робочих станцій із спільним поштовим індексом. Будівля все ще була корпоративним залом.
Їм не потрібен кампус, нова підстанція чи річка. Їм потрібна невелика комірка, яка поводиться як центр обробки даних штучного інтелекту в мініатюрі: живлення, яке стійки можуть реально витримувати, тепло, яке виходить, не нагріваючи чіпи, тканина, яку може використовувати навчальне завдання, сховище, яке може приймати контрольну точку, та робочий аркуш на випадок, якщо вузол вийде з ладу. Оскільки зображення не можуть виходити, оренда коло-клітки за сорок хвилин — це не рішення. Модернізація двох стійок — це рішення.
Що потрібно клітині
-
Виміряний бюджет живлення в цьому рядку, з PDU, а не зі списку бажань щодо GPU. Якщо резервна потужність не може забезпечити чотири сервери під навчальним навантаженням, розмова на цьому зупиняється, і вони розглядають щільніший колорит, а не диво
-
Охолодження повітря ніколи не мало виконуватися при такій щільності: замість цього використовувалися теплообмінники на задніх дверях, якщо зал їх може витримати, або невеликий рідинний контур, якщо це можливо. Якщо ні те, ні інше, сервери не встановлювалися
-
Виділена високошвидкісна мережа між чотирма вузлами, а не офісний Ethernet. Якщо постачальник має в каталозі лише 10-гігабітний комутатор, це не кластер
-
Локальне швидке сховище для контрольних точок та навчальних шардів, а не мережа зберігання даних віртуальної машини (VM SAN)
-
Планувальник, інтервал контрольних точок та письмовий шлях перезапуску. Апаратне забезпечення — це знаменитість. Цей рівень — це завдання
-
Обгороджена коробка висновків для заводської лінії, відокремлена від навчального чату, оскільки обслуговування потребує хвостової затримки та ізоляції, а не колективного
-
Дозвіл на ведення обліку живлення, годинників графічного процесора, подій дросельної заслінки та настінного годинника завдань. Якщо вони не зможуть їх перевірити, вони сфотографують графічні процесори та пропустять перемикачі
Приклад інструкції
Томос викладає це у брифі об'єктів, простою мовою:
Не називайте це кампусом штучного інтелекту. Побудуйте двостійкову навчальну камеру в існуючому залі для чотирьох серверів з двома прискорювачами. Заводські образи залишаються на місці. Успіх полягає в тому, що чотири вузли виконують 12-епохальний рецепт інспекції та навчання без теплового дроселювання, пишуть контрольну точку за лічені хвилини, а не за десятки хвилин, і відновлюють роботу з цієї контрольної точки, коли ми навмисно знищуємо ранг. Охолодження має підтримувати графічні процесори на їхніх навчальних частотах. Мережа має бути спільною тканиною цих чотирьох блоків, а не шляхом через офісний стек. Сховища повинні живити чіпи. Якщо теплообмінники на задніх дверях не підходять, скажіть про це і зупиніться. Не вказуйте PUE для двох стійок у змішаному залі. Це число було б театром.
Потім він вставляє це в саму навчальну роботу:
Контрольна точка кожні 30 хвилин до місцевого швидкого пулу. Якщо ранг гине, почніть з останньої повної контрольної точки. Не чекайте на SAN. Не продовжуйте тренування, поки годинники закінчуються після розпалу. Запишіть це та зупиніться, щоб ми могли побачити стійло.
Гарна година виглядає так: всі вісім графічних процесорів працюють на тренувальних частотах, файл контрольної точки встановлено, завдання все ще працює в синхроні. Погана година виглядає так: вентилятори працюють на повній потужності, частота знижена, контрольна точка позначена на 2% через десять хвилин, і хтось в офісі каже: «кластер запущено». Запущено — це не навчання.
Як це перевірити
Вони пишуть тест перед модернізацією, і в цьому вся суть недовіри до демоверсії.
-
Той самий рецепт 12 епох, ті самі 120 000 знімків з перевірки, вісім прогонів
-
Час вимірюється настінним годинником до завершення рецепту, включаючи будь-який перезапуск, від моменту надсилання завдання до останньої контрольної точки епохи 12
-
Пропуск перегріву: частота графічного процесора залишається на цільовому рівні навчання протягом запуску. Подія throttle вважається невдалою, навіть якщо завдання врешті-решт завершиться
-
Пропуск на сховище: час запису в контрольній точці, медіана та найгірший, з журналу завдань
-
Пропуск тканини: робота не чекає колективно, поки ранг здоровий. Якщо вони не бачать цього очікування, інструментарій не завершено
-
Два з восьми пробігів навмисно вбивають ранг на фіксованому кроці, щоб перевірити шлях до перезапуску
-
Висновок – це окремий тест із 200 зображень, починаючи від заводської лінії та закінчуючи огородженою сервірувальною коробкою. Успіх у навчанні не враховується як успішна подача
-
Вони записують потужність стійки від PDU за 15-хвилинні вибірки, тому нікому не доводиться винаходити мегават
Прийняття рішення про визначення комірки як "готової до роботи зі штучним інтелектом": 8 з 8 рецептів завершено; 0 з 8 показує теплове обмеження; обидва зупинені запуску відновлюються; контрольні точки залишаються за лічені хвилини. Якщо вони пропустять це, у них все ще є серверна кімната з модними відеокартами.
Результат
Ілюстративний результат вигаданого восьмиразового тесту, а не опублікованого рисунка Kestrel.
Припущення: чотири сервери з двома прискорювачами у двох стійках; одна модель інспекції; 120 000 знімків на колесах; вісім запуску фіксованого 12-епохального рецепту; настінний годинник включає перезапуски до завершення рецепту; дросель означає зареєстроване зниження навчального годинника; час контрольної точки – це запис, а не побажання; живлення стійки – це зразки PDU, а не кампусне PUE.
До модернізації, графічні процесори у звичайних стійках з повітряним охолодженням на офісному Ethernet та VM SAN:
-
5 з 8 пробіжок завершилися з першої спроби. Медіанний настінний час серед цих п'яти: 14 годин
-
3 з 8 довелося запускати знову після зупинки приблизно о 11 годині (два після того, як вузол помер через застарілу контрольну точку, один після того, як контрольна точка заповнила SAN). Негайне повторення спроби, жодного нічного очікування в годиннику: 11 годин втрачено плюс 14 годин другої спроби, або 25 годин до завершення рецепту на цих трьох
-
Середній час до завершення рецепту для всіх восьми, включаючи перезапуски: 18 годин. (П'ять – за 14 годин, три – за 25. Медіана для всіх восьми все ще становить 14 годин, що приховує перезапуски. Ось чому середнє значення є тут базовим.)
-
Тепловий дросель зареєстровано у 7 з 8 запуску. Медіанний час на зниженому тактовому режимі: 3 години за 14-годинну спробу
-
Запис на контрольній точці: медіана 22 хвилини
-
Випробування на вбивство рангу було не тим випробуванням, яке вони могли б пройти. У них не було правил гри. Дві випадкові смерті стали знахідкою
-
Пікове навантаження ІТ на дві стійки під час навчання: близько 18 кВт. Ряд мав достатньо потужності. У нього не було охолодження чи тканини
Після встановлення теплообмінників на задніх дверцятах цих двох стійок, виділеної мережі між чотирма вузлами, невеликого пулу NVMe для контрольних точок, 30-хвилинної контрольної точки та набору завдань для перезапуску:
-
8 з 8 фінішували з першої спроби. Медіанний показник настінного годинника: 9 годин
-
Термічний дросель: 0 з 8
-
Контрольна точка написання: медіана 90 секунд. Найгірший результат у наборі: 3 хвилини
-
Два навмисні рангові вбивства відновилися з останньої 30-хвилинної контрольної точки. Додатковий настінний годинник на цих двох забігах: близько 40 хвилин кожен, включаючи діагноз, тож ці два забіги провели близько 9 годин 40 хвилин. Середнє значення за вісім раундів — 9 годин
-
Пікове навантаження ІТ все ще близько 18 кВт. Ті самі мікросхеми. Інша поведінка будівлі
У цій вибірці середній час до завершення рецепту зменшився з 18 годин до 9 годин, або на 9 годин кожен, 72 години за вісім прогонів. Показник «завершено з першого разу» знизився з 5 з 8 до 8 з 8. Показник «Throttle» знизився з 7 з 8 до 0 з 8. Це останнє число вказує на те, чи купили вони прискорювачі, чи прес-пап'є. Вони не називатимуть зміну часу 50% економією виробництва. Вісім прогонів – це невеликий і простий набір.
Ці цифри є прикладом оцінки, заснованим на заявленому тесті, невеликій вибірці, одній моделі та одному змішаному залі. Вони не є показником продуктивності (PUE), не є мегаватом кампусу і не є доказом того, що Kestrel повинна будувати навчальний майданчик у полі. Огляд журналів тривав протягом 9 годин; вони цього не приховували. Цифра 18 кВт – це округлене значення PDU, а не рахунок за комунальні послуги. Вони не конвертували 72 години у вартість, оскільки змішаний тариф на електроенергію заводу створив би фальшиве економічне обґрунтування.
Перевірка подачі була окремою та меншою: 200 лінійних зображень до огородженої коробки, все на місці. Це висновок, а не навчання. Змішування цих двох було б помилкою гібридного залу в мініатюрі.
Що може піти не так
-
Відділ закупівель постійно називає чотири сервери «центром обробки даних штучного інтелекту». За цим ярликом приховується сантехніка, а наступною закупівлею є ще більше графічних процесорів для того ж хворого проходу
-
Теплообмінники на задніх дверях вмикаються, але водяну сторону ніхто не запускає в роботу. Вентилятори все ще кричать. Годинники все ще відбивають сигнал
-
Фабрика даних — це один комутатор без резервного шляху. Одне збійне з’єднання, і «кластер» знову складається з чотирьох робочих станцій
-
Контрольні точки залишаються в SAN, оскільки пул NVMe був "фази два". Фаза два не надходить до наступного непрацюючого вузла
-
Вони вказують PUE для двох стійок у змішаному залі. Клімат, межі та решта рядка ERP роблять це співвідношення костюмним
-
Навчання та обслуговування спільно використовують тканину. Потік контрольно-пропускних пунктів змушує заводську лінію чекати. Затримка хвоста — це продукт, а не щільність
-
Вузол вимикається, і хтось сприймає це як квиток на безвідмовну роботу, а не як перезапуск контрольної точки. Корпоративні операції та операції зі штучним інтелектом обговорюють один одного цілий день
-
Вони могли б орендувати клітку, але зображення не можуть зникнути. Забувши про це обмеження, вони поринають у хмарну розмову, яку їм доведеться розслабити
Практичний висновок
Те, що є центром обробки даних штучного інтелекту в цій формі, — це не склад і не рахунок-фактура для графічного процесора. Це комірка, яка дозволяє прискорювачам завершувати роботу: потужність, яку вони можуть утримувати, тепло, яке виходить, тканина, контрольна точка та хтось, хто відповідає за смерть рангу. Kestrel не потребував кампусу. Їм потрібні були дві стійки, щоб перестати вдавати. Більшості команд варто орендувати таку систему. Дехто, маючи секретний набір даних і зал, який може витримувати тепло, повинен побудувати комірку та відмовитися від ковзання.
Найчастіші запитання
Що таке центр обробки даних зі штучним інтелектом?
Обчислювальний майданчик з високою щільністю, де живлення, охолодження, мережа та сховище зосереджені на паралельному навчанні та обслуговуванні моделей, а не на акуратних рядах серверів загального призначення. Він спроектований таким чином, щоб величезна кількість прискорювачів могла навчати та обслуговувати моделі без «танення», зупинок у мережі та очікування на диску. Звичайний корпоративний зал — це змішаний район. Зал штучного інтелекту — це монокультура, одиницею цінності якої є прискорювач, такий як графічні процесори або чіпи типу TPU. Він виглядає як склад і поводиться як електростанція, яка виконує математичні обчислення.
Чим відрізняється центр обробки даних зі штучним інтелектом від звичайного центру обробки даних?
Традиційні зали обробки даних оптимізовані для змішаних робочих навантажень та часу безвідмовної роботи багатьох дрібних сервісів. Сайти зі штучним інтелектом змінюють пропорції: щільність зростає, мережа стає тканиною, без якої навчальна робота не може обійтися, а сховище даних має забезпечувати рух контрольних точок або простоювати прискорювачі. Корпоративні операції думають про заявки та вікна змін. Операції зі штучним інтелектом думають про черги завдань та неприємне відчуття, коли вузол вимикається наприкінці довгострокової перспективи. Ви все ще можете зателефонувати в обидва центри обробки даних. Цей напис просто приховує сантехніку.
Чому центри обробки даних зі штучним інтелектом споживають так багато енергії?
Видатним обладнанням є не розумний процесор. Це лоток прискорювача: графічні процесори або інші чіпи штучного інтелекту, упаковані в сервери, потім стійки, потім ряди, що мають спільну високошвидкісну структуру. Щільність на стійку — це головний поворот сюжету: менше стійок, кожна з яких — невелика піч. Мегавати ІТ-навантаження з'являються, коли зал заповнюється, хоча вигадувати типову цифру не варто. Обмежувальним фактором часто є підстанція, а не список бажаних графічних процесорів.
Як охолоджуються центри обробки даних зі штучним інтелектом?
Стійки високої щільності відводять тепло так, як ніколи раніше не просили повітря. Ви можете інтенсивніше подавати тепло за допомогою теплообмінників із задніми дверцятами, гарячіших проходів та розумного стримування. Потім з'являється рідина: охолодження безпосередньо до чіпа, контури охолодження та занурення в деяких конструкціях. Прискорювач, який дроселює, - це той, за який ви вже заплатили, і який не можете використовувати повною мірою. PUE все ще має значення, тому що кожен ват, витрачений на вентилятори та насоси, - це ват, який не пішов на графічний процесор. Вода також є важливою: деякі установки ковтають, деякі ковтають.
Чому мережа має таке ж значення, як і графічні процесори?
Навчання – це розмова: тисячі акселераторів обмінюються градієнтами, параметрами та шардами моделі в тісній синхронізації. Якщо тканина тремтить, вся робота чекає на найповільнішому стрибку. Ось чому зали штучного інтелекту одержимі мережами з високою пропускною здатністю, низькою затримкою, тканинами типу InfiniBand або Ethernet в одній ролі, а також топологіями, які не складаються навпіл, коли з'єднання виходить з ладу. Висновок дбає про затримку хвоста, багато менших запитів та ізоляцію. У цій будівлі сантехніка – це ресторан.
Для чого використовується центр обробки даних штучного інтелекту: для навчання чи логічного висновку?
Навчання – це кампанія: зберіть кластер, дайте йому дані, ретельно перевіряйте та запускайте протягом годин або тижнів. Висновок – це вітрина: моделі, які вже навчені, тепер відповідають, з важливою затримкою. Навчальні кампуси женуться за потужністю, землею та щільністю. Місця логічного висновку женуться за затримкою та присутністю. Гібридні зали існують, тому що капітал не безмежний, іноді один зал з двома контурами охолодження. Трохи старіший акселератор поруч із замовником може перевершити гламурний за континент.
Чому важливе значення має сховище даних у центрі обробки даних зі штучним інтелектом?
Дані для навчання мають надходити достатньо швидко, щоб графічні процесори не тупали ногами. Контрольні точки мають бути встановлені, щоб збій не втратив тиждень. Ваги моделі мають завантажуватися до того, як обслуговувана репліка буде запущена. Пропускна здатність сховища, а не лише ємність, є тихим вузьким місцем. Ви можете витратити цілий статок на прискорювачі та «заморочити» їх за допомогою ввічливого масиву, розробленого для віртуальних машин.
Що відбувається, коли вузол вмирає посеред виконання?
Один непрацюючий акселератор у тісно пов'язаному навчальному завданні може зупинити весь хор. Навчанню потрібні контрольні точки, а не оптимізм. Висновок виснажує хворий вузол, змушує репліку відповідати та залишається активною. Вікна змін все ще конфліктують із навчальними запусками, яким байдуже на ваш календар. Резервування все ще важливе для живлення, охолодження, шляхів та сховища, але режим збоїв менш акуратний, ніж старий слайд "дев'ять хвилин безвідмовної роботи".
Який вплив має центр обробки даних зі штучним інтелектом на електромережу, воду та сусідів?
Підключення до мережі часто є вирішальним фактором вибору місця. Земля – це просте рішення порівняно з підстанцією та комунальним підприємством, у якого є інші клієнти. Вода для охолодження, якщо ви її використовуєте, стає проблемою для сусідів, щойно опади стають надмірними, разом із шумом, візуальним об'ємом та теплом біля огорожі. Навчання може ховатися на дешевших ринках електроенергії та в прохолоднішому кліматі. Інференція любить бути поруч із користувачами. Немає одного ідеального місця. Існує компроміс із прес-релізом.
Чи потрібен мені власний центр обробки даних зі штучним інтелектом, чи варто орендувати?
Більшості людей не потрібно володіти одним із цих залів. Гіперскейлери будують, тому що продуктом є флот. Лабораторії будують, коли час очікування є вузьким місцем або дані не можуть бути виведені. Банк, лікарня, уряд чи виробник із секретним набором даних можуть зробити раціональним локальне або приватне колокейдж. Усім іншим варто орендувати: колокейшн, готовий до штучного інтелекту, хмарне резервування або керований кластер. Ви отримуєте прискорювачі, не стаючи оператором електростанції.
Посилання
-
МЕА - www.iea.org
-
LBNL — datacenters.lbl.gov
-
Зелена мережа - www.thegreengrid.org
-
LBNL — datacenters.lbl.gov
-
LBNL — datacenters.lbl.gov
-
Інститут безвідмовної роботи - journal.uptimeinstitute.com
-
NVIDIA — developer.nvidia.com
-
NVIDIA — docs.nvidia.com
-
NVIDIA — docs.nvidia.com
-
NVIDIA — docs.nvidia.com
-
Google Хмара – docs.cloud.google.com