DeepSeek портує DeepGEMM на Huawei Ascend, досягаючи 99,8% використання заліза
DeepSeek виплавив DeepGEMM-Ascend — порт бібліотеки матричних ядер на NPU Huawei Ascend 950. Він підтримує GEMM у FP4, FP8, BF16 та grouped GEMM для MoE,MQA та MegaMoE, при цьому плотний GEMM у BF16 досягає 99,8% теоретичного потоку.
🔬 Технічний прорыв для спеціалістів. Для тих, хто оптимізує інференс MoE-моделей на Ascend — це реальний крок до скорочення витрат на обчислення без втрати точності.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •DeepSeek портував DeepGEMM на Huawei Ascend 950 NPU
- •Підтримує GEMM у FP4, FP8, BF16 та grouped GEMM для MoE
- •BF16 GEMM досягає 431 TFLOPS (99,8% теоретичного пику)
- •Потребно CANN 9.20, torch_npu, Python 3.10+
- •Ліцензія MIT, код доступний на GitHub
Як це змінить ваш ринок?
Компанії, що використовують Huawei Ascend для AI-обчислень, тепер можуть оптимізувати інференс MoE-моделей без втрати продуктивності. Це зменшує залежність від NVIDIA у низькорівневому шарі AI-апаратного забезпечення та відкриває шлях до гетерогенних інфраструктур.
Визначення: GEMM (General Matrix Multiply) — фундаментальна операція лінійної алгебри, що використовується в нейронних мережах для перемноження матриць ваг та активацій.
Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.
- •Для IT-команд у компаніях з 200+ співробітників, що мають доступ до Huawei Ascend 950
- •Потрібна спеціалізована команда з досвідом у CANn та PyTorch NPU
- •Мін. бюджет: доступ до Ascend 950 (хмара або локально) + 1-2 інженера на тиждень
- •Час на впровадження: 3-5 днів для тестування та інтеграції
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| DeepGEMM-Ascend | безкоштовно (MIT) | Huawei Ascend 950 | CANN 9.20, torch_npu, Python 3.10+ | Оптимізовано під Ascend, 99,8% využстання |
| NVIDIA CUTLASS | безкоштовно (BSD) | NVIDIA GPU | CUDA, Python | Uniwersalний, але нижче využстання на Ascend |
| vendor-specific NPU SDK | залежить від вендора | специфічний чіп | вендор-залежні | Оптимізовано під конкретний чіп, закритий код |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Machinelearning — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live