ПозитивнаImpact 6/10🧪 Beta🏛️ Від 200 людей🏭 Виробництво і Промисловість

DeepSeek портує DeepGEMM на Huawei Ascend, досягаючи 99,8% використання заліза

Machinelearning•близько 13 годин тому•1 перегляд•

DeepSeek виплавив DeepGEMM-Ascend — порт бібліотеки матричних ядер на NPU Huawei Ascend 950. Він підтримує GEMM у FP4, FP8, BF16 та grouped GEMM для MoE,MQA та MegaMoE, при цьому плотний GEMM у BF16 досягає 99,8% теоретичного потоку.

ВердиктПозитивнаImpact 6/10

🔬 Технічний прорыв для спеціалістів. Для тих, хто оптимізує інференс MoE-моделей на Ascend — це реальний крок до скорочення витрат на обчислення без втрати точності.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • •DeepSeek портував DeepGEMM на Huawei Ascend 950 NPU
  • •Підтримує GEMM у FP4, FP8, BF16 та grouped GEMM для MoE
  • •BF16 GEMM досягає 431 TFLOPS (99,8% теоретичного пику)
  • •Потребно CANN 9.20, torch_npu, Python 3.10+
  • •Ліцензія MIT, код доступний на GitHub

Як це змінить ваш ринок?

Компанії, що використовують Huawei Ascend для AI-обчислень, тепер можуть оптимізувати інференс MoE-моделей без втрати продуктивності. Це зменшує залежність від NVIDIA у низькорівневому шарі AI-апаратного забезпечення та відкриває шлях до гетерогенних інфраструктур.

Визначення: GEMM (General Matrix Multiply) — фундаментальна операція лінійної алгебри, що використовується в нейронних мережах для перемноження матриць ваг та активацій.

Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.

  • •Для IT-команд у компаніях з 200+ співробітників, що мають доступ до Huawei Ascend 950
  • •Потрібна спеціалізована команда з досвідом у CANn та PyTorch NPU
  • •Мін. бюджет: доступ до Ascend 950 (хмара або локально) + 1-2 інженера на тиждень
  • •Час на впровадження: 3-5 днів для тестування та інтеграції

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
DeepGEMM-Ascendбезкоштовно (MIT)Huawei Ascend 950CANN 9.20, torch_npu, Python 3.10+Оптимізовано під Ascend, 99,8% využстання
NVIDIA CUTLASSбезкоштовно (BSD)NVIDIA GPUCUDA, PythonUniwersalний, але нижче využстання на Ascend
vendor-specific NPU SDKзалежить від вендораспецифічний чіпвендор-залежніОптимізовано під конкретний чіп, закритий код

💬 Часті запитання

Ні, код розповсюджується на умовах ліцензії MIT — дозволяє безкоштовне використання, модифікацію та розповсюдження.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
DeepSeekDeepGEMMHuaweiAscendNPUGEMMMoEBF16FP8FP4CANN

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live