ПозитивнаImpact 5/10🔬 Research🏢 Від 50 людей🏭 Виробництво і Промисловість📺 Медіа і Контент

K2-Horizon-MoVA-36B-A4B: Відкрита MoE-модель з архітектурою Mixture-of-Values

Нейронавт | Нейросети в творчестве16 днів тому5 переглядів

Представлена відкрита MoE-модель K2-Horizon-MoVA-36B-A4B з новою архітектурою уваги Mixture-of-Values. Активується лише 4B з 36B параметрів на токен, забезпечуючи високу ефективність та 512K контексту.

ВердиктПозитивнаImpact 5/10

🔬 Цікаво для дослідження, але не продукт. Архитектурна новина без готового API, ваг або інтеграції — для компаній до 200 людей тут нема дії: треба чекати на обгортки або спільноти.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Модель K2-Horizon-MoVA-36B-A4B має 36B параметрів, але активує лише 4B на токен завдяки архітектурі MoVA
  • Контекст 512K токенів дозволяє обробляти довгі документи та ланцюжки агентних викликів
  • Висока ефективність у кодінгу, розумінні та агентних задачах (Terminal-Bench, GPQA Diamond, SciCode)
  • Ліцензія Apache 2.0 — дозволяє вільне використання та модифікацію
  • Доступна варіант 375B/23B для ще більших можливостей

Як це змінить ваш ринок?

Архітектура MoVA може стати фундаментом для нового покоління ефективних MoE-моделей, що зменшать витрати на інференс без втрати якості. Це особливо цінно для виробництва, де локальна обробка даних зменшує залежність від хмари та підвищує конфіденційність.


Визначення:

Mixture-of-Values (MoVA) — архітектурний прием, при якому замість одного значення на голову уваги використовується суміш декількох значень, збільшуючи виразність моделі при однакових обчислювальних витратах.


Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.

Поки нема публічних ваг або API — не придатно для безпосереднього впровадження. Потребує дослідження та інтеграції спільнотою. Для експериментів: доступ до GPU 24GB+ для тестування подібних MoE-моделей, час 1-2 тижні на адаптацію архітектури.


Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
K2-Horizon-MoVA-36B-A4Bдані не розкритіЛокально / хмараGPU 24GB+, навички ML-інженеріїMoVA-архітектура, 4B активних на токен
Mixtral 8x7BбезкоштовноЛокально / хмараGPU 24GB+Стандартна MoE, 12B активних на токен
DeepSeek-MoE 16BбезкоштовноЛокально / хмараGPU 16GB+Оптимізована для низької активності, але менший контекст

🔒 Підтекст (Insider)

Це фундаментальний крок у ефективності MoE: зменшення активних параметрів без втрати якості може змінити економіку локального ШІ. Але поки нема ваг у публічному доступі — це чорнетка, а не інструмент.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
MoEMixture-of-ValuesMoVA36Bparameters4Bactive512KcontextApache2.0agentictaskscodingreasoning

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live