НейтральнаImpact 2/10🧪 Beta🏢 Від 50 людей

Релиз квантованої моделі Qwen3.6-27B-Architect-Polaris2-Fable-B-F451-NVFP4

Shir-man Trendingблизько 4 годин тому1 перегляд

Автор PassingByPixels виклав на Hugging Face NVFP4-квантовану версію злиття Qwen3.6-27B. Для роботи спекулятивного декодування потрібен тензор mtp.fc.weight, якого немає в основному репозиторії.

ВердиктНейтральнаImpact 2/10

🔬 Нічний експериментальний реліз для ML-інженерів. Без офіційної підтримки, документації та гарантій якості — компаніям до 200 людей тут нічого не змінює, крім як переслати посилання власному AI-розробнику.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Автор: PassingByPixels (анонімний ком'юніті-розробник)
  • Базова модель: Qwen3.6-27B merge (Architect-Polaris2-Fable-B-F451)
  • Квантування: NVFP4 (4-бітне з векторною нормалізацією)
  • Проблема: відсутній mtp.fc.weight для MTP спекулятивного декодування
  • Ліцензія: не вказана (типово Apache 2.0 як у Qwen, але перевірте репо)

Як це змінить ваш ринок?

Для українського IT-ринку — зовсім не змінить. Це нічний експериментальний форк, який цікавий лише ML-інженерам, що тестують NVFP4 на власному залізі. Бізнес-застосування нульове: немає бенчмарків, немає гарантій, немає підтримки.

Визначення: NVFP4 — 4-бітне квантування з Normalized Vector Float Point, яке краще зберігає точність за GPTQ/AWQ, але вимагає підтримки на GPU (H100/Blackwell для повної швидкості).

Для кого це і за яких умов

  • Мінімум заліза: GPU 24 GB VRAM (RTX 3090/4090, A6000) для 27B @ 4 біт + контекст
  • Команда: потрібен ML-інженер, що вміє дебажити відсутні тензори та збирати llama.cpp/vLLM з кастомними ядрами
  • Час на впровадження: 1-3 дні на налаштування інференсу, тестування якості, пошук форків з виправленим MTP
  • Масштаб: лише для компаній з власною ML-командою (50+ людей, окремний AI-бюджет)
  • Без команди ML: не витрачайте час — це не продукт, а сирий чекпоінт

Альтернативи

Qwen2.5-32B-Instruct (офіційний)Llama-3.1-70B-Instruct (офіційний)Qwen2.5-14B-Instruct (офіційний)
ЦінаБезкоштовно (Apache 2.0)Безкоштовно (Llama 3.1 Community)Безкоштовно (Apache 2.0)
Де працює24 GB VRAM (4-біт), хмара48 GB VRAM (4-біт), хмара16 GB VRAM (4-біт), MacBook M-series
Мін. вимогиllama.cpp / vLLM / Ollamallama.cpp / vLLM / Ollamallama.cpp / vLLM / Ollama
Ключова різницяСтабільні ваги, офіційні бенчмарки, довга підтримкаНайкраща відкрита модель для reasoning, великий контекстБаланс якості/розміру, працює на MacBook Pro

💬 Часті запитання

Ні. Офіційна модель має перевірену якість, підтримку в llama.cpp/Ollama/vLLM, документацію. Цей форк — сирий експеримент з відомою поломкою MTP.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
QwenLLMquantizationNVFP4HuggingFaceMTPspeculativedecoding

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live