ПозитивнаImpact 5/10🔬 Research👤 Для всіх📺 Медіа і Контент

WeMM-Embedding-9B: універсальна мультимодальна модель векторного представлення

Shir-man Trendingблизько 2 годин тому0 переглядів

Тенцент випустив WeMM-Embedding-9B — мультимодальну модель векторного представлення на базі Qwen3.5, яка обробляє текст, зображення, відео та документи, повертаючи 4096-вимірні L2-нормалізовані ембединги та досягаючи СОТА на бенчмарку MMEB-v2.

ВердиктПозитивнаImpact 5/10

🔬 Цікаво для дослідження, але не продукт. Модель опенсорсна, але ваги не публічні — fine-tune можливий, а повне перенавчання — ні. Для тих, хто експериментує з мультимодальним пошуком.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • WeMM-Embedding-9B — мультимодальна модель векторного представлення на базі Qwen3.5
  • Обробляє текст, зображення, відео та документи, повертаючи 4096-вимірні ембединги
  • Достигає 80,6 балу на бенчмарку MMEB-v2 (СОТА)
  • Ваги моделі не публічні, лише архітектура доступна
  • Розміром 9B параметрів, призначена для дослідження мультимодальних представлень

Як це змінить ваш ринок?

Для медіакомпаній та рекламних агентств доступ до відкритих мультимодальних ембедингів може зменшити залежність від закритих API типу OpenAI або Google. Однак без публічних ваг модель не може бути використана в продакшені без додаткових ресурсів на відтворення ваг або ліцензування.

> Визначення:

Мультимодальна ембедингова модель — нейронна мережа, що перетворює різні типи даних (текст, зображення, аудіо) у спільний векторний простір, де семантично схожі об’єкти розташовані недалеко один від одного.

Для кого це і за яких умов

Для дослідників та ML-інженерів у компаніях з IT-командою, які працюють над мультимодальним пошуком або генеративним AI. Потрібний доступ до GPU для інференсу (оцінково 24GB+ для повного розміру), навички роботи з Hugging Face та PyTorch. Час на впровадження — 1-2 тижні для експериментів, якщо ваги доступні.

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
WeMM-Embedding-9Bдані не розкритіHugging FacePyTorch, GPU 24GB+Мультимодальне, 4096-dim, на Qwen3.5
OpenAI text-embedding-3-large$0.13/1M токенівAPIІнтернет-з’єднанняТекст-only, 3072-dim, закрите
Jina CLIPбезкоштовноHugging FacePyTorch, GPU 16GB+Текст+зображення, 768-dim, опенсорс
Google Vertex AI Multimodal Embeddingsдані не розкритіGoogle CloudGCP-акаунтІнтеграція з Vertex, підтримка Google

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
multimodalembeddingQwen3.5MMEB-v24096-dimensionalTencent

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live