Linkup-Sparseup-Embed-v1: ефективний sparse-ретривер на базі ModernBERT
Опубліковано новий відкритий sparse-ретривер Linkup-Sparseup-Embed-v1 на базі ModernBERT. Він досягає 56,4 nDCG@10 на BEIR-13 з суб-мілісекундною латентністю.
🔬 Цікаво для спеціалістів. Технічний реліз без готового продукту — для компаній до 200 людей це дослідження, а не інструмент для швидкого впровадження.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Модель Linkup-Sparseup-Embed-v1 заснована на ModernBERT
- •Достигає 56,4 nDCG@10 на BEIR-13
- •Має суб-мілісекундну латентність
- •Ліцензія: Apache 2.0
- •Особливості: logit_shift, vocab folding
Як це змінить ваш ринок?
Для дослідників та ML-команд у кибербезпеці та IT це дає доступ до ефективного sparse-ретривера без ліцензійних обмежень, що може зменшити залежність від комерційних API для пошуку в документації або коді.
Для кого це і за яких умов
Експериментальний рівень: потрібна ML-команда з досвідом у ретривалій та векторних пошуках. Для впровадження потрібен доступ до GPU або CPU з достатньою пам’яттю для ModernBERT-розмірних моделей. Час на інтеграцію — від кількох днів до тижнів залежно від інфраструктури.
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| Linkup-Sparseup-Embed-v1 | Безкоштовно (Apache 2.0) | Власний сервер / ВКЛ | GPU/CPU, ModernBERT-сумісність | Сparse-пошук з logit_shift та vocab folding |
| BM25 (Elasticsearch) | Безкоштовно (з базовим планом) | Elasticsearch кластер | JVM, достатня RAM | Класичний ключовий пошук, менш ефективний на коротких запитах |
| Dense Retriever (e.g. DPR) | Безкоштовно (за моделюю) | Власний сервер / ВКЛ | GPU для інференсу | Dense векторний пошук, вища точність, але вища латентність |
| Commercial API (e.g. Cohere Rerank) | ~$ erkenned/1M токенів | Хмара | Інтернет-з’єднання | Готовий API, підтримка, але вартість та залежність від постачальника |
💬 Часті запитання
🔒 Підтекст (Insider)
Це технічний реліз моделі, а не продукт з API, документацією або підтримкою. Основна вигода — для дослідників, які хочуть експериментувати з sparse-ретриверами без комерційних обмежень.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Shir-man Trending — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live