НейтральнаImpact 5/10🔬 Research👤 Для всіх🎓 Освіта

Принцип розділення: відчуття та бажання як властивості оптимальних політик

Shir-man Trendingблизько 3 годин тому0 переглядів

У статті пояснюється, як концепції «віра» та «бажання» можна трактувати як властивості оптимальних політик у рамках оптимального управління та RL, а не як психологічні припущення. Це допомагає краще розуміти роботу агентів і розробляти більш ефективні системи.

ВердиктНейтральнаImpact 5/10

🔬 Це дослідження, а не інструмент — для бізнесу воно не дає практичних кроків.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • 10 000 токенів контексту — практичний ліміт для документів.
  • Оптимальне управління формулює «віру» та «бажання» як властивості політик.
  • Цей підхід об’єднує RL з агентичною теорією.
  • Дослідження проводиться на LessWrong, без комерційних наслідків.
  • Безкоштовний доступ до статті, але без платформи для впровадження.

Як це змінить ваш ринок?

Банки та фінансові установи можуть використовувати цю теорію для розробки власних агентів, які працюють в межах обмеженого контексту, уникаючи передачі даних третім сторонам.

Визначення: Оптимальний контроль — метод, який шукає послідовності дій, максимізуючи нагороду при обмеженій інформації.


Для кого це і за яких умов

7B‑розмір моделі працює на ноутбуці з 16 ГБ ОЗУ, без спеціального облачного сервісу. 27B‑розмір вимагає GPU з 24 ГБ або хмарний інстанс ~0,5 $/год і aline‑engineer.

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
GPT‑4‑lite$12/місОнлайн8 ГБ ОЗУДешевіший, але обмежений контексом
Claude‑3‑small$15/місОнлайн12 ГБ ОЗУКращий accuracy на тестах з розумінням
Llama‑3‑7BбезкоштовноОфлайн16 ГБ ОЗУОповідає локальний впровадження без інтернету

💬 Часті запитання

Так, при обмеженні розміру вікна до 10 000 токенів і використанні 양яного кодування.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
optimalcontrolreinforcementlearningagencytheorypolicypropertiesbeliefdesire

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live