Anastasiia Mudra · 6 жовтня 2026
Навчена подобатися: чому LLM не вміє ставити оцінки
Чому LLM погано оцінює
Найпростіший спосіб отримати оцінку від мовної моделі: дати їй текст і спитати «наскільки це серйозно, від 1 до 10». Відповідь буде швидкою, з поясненням і виглядатиме переконливо. Але дрібниця і справжня проблема отримають від неї майже однакову оцінку, тож відрізнити одне від іншого за цим числом не вийде.
- LLM ставить оцінки у вузькому діапазоні. Дослідники фіксують, що LLM-оцінювачі видають викривлені розподіли оцінок (Stureborg et al., 2024) і стискають шкалу до середини: завищують низькі оцінки й занижують високі. У клінічному оцінюванні це не виправили навіть приклади на всю шкалу в запиті (Zhang et al., 2026).
- Так її було навчено. Після базового навчання LLM проходить донавчання на оцінках людей (Reinforcement Learning from Human Feedback, навчання з підкріпленням на основі відгуків людей): люди порівнюють відповіді, і модель вчиться писати так, як людям більше подобається. А люди частіше схвалюють відповіді, з якими згодні. Так модель звикає підлаштовуватися під співрозмовника й казати те, що він хоче почути (Sharma et al., 2023). Інше дослідження показало, що саме це донавчання під людські очікування (alignment) змушує модель знову й знову обирати одні й ті самі оцінки (Sato et al., 2026).
Для моделі, навченої догоджати, оцінка «1» чи «10» означає різке судження і потенційний конфлікт. Тому вона обирає середину або зсуває все в зону «серйозно, але не катастрофа». У результаті і дрібниця, і щось серйозне отримують приблизно 7, і за такою оцінкою їх уже не розрізнити.
Що таке Jev
У вересні 2026 року TypeSafe AI випустила Jev. Це модель, яка принципово не генерує текст. На вхід вона отримує текст або JSON і заздалегідь задані питання, а повертає типізовані відповіді:
- Noul: ймовірність того, що відповідь «так», від 0 до 1;
- Choice: вибір одного варіанта зі списку з ймовірністю для кожного;
- Score: оцінка за шкалою, яку задаєте ви: кожен рівень описаний словами (наприклад, «1: косметична дрібниця», «10: втрата всіх даних»), і модель обирає, якому опису найкраще відповідає те, що їй дали оцінити.
Але головне, чим Jev відрізняється від LLM, це спосіб навчання. Під час навчання модель отримувала винагороду не за відповіді, які подобаються людям, а за точність: якщо модель каже, що впевнена на 90%, вона й має бути права приблизно в 9 випадках з 10 (Reinforcement Learning for Calibrated Decisions). Вона не пояснює і не переконує: вона повертає число, на яке програма може одразу спиратися.
Звучить як рішення саме тієї проблеми, з якої почалася ця стаття. Це варто було перевірити на реальних задачах.
Дві моделі, одні й ті самі задачі
Для порівняння було обрано робочий продукт, у якому LLM щодня ухвалює багато дрібних рішень: відповідає «так» чи «ні», обирає варіант зі списку, ставить оцінку від 1 до 10.
У ролі LLM тут виступали недорогі, але цілком ефективні моделі, які зазвичай і беруть для таких дрібних рішень, а не найдорожчі на ринку.
Ці задачі було віддано обом моделям одночасно: LLM і Jev отримували однакові дані й відповідали незалежно. Кожен випадок, де їхні відповіді розходилися, було розібрано вручну й визначено, хто правий. Оцінки обох моделей було звірено з однією й тією самою шкалою, де кожен рівень має чіткий опис. Порівняння навмисно проводилося на реальних робочих даних, а не на спеціально підготовленому наборі: так видно, як моделі поводяться в щоденній роботі, а не на зручних прикладах.
Результати
Перша колонка таблиці показує, у скількох випадках обидві моделі дали однакову відповідь. Друга показує, яка з моделей виявилася правою після ручної перевірки там, де їхні відповіді розійшлися.
| Тип задачі | Як часто відповіді збіглися | Хто правий, коли відповіді різні |
|---|---|---|
| Так / ні* | 96% | Jev, у важливіших випадках |
| Вибір зі списку | 72% | Jev у 20%, у решті жодна не краща |
| Оцінка за шкалою 1–10** | 8% | Jev у 73%, у решті жодна не краща |
* Jev на питання «так чи ні» повертає не саму відповідь, а ймовірність того, що відповідь «так», від 0 до 1. Тут відповідь вважалася «так», коли ця ймовірність становила 0.6 або більше.
** Низький збіг тут не означає, що одна з моделей погана: вони просто ставили різні оцінки. Як саме, показує діаграма нижче.
Відповіді «так / ні»: помилки LLM дорожчі
У простих бінарних рішеннях різниці майже немає: 96% відповідей збігаються. Проте розбіжності, які все ж трапляються, різні за природою:
- Там, де права LLM, Jev здебільшого давав ймовірність, близьку до половини, тобто прямо показував, що сумнівається. Частину таких випадків прибрав саме поріг 0.6 замість звичних 0.5.
- Там, де правий Jev, помилки LLM дорожчі: вона пропускала те, що варто було відкинути, і відкидала те, що було важливим.
У LLM такої ймовірності немає: вона відповідає «так» або «ні» однаково впевнено, навіть коли сумнівається.
Вибір зі списку: LLM забагато говорить
LLM на питання «який варіант» відповідає реченням, а з нього ще треба витягти відповідь. Повернути рівно один варіант у потрібному форматі їй складно: частину зусиль вона витрачає на пояснення й оформлення, і навіть правильна відповідь може загубитися в цьому тексті. Іноді вона називає одразу кілька варіантів, і тоді обраним випадково стає не той. Jev обирає зі списку, тож така помилка в нього неможлива в принципі. В інших випадках, коли моделі відповідали по-різному, обидві відповіді були правильними: моделі просто обирали різні, але однаково доречні варіанти.
Оцінка від 1 до 10: половина шкали для LLM не існує
Дані тут реальні, тому оцінки й не мали рівномірно покрити всю шкалу: серед них просто не було катастрофічних випадків, тож крайніх оцінок не поставила жодна з двох моделей. Важливий не сам розподіл, а різниця між моделями на тих самих даних.
LLM не поставила жодної оцінки нижче 5: усе, що вона бачила, здавалося їй «доволі важливим». Середня оцінка 6.8, а майже третина отримала 8. Jev використовує нижню частину шкали й розрізняє випадки: справжня дрібниця отримує 2, саме так, як її описано у шкалі.
Показовий приклад: те, що взагалі не заслуговувало уваги, LLM оцінила як майже критичне, на 8–9 з 10. Jev поставив цьому 4–5.
Практичний наслідок: поріг «відкидати все з оцінкою нижче 4» з Jev працює і відсікає дрібниці. З LLM він не спрацював би жодного разу.
Поки LLM пояснює, Jev уже відповів
| Jev | LLM | |
|---|---|---|
| Медіана часу відповіді | ~0.26 с | ~5 с |
| Найповільніші 5% відповідей | довше за 0.4 с | довше за 29 с |
| Найдовша відповідь | 3.7 с | 74 с |
| Ціна 1000 рішень | $0.054 | $0.49 |
Найбільший розрив в оцінках від 1 до 10: тут Jev дешевший у 35 разів. До кожної оцінки LLM додає розлоге пояснення, і за кожне слово в ньому доводиться платити. Jev повертає лише число.
Без недоліків теж не обійшлося: Jev доступний лише як зовнішній сервіс, і іноді він просто не встигав відповісти. Тоді рішення ухвалювала LLM, тож запасний варіант на такий випадок потрібен обов'язково.
Висновок
- Для оцінок за шкалою LLM погано підходить. Вона навчена подобатися, тож її оцінки стиснуті й нічого не розрізняють. Модель, навчена на точність, справляється помітно краще.
- Для рішень «так/ні» якість однакова, але Jev дає ймовірність, а отже, поріг, який можна налаштувати. І він у рази дешевший та швидший.
- Якщо відповідь означає вибір зі списку, текст зайвий. Чим менше тексту треба розбирати, тим менше способів помилитися.
- LLM лишається там, де потрібен текст: знайти проблему, пояснити її, запропонувати виправлення. Jev не генерує текст і не претендує на це.
Тож усі ці рішення тепер ухвалює Jev, а відповідь «так» він дає лише тоді, коли впевнений щонайменше на 60%.