▶ Запис стріму: RAG для SEO. Що працює насправді? Дивитися →
Новини індустрії

Астрологи оголосили тиждень нових моделей

Олеся Коробка··4 хв читання

Оновлення 6 вересня: OpenAI випустили GPT-6 Astra, доповнили розділ про неї нижче.

За тиждень вийшла ціла пачка нових моделей: Anthropic випустили Fable 5.1 і Mythos 5.1, Google викотили Gemini 3.8 Flash і окрему 3.8 Flash Cyber для кібербезпеки, а китайські Z.ai та Alibaba відкрили ваги GLM-5.3-Flash і Qwen3.8-Flash-Next. Разом із літніми релізами GPT-5.6, Kimi K3 і Grok 4.6 верхівка рейтингів повністю оновилася за два місяці, а OpenAI тим часом розганяли чутки про наступну GPT-6 Astra.

Мем з подіумом нових AI-моделей, три Gemini Flash святкують на останній сходинці

Fable 5.1 і Mythos 5.1

Anthropic 1 вересня випустили Fable 5.1 і Mythos 5.1. За заявою Anthropic, Fable 5.1 обходить Fable 5, Opus 5 і GPT-5.6 Sol у внутрішніх тестах з програмування і дослідницької роботи, незалежних замірів поки немає. Базові тарифи не змінилися, але подешевшало читання кешу, тобто повторне використання контексту, який модель уже обробила. Типова робота через це виходить приблизно на 25% дешевшою, а довгі агентні сценарії, коли модель годинами сама виконує багатокрокову задачу, до 45%. Mythos 5.1 — це та сама модель з меншою кількістю запобіжників, доступна тільки американським організаціям після перевірки. API для перевірки невидимої помітки згенерованого тексту, якого в серпні ще не існувало, вийшов у закритий попередній доступ.

Gemini 3.8 Flash і 3.8 Flash Cyber

Google 2 вересня викотили одразу два варіанти Gemini 3.8, третій реліз Flash за три місяці після 3.6 і 3.7. Звичайна 3.8 Flash, за словами Google, дає приріст у програмуванні, агентних задачах і багатокроковому міркуванні за тієї ж швидкості й ціни, що у 3.7. За тестами Google, вона обходить частину більших моделей на задачах з програмування DeepSWE і набирає 54.9% на HLE-Verified, наборі складних питань з природничих наук і професійних сфер.

Графік DeepSWE V1.1 з якістю і ціною за задачу, Gemini 3.8 Flash поруч з Opus 5

На графіку з анонсу, побудованому на даних Datacurve AI, 3.8 Flash розвʼязує близько 73% задач DeepSWE, приблизно на рівні Claude Opus 5, тільки задача обходиться в рази дешевше. До 31 грудня діє стартова ціна $0.75 за мільйон вхідних токенів і $3.75 за вихідні, далі тарифи зростають удвічі. Модель уже працює в застосунку Gemini для передплатників Pro і Ultra, в AI Mode і в Google Sheets. Пошук Google працює на дешевших моделях цієї ж лінійки, влітку його перевели на Gemini 3.5 Flash-Lite.

3.8 Flash Cyber заточена під кібербезпеку: пошук вразливостей у коді і автоматичне латання. Google заявляють, що у внутрішніх тестах модель знаходить понад 70% вразливостей на 20 мовах програмування. У відкритий доступ її не дають, модель доступна тільки перевіреним фахівцям із захисту через програму Fairwind.

GLM-5.3-Flash і Qwen3.8-Flash-Next

Z.ai 26 серпня випустили GLM-5.3-Flash, першу модель лінійки GLM-5, яка з коробки працює з текстом, зображеннями і відео. Розмір 320 млрд параметрів, з яких на кожен запит працюють лише 18 млрд, тому вона швидка і дешева: $0.15 за мільйон вхідних токенів і $0.50 за вихідні, до 9 вересня ще й знижка 50%. Контекст мільйон токенів, ваги відкриті під ліцензією MIT, тобто модель можна завантажити і запускати в себе. Того ж дня Alibaba відкрили ваги Qwen3.8-Flash-Next на 125 млрд параметрів з 6 млрд активних, це попередній показ архітектури майбутньої Qwen4. У MarkTechPost порівняли обидві моделі і зауважили, що дві лабораторії незалежно зійшлися майже на однаковій архітектурі.

GPT-6 Astra вийшла

Перед випуском OpenAI відійшли від прямого хайпу. Сама компанія модель майже не рекламувала, зате в X писали акаунти, які нібито мали ранній доступ: викладали згенеровані Astra ігри, сайти, 3D-обʼєкти і воксельні світи та повторювали, що модель underhyped, тобто недооцінена ще до виходу. Показані приклади були зроблені в режимі максимальних зусиль з довгим міркуванням, тобто найкращі генерації, відібрані після багатьох спроб.

Оновлення 6 вересня. OpenAI випустили GPT-6 Astra 3 вересня: спершу обмежений доступ для перевірених організацій, за кілька днів модель отримають передплатники Plus, Pro, Business і Enterprise, а також API і AWS. За заявою OpenAI, Astra обходить GPT-5.6 Sol і Claude Fable 5 та набирає майже максимальні бали на ключових тестах міркування: 98% на математичному FrontierMath Tier 4 і 99.9% на ARC-AGI-3. Незалежних замірів поки немає. Це перша модель OpenAI, яка досягла рівня Critical з кібербезпеки за внутрішньою шкалою ризиків компанії, тому роллаут навмисно повільний і з додатковими запобіжниками. В API модель коштує $10 за мільйон вхідних токенів і $50 за вихідні, кешовані вхідні токени $1, пакетна обробка вдвічі дешевша.

Хто на подіумі з літа

Решта топових релізів зібралася за останні два місяці. OpenAI ще 9 липня випустили лінійку GPT-5.6 у трьох варіантах Sol, Terra і Luna з контекстом у мільйон токенів. Moonshot 27 липня виклали ваги Kimi K3 на 2.8 трлн параметрів, найбільшої відкритої моделі в історії. SpaceXAI, колишня xAI, 12 серпня показали Grok 4.6, який на незалежному індексі Artificial Analysis набрав стільки ж балів, скільки GPT-5.6 Sol Max.

Оновлення моделей чимось схожі на кор-апдейти: після переходу ChatGPT на GPT-5.5 обсяг цитувань сайтів у відповідях знову виріс. Тож найближчими тижнями варто дивитися на трафік AI-ботів у логах.