Жёсткие тесты: GPT-6 Astra vs Fable 5.1, Opus 5, GPT 5.6 Sol, Kimi K3, GLM 5.3



Регистрируйся в облачной платформе immers.cloud по моей ссылке и получи 20% бонусов при первом пополнении!
Реклама. ООО «ДТЛ». ИНН 9717073792. erid: 2W5zFGBv3Bo

🔗 Клуб по AI (исходный код, промпты, встречи и доп контент):
🔗 Мой Telegram канал:
🔗 Разработка/внедрение AI/консультации:

В этом видео жёстко тестирую GPT-6 Astra и сравниваю с Fable 5.1, Opus 5, GPT-5.6 Sol, Kimi K3 и GLM 5.3. Шесть моделей, шесть реальных задач и только один ван шот промпт — без исправлений и допинываний.

00:00 Начало
00:32 Какие модели сравниваем
02:36 Правила тестов
02:51 Тест 1 — игра
05:00 Тест 2 — приложение для iPhone
07:33 Тест 3 — синтезатор
08:52 Промежуточные итоги: кто лучше в кодинге
09:18 Тест 4 — дизайн
10:50 Тест 5 — монтаж
13:14 Тест 6 — моделирование в Blender
14:45 Финальная таблица
15:12 Стоимость, скорость и эффективность
16:00 Какую модель выбрать
16:43 Заключение

source

28 Comments

  1. Честно говоря это тест ваншота, который мало о чем говорит. Надо что-то тестить более приближенное к реальной работе, чтобы люди могли выбрать, что им использовать. Типа, если бы ты дал gpt-6 второй промпт, она бы доделала скролл, и по очкам была бы на 1-2 месте, и при этом всё равно это было бы по стоимости и скорости выгоднее чем fable. Может просто снимать какой-то процент баллов за каждый новый промпт, но всё равно давать доделать до конца?

  2. ИИ могли спокойно протестить скролл в суфлере. Звук это только источник, программа же работает с данными, всегда можно подать на вход тестовые данные, как будто звук уже расшифрован был.

  3. С одной стороны задачи интересные, с другой большая часть не юзабельны напрямую. Интересно, как потом дорабатывать эти 3д видео, на уровне промтов: сделай ещё круче?

  4. 4:50
    Я хз заметил ли ты, но можель astra даже попыталась сделать отображение динамического навигационного маршрута на дороге. Он правда почему то обозначался не конкретной линией на дороге, а какими то зелёными плюхами, но как сам факт довольно интересно.

  5. Хорошее сравнение, но. Что за прикол ставить 0 баллов, если приложение не запустилось с первого раза. Лучше добавить столбец с количеством доработок, чем пытаться завести приложуху с одного промта.

    Никто так не вайбкодит. Это всегда процесс из кучи доработок.

  6. Астра на ультра, но ржавчина на микрофоне. Наверное это дизайн в тон рыжим глазам, рыжей бороде, волосам и рыжим шторам

  7. Норм. Хороший тест. Про 3д моделирование вообще как будто отдельно модели обучаются – разница слишком большая

  8. 8:10 понимание твоих промтов моделями, это отдельный бенчмарк. Не уверен, что некоторые модели сделали хуже других, возможно они делали другое, по другому поняв твои кошмарные промты.

  9. Спасибо! Юзаю оба (Claude Code/Codex) , но в основном использую клода, так как он намного человечнее пишет тексты (статьи и т.п.)

  10. Ролик интересный, лично я пока с клода уходить не собираюсь и ролик это подтвердил. Но мне кажется оценка стоимости и эффективности была бы объективнее если бы было тз с тесткейсами и каждую модель в любое число токенно и запросов заставляли бы доделать задачу до прохождения всех тест кейсов. Тогда дешевизна и скорость Астры уже не так очевидна если Fable например в один промпт справляется, а Астра в еще 2 корректирующих и в итоге сжирает столько же токенов + время на доп проверки ее результатов

  11. Олег, при всем уважении, но тесты ровно как у большинства обзорщиков и «жесткими» их назвать уж никак нельзя. Не вижу тестов на работу с фреймворками и песочницами, где по 5-7 штук активных mcp и скилов. Не понятно как та или иная модель держит контекст на длинных цепочках вызовов mcp, как часто забывает дернуть тот или иной инструмент или скилл. Тесты просто на голую модель откровенно говоря не информативны.

  12. Никто на ультрах не использовал эти модели от фейбл, блин че же она может сотворить, даже интересно😅

  13. Все тесты текстовых моделей напоминают тесты рисующих моделей. Им дают "нарисовать" сайт, игру или приложение, и потом смотрят: о красивенько, кнопочки есть, Цвет меняется, переливаются, глаз не трет, что-то открывается, значит Шикарно. Тоже проделываем с остальными моделями. Ну, в такой-то Модели получилось красивее всего, и значит, она классная. Лучше всех. Но не проверяют ни на бизнес логику приложений, не на то как она работает с реальными данными, ни под нагрузкой, если на сайт зайдет 100 человек и оценивают как-то по красоте. Причем за нейронками известно есть вариабельность ответа на один и тот же промпт, и она может при одном и том же промпте, заданном три раза с чистого контекста, выдать три разных результата. Причем два из них будут хировыми, а один Наиболее приемлемый. А в тестох люди почему-то оценивают по одному единственноему промт-решению, по одной единственной попытке, каждой Нейросети. И Предполагают, что Каждая сразу даст свой Лучший ответ. Это пальцем в небо. Может температуру ставят на ноль, конечно, некоторые. Но тоже, по-моему, тест какой-то обрезанный получается. Ведь в реале мы его Юзаем не на нулевой температуре.

    Это я к тому пишу, что реальные задачи они не решают. Когда нужно сделать конкретное решение, от них этого сложно добиться. Постоянно получается что-то красивое, офигенское, но не то, что мне нужно, и без понимания логики бизнес процесса.
    В реале я его использую для подбора оборудования по спецификации по проекту строительства. То есть в спецификации у меня есть множество позиции различного оборудования. И серверные, и извещатели различные, датчики, швабаумы, много чего. И на каждой из них есть документ, который называется опросный лист, в котором указаны все характеристики необходимого оборудования. Но подбирать его нужно самостоятельно. Ползать по интернету, искать оборудование через Гугл, сверять характеристики. И составлять результаты в таблицу, чтобы потом выбрать лучшее, наиболее подходящее, и с наименьшим сроком поставки. Агентные режимы начали справляться с этой задачей, и оне справляются с ней очень "красиво",- как на этих тестах, но Если присмотреться, При проверке видно, что по-прежнему придумывают различные результаты, даже если ты им даешь инструменты (Mcp-server Bright Data) для обхода антибот-защиты и антибот-ловушек На таких сайтах, как Озон, Авито и прочих, которые борются с роботами. И все равно, Имея достоверный результат из инета, они Предпочитают сочинять эти "результаты" из предположений.
    Чтобы это все нормально работало, пришлось создавать петлю из четырех агентов, один из которых ищет, Формирует результирующую таблицу Excel, второй сеет туда ошибки(Для проверки работы поисковика ошибок), третьей ищет ошибки в таблице Excel( Все в том числе и заложены). И четвертый Агент-судья, который смотрит, нашел ли он все заложенные ошибки вторым агентом. Если он нашел все, Значит он проверил все строки, И все ячейки Таблицы. Иначе он начинает проверять почему не получается найти ошибки. Значит опять меняет алгоритм, меняет подходы У первого, второго и третьего агентов. И только тогда получается получить достоверные результаты за приемлемое время. А если самому проверять, то искусственный интеллект, точнее нейросети, придумывают столько контента, что его прочитать некогда, не то что перепроверь. Поэтому перепроверять его нужно тоже вместе с нейронными сетями и агентами, основанными на них. Иначе вы как бы становитесь Самым медленным звеном, И процесс затягивается.

Leave a Reply

Your email address will not be published. Required fields are marked *

You might like

© 2026 Cantinho do Vídeo - WordPress Video Theme by WPEnjoy