26 августа 2026 года компания Z.ai представила GLM-5.3-Flash — первую мультимодальную модель серии GLM 5.3. Модель содержит 320 миллиардов параметров, из которых для каждого токена активируются 18 миллиардов, поддерживает контекстное окно объёмом 1 миллион токенов, а также обработку изображений и видео на входе. До официального анонса модель была доступна под именем «Ox Alpha» на платформе OpenRouter и показала результаты, сопоставимые с Claude Opus 4.8. Веса опубликованы под лицензией MIT на Hugging Face.
Серия GLM-5.3 стала заметным событием на рынке ИИ-моделей. Модель показывает результаты на уровне лучших проприетарных решений, а её использование обходится примерно в 40 раз дешевле. Для разработчиков, которые хотят использовать мощную модель с открытыми весами без существенных лицензионных ограничений, это редкое сочетание возможностей.
Архитектура GLM-5.3-Flash: гибридное внимание и MoE
В основе GLM-5.3-Flash лежит архитектура Mixture-of-Experts с 288 экспертами, из которых 8 активируются для каждого токена. Общее число параметров составляет 320 миллиардов, а на обработку одного токена активируются 18 миллиардов параметров. Подход MoE позволяет задействовать только часть параметров модели при обработке конкретного токена, что снижает вычислительную нагрузку при сохранении высокого качества обработки.
Ключевая особенность модели заключается в использовании гибридного механизма внимания. Он сочетает два механизма: механизм линейного внимания KDA для длинных последовательностей и разреженный механизм MLA без позиционных кодировок NoPE для коротких и средних дистанций. Вместе эти механизмы образуют систему IndexPool, которая сокращает объём вычислений внимания примерно в 3 раза и уменьшает размер KV-кэша в 4,4 раза. На практике это значит, что модель обрабатывает длинные документы быстрее и с меньшим расходом памяти, чем модели с традиционным механизмом внимания.
Архитектура включает 45 слоёв и технологию mHC (Manifold-Constrained Hyper-Connections). Этот метод позволяет информации эффективнее перемещаться между слоями и экспертами. Веса в формате FP8 уменьшают требования к памяти, а механизм чернового декодирования MTP ускоряет генерацию, предсказывая несколько токенов за один проход.
Модель обучена на корпусе из 30 триллионов токенов с мультимодальными данными. Обучение проходило на китайских ИИ-чипах, что демонстрирует возможность создания конкурентоспособных моделей без прямой зависимости от западного оборудования.
Окно контекста: 1 миллион токенов
Контекстное окно GLM-5.3-Flash составляет 1 048 576 токенов. Для сравнения: большинство моделей на рынке работают с окном 128 000 или 200 000 токенов. Такой объём контекста расширяет возможные сценарии использования.
Вы можете загрузить в модель целую книгу, длинную историю переписки, видеозапись продолжительностью несколько минут или большой объём технической документации. Модель может учитывать весь запрос и сохранять доступ к сведениям из его начала. Для разработчиков это значит анализ целых кодовых баз, обработку многостраничных договоров и подготовку кратких изложений длинных конференций. Для обычных пользователей это возможность задать вопрос по содержимому видео или серии изображений без разбивки запроса на части.
В сочетании с KV-кэшем, уменьшенным в 4,4 раза, такое окно контекста остаётся практичным. Модель не требует пропорционального роста памяти при увеличении длины запроса, что делает обработку длинных контекстов более практичной с точки зрения затрат.
Бенчмарки GLM-5.3-Flash: сравнение с Claude Opus 4.8
На платформе Artificial Analysis модель получила Intelligence Index 57. Такой же показатель получил Claude Opus 4.8. Это значит, что модель с открытыми весами показывает результат, сопоставимый с одной из ведущих проприетарных моделей.
| Бенчмарк | GLM-5.3-Flash | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 57 | 57 | н/д |
| Terminal-Bench 2.1 | 84.3 | 85.0 | н/д |
| DeepSWE v1.1 | 63.4 | н/д | 46.2 |
| AutomationBench | 48.8 | н/д | н/д |
| HLE | 55.3 | н/д | н/д |
| OfficeQA Pro | 62.4 | ниже | н/д |
Эти результаты показывают следующее. Terminal-Bench 2.1: 84,3 против 85,0 у Opus 4.8. Разница в 0,7 балла на бенчмарке, который измеряет способность модели выполнять задачи в терминале, писать код и работать с командной строкой, остаётся небольшой.
Особенно показателен результат DeepSWE v1.1. GLM-5.3-Flash набрала 63,4 балла против 46,2 у предыдущей GLM-5.2. Рост на 17,2 балла говорит о том, что модель стала значительно лучше в задачах разработки и автоматизации. OfficeQA Pro: 62,4 балла, и это выше, чем у Opus 4.8. В задачах работы с офисными документами GLM-5.3-Flash показывает более высокий результат, чем одна из ведущих проприетарных моделей на этом тесте.
Пока нет полных данных о производительности на всех существующих бенчмарках, но по доступным результатам модель уверенно держится в числе лучших решений. Скорость генерации составляет 48,7 токена в секунду, а задержка до появления первого токена — 1,52 секунды. Для модели с 320 миллиардами параметров это серьёзные показатели, особенно учитывая цену.
Мультимодальность: изображения и видео
GLM-5.3-Flash стала первой мультимодальной моделью серии GLM-5. Модель обрабатывает изображения и видео на уровне собственной архитектуры, без внешних модулей.
Пользователи могут загружать скриншоты, фотографии и видеозаписи. Модель анализирует содержимое визуального входа и отвечает текстом. Для разработчиков это открывает возможности автоматического распознавания документов, анализа интерфейсов и обработки видеорядов.
Мультимодальность также позволяет модели одновременно работать с текстом и изображениями в одном запросе. Вы можете задать вопрос о конкретном кадре видеозаписи, и GLM-5.3-Flash обработает и текст, и визуальный контекст одновременно. Это полезно для задач, где нужно связать текстовое описание с визуальным материалом. Например, можно попросить модель описать, что происходит в определённый момент видеозаписи, или извлечь информацию из графика на скриншоте.
Цены на API GLM-5.3-Flash
Стоимость использования API GLM-5.3-Flash примерно в 40 раз ниже стоимости API Claude Opus 4.8. Это частично связано с MoE-архитектурой с низкой активацией параметров: модель использует 18 миллиардов из 320, однако итоговая стоимость также зависит от объёма обрабатываемых токенов и условий тарифа.
| Параметр | Стоимость |
|---|---|
| Входящие токены | $0.15 за миллион |
| Кэшированные входящие токены | $0.03 за миллион |
| Исходящие токены | $0.50 за миллион |
Для сравнения: Claude Opus 4.8 стоит 6замиллионвходящихи 15 за миллион исходящих токенов. Разница в 40 раз делает модель Z.ai доступной для проектов с ограниченным бюджетом, где раньше не было варианта использовать ИИ-модель такого уровня. Учитывайте аспекты безопасности при работе через API: не отправляйте конфиденциальные данные в промптах.
Кэширование входящих токенов снижает стоимость ещё в 5 раз. Если вы отправляете повторяющиеся запросы с одинаковым системным промптом, стоимость обработки кэшированных входящих токенов может составлять $0.03 за миллион. Для приложений с высокой нагрузкой и повторяющимся контекстом основная часть расходов уходит на генерацию ответа, а не на обработку входных данных.
ZCode: доступ к GLM-5.3-Flash с мобильных устройств
Не все хотят работать с API напрямую. Для тех, кто предпочитает готовый интерфейс, Z.ai предлагает платформу ZCode. Это браузерный инструмент, через который можно использовать GLM-5.3-Flash без программирования.
ZCode предлагает три тарифных плана. Тариф Lite стоит 18вмесяциподходитдлябазовыхзадач.ТарифPro∗∗стоит 80 в месяц** и предоставляет большие лимиты и доступ к продвинутым функциям. Тариф Max стоит $168 в месяц и предлагает наиболее высокий лимит использования.
Для пользователей Android и iOS ZCode работает через браузер. Не нужно устанавливать отдельное приложение, достаточно открыть сайт и начать работу. Это удобно, когда нужно быстро сгенерировать текст, проанализировать изображение или задать вопрос модели с телефона. Платформа поддерживает многие функции, доступные через API, включая загрузку изображений, обработку длинных контекстов и генерацию текста.
Открытый исходный код: что значит лицензия MIT для GLM-5.3
Веса GLM-5.3-Flash опубликованы на Hugging Face под лицензией MIT. Это одна из наиболее разрешительных лицензий с открытым исходным кодом. Модель можно использовать в коммерческих продуктах, модифицировать и распространять при соблюдении условий лицензии.
Для разработчиков это значит, что GLM-5.3 можно разворачивать локально на собственном оборудовании. Веса модели можно скачать на Hugging Face, а формат FP8 снижает требования к памяти по сравнению с аналогичными моделями того же размера. Это не значит, что её запустит любой ноутбук. 320 миллиардов параметров требуют серьёзного оборудования. Но для компаний с собственными серверами это реальный вариант.
Открытая лицензия также позволяет дополнительно обучать модель GLM-5.3-Flash на конкретных данных и использовать результат в своих продуктах при соблюдении условий лицензии. На данный момент лишь несколько моделей сопоставимого качества имеют столь открытую лицензию.
«Ox Alpha»: анонимный тест на OpenRouter
Перед официальным анонсом GLM-5.3-Flash была доступна на OpenRouter под именем «Ox Alpha». Пользователи могли тестировать модель, не зная, кто её разработал. Они оценивали её результаты и делились отзывами по мере тестирования.
Когда Z.ai раскрыла, что Ox Alpha и есть GLM-5.3-Flash, это вызвало значительный интерес в сообществе. Модель уже зарекомендовала себя в слепых тестах: пользователи оценивали её возможности, не зная, кто является разработчиком модели. Такой подход к запуску встречается нечасто среди разработчиков ИИ-моделей. Он показывает, что Z.ai была уверена в качестве продукта ещё до официального объявления.
Заключение
GLM-5.3-Flash предлагает уровень Claude Opus 4.8 за 1/40 его стоимости, с открытыми весами под MIT и нативной мультимодальностью. Окно контекста в 1 миллион токенов и скорость генерации 48.7 токенов в секунду делают её пригодной для задач от анализа документов до автоматизации разработки. Платформа ZCode даёт доступ к модели с любого мобильного устройства через браузер, а открытая лицензия позволяет разработчикам строить собственные продукты на базе GLM-5.3. Если вы ищете открытую ИИ-модель, которая не уступает проприетарным решениям по качеству, но при этом доступна по цене и открыта для модификации, GLM-5.3-Flash один из немногих вариантов на рынке прямо сейчас. Начните с ZCode для быстрого доступа или подключите API напрямую, чтобы оценить возможности модели на своих задачах.



