Google DeepMind представила Gemma 4 12B — новую открытую мультимодальную модель, которую компания позиционирует как вариант для локального запуска на обычных ноутбуках. Это не просто очередной компактный LLM-релиз: модель умеет работать не только с текстом, но и с изображениями и аудио, а ещё рассчитана на сравнительно скромный по современным меркам объём памяти — около 16 ГБ VRAM или unified memory.
Что произошло
По данным Google DeepMind, Gemma 4 12B стала промежуточным звеном между более лёгкой E4B и более мощной 26B MoE-моделью в линейке Gemma 4. Главная ставка здесь — на сочетание мультимодальности, локального запуска и открытой лицензии Apache 2.0.
У модели несколько важных особенностей:
- она принимает текст, изображения и аудио;
- это первый mid-size релиз Google в серии Gemma с нативной поддержкой аудиовхода;
- модель построена на encoder-free архитектуре, где визуальные и аудиоданные идут прямо в backbone LLM, без отдельных тяжёлых мультимодальных энкодеров;
- Google заявляет производительность, близкую к более крупной Gemma 4 26B, но с заметно меньшими требованиями к памяти;
- модель доступна открыто и интегрируется с популярными инструментами вроде Ollama, Hugging Face Transformers, llama.cpp, MLX, vLLM и других.
Отдельно Google отмечает, что семейство Gemma 4 уже превысило 150 млн загрузок, а новая версия 12B должна сделать локальные агентные и мультимодальные сценарии заметно доступнее для разработчиков.
Почему это важно
Рынок ИИ сейчас идёт сразу в двух направлениях: с одной стороны, компании наращивают мощность облачных моделей, с другой — растёт спрос на локальные модели, которые можно запускать без постоянной зависимости от внешнего API. Gemma 4 12B попадает ровно в эту вторую волну.
Здесь важны сразу несколько моментов.
Во-первых, Google делает ставку не просто на «маленькую открытую модель», а на мультимодальный локальный ИИ. Это значит, что разработчики могут строить приложения, которые анализируют изображения, слушают аудио и рассуждают поверх этого без обязательной отправки данных в облако. Для приватных, офлайн- и edge-сценариев это серьёзный плюс.
Во-вторых, отказ от отдельных мультимодальных энкодеров — интересный инженерный ход. Если такая архитектура действительно даёт меньшую задержку и снижает требования к памяти, это может стать заметным аргументом в пользу более компактных, но всё ещё полезных мультимодальных моделей.
В-третьих, важна именно открытость релиза. Apache 2.0 и широкая совместимость с экосистемой делают Gemma 4 12B не демонстрацией ради PR, а реальным инструментом для разработчиков, стартапов и команд, которые хотят встроить ИИ в свой продукт без жёсткой привязки к закрытым платформам.
Что дальше
Скорее всего, ближайшие месяцы покажут, насколько Gemma 4 12B действительно удобна в практической работе — не на бенчмарках, а в реальных локальных сценариях: ассистентах, мультимодальных агентах, голосовых интерфейсах и прикладных инструментах для бизнеса.
Если модель подтвердит заявленный баланс между качеством и требованиями к железу, давление на рынок локального ИИ только усилится. Для Google это ещё и стратегический ход: компания показывает, что умеет конкурировать не только в облачных frontier-моделях, но и в сегменте открытых моделей для повседневного железа.
На практике это означает простую вещь: качественный мультимодальный ИИ постепенно перестаёт быть привилегией дата-центров и всё увереннее переезжает на пользовательские устройства.
Нейросети для текста, картинок, видео и музыки
Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.
Начать бесплатно