Meta выпустила Llama 4, и это знаковый момент для искусственного интеллекта с открытым исходным кодом. Модель с 405 миллиардами параметров использует архитектуру смешанных экспертов (MoE), которая активирует только часть параметров для каждого вывода, что делает ее значительно более эффективной, чем предполагает ее размер. По большинству тестов Llama 4 соответствует или превосходит GPT-4 Turbo — и его можно загрузить и запустить бесплатно. Последствия для индустрии искусственного интеллекта, для внедрения предприятиями и для конкурентной динамики между открытыми и закрытыми разработками искусственного интеллекта огромны.
Мы потратили три недели на тестирование Llama 4 для выполнения ряда задач — кодирования, рассуждения, творческого письма, выполнения инструкций и многоязычной производительности — и сравнивали его напрямую с GPT-4 Turbo, Claude 3.5 Sonnet и Gemini 1.5 Pro. Вот наша комплексная оценка.
Архитектура: почему смесь экспертов меняет все
Llama 4 использует разреженную архитектуру смешанных экспертов (MoE) с 405 миллиардами общих параметров, но только примерно 70 миллиардов активных параметров на один прямой проход. Это означает, что затраты на вывод сопоставимы с моделью с плотностью 70B, но при этом мы получаем выгоду от объема знаний модели 405B. Архитектура похожа на Mixtral от Mistral и Gemini 1.5 от Google, но в значительно большем масштабе.
Подход MoE работает путем маршрутизации каждого входного токена в подмножество «экспертных» подсетей, каждая из которых специализируется на различных типах контента. Вопрос о математике может активизировать других экспертов, чем вопрос о творческом письме. Эта специализация позволяет модели развивать более глубокие знания в конкретных областях без вычислительных затрат на активацию всех параметров для каждого входа.
Практическим результатом является модель, которая одновременно более эффективна и эффективна, чем плотная модель эквивалентного качества. Запуск Llama 4 на уровне качества GPT-4 Turbo требует примерно на 40 % меньше вычислительных затрат, чем запуск сопоставимой модели с высокой плотностью, что является значительным преимуществом для организаций, развертывающих ИИ в больших масштабах.
Эталонная производительность: где она находится
Llama 4 набирает 87,6% по MMLU (массовое многозадачное понимание языка) по сравнению с 86,4% у GPT-4 Turbo и 88,7% у Claude 3.5 Sonnet. По кодированию HumanEval он набирает 82,3% — ниже 87,1% у GPT-4 Turbo, но значительно опережает предыдущие модели с открытым исходным кодом. По GPQA (научные вопросы для выпускников) он набирает 71,2%, демонстрируя подлинные знания экспертного уровня в научных областях.
Особого внимания заслуживает производительность кодирования. Предыдущие модели с открытым исходным кодом постоянно отставали от закрытых моделей в задачах кодирования, которые являются одними из наиболее коммерчески ценных приложений ИИ. Оценка HumanEval Llama 4, равная 82,3%, значительно сокращает этот разрыв, что делает его надежным выбором для приложений генерации кода и проверки, которые ранее требовали GPT-4 или Claude.
В чем Llama 4 терпит неудачу: в самых сложных задачах рассуждения — многоэтапных математических доказательствах, сложных логических выводах и задачах, требующих последовательного и последовательного рассуждения в очень длинных контекстах — она отстает от GPT-5 и Claude 4 Opus. Для подавляющего большинства реальных приложений этот разрыв незначителен. Для самых требовательных приложений это имеет значение.
Запуск Llama 4: аппаратные требования и параметры
Объем активных параметров 70 байт означает, что Llama 4 может работать на одной высокопроизводительной рабочей станции с 4 графическими процессорами NVIDIA RTX 5090 (всего 96 ГБ видеопамяти). Это дорогое оборудование — около 12 000 долларов США только за графические процессоры — но оно делает ИИ высочайшего качества доступным для хорошо финансируемых исследовательских групп и предприятий, которым необходимо развертывание на местах из соображений конфиденциальности данных.
Для большинства пользователей облачный вывод более практичен. Аппаратное обеспечение LPU Groq запускает Llama 4 со скоростью более 800 токенов в секунду — быстрее, чем любой другой поставщик логического вывода, и значительно быстрее, чем 50–100 токенов в секунду, типичные для вывода на основе графического процессора. Вместе AI, Replication и Fireworks AI предлагают логический вывод Llama 4 по конкурентоспособным ценам, обычно от 0,50 до 1,00 доллара за миллион токенов — это лишь небольшая часть от 10 долларов США за миллион входных токенов GPT-4 Turbo.
Квантованные версии Llama 4 (4-битная и 8-битная) могут работать на более скромном оборудовании. 4-битная квантованная версия работает на одной видеокарте RTX 4090 (24 ГБ видеопамяти) с умеренным снижением производительности — примерно 3–5 % в большинстве тестов. Это делает Llama 4 доступной для отдельных разработчиков и небольших команд, которые хотят экспериментировать с искусственным интеллектом высочайшего качества без затрат на облако.
Коммерческое использование и лицензирование
Llama 4 выпускается под специальной лицензией Meta, которая позволяет коммерческое использование компаниям с менее чем 700 миллионами активных пользователей в месяц. Это охватывает подавляющее большинство предприятий — лишь немногие компании в мире превышают этот порог. Веса моделей доступны на Hugging Face и веб-сайте Meta, а точная настройка явно разрешена.
Meta выпустила несколько вариантов: базовую модель (для тонкой настройки), версию с настройкой инструкций (для общего использования) и версию, оптимизированную для чата (для диалоговых приложений). Версия, настроенная на инструкции, является наиболее полезной для большинства приложений — она надежно следует инструкциям и выдает хорошо отформатированные выходные данные без дополнительной тонкой настройки.
Открытые и закрытые дебаты об искусственном интеллекте
Выпуск Llama 4 возобновил дебаты об относительных преимуществах открытой и закрытой разработки ИИ. Сторонники искусственного интеллекта с открытым исходным кодом утверждают, что Llama 4 демонстрирует, что открытые модели могут соответствовать закрытым моделям по возможностям, предлагая при этом значительные преимущества в стоимости, конфиденциальности и настраиваемости. Критики утверждают, что выпуск мощных моделей ИИ без ограничений создает риски, которые перевешивают выгоды.
Позиция Meta заключается в том, что ИИ с открытым исходным кодом безопаснее, чем закрытый ИИ, поскольку он позволяет более широкому исследовательскому сообществу выявлять и устранять проблемы безопасности, а не концентрировать эту ответственность в одной компании. OpenAI и Anthropic не согласны с этим, утверждая, что возможность контролировать развертывание необходима для управления рисками, связанными со все более мощными системами искусственного интеллекта.
Практическая реальность такова, что Llama 4 уже используется тысячами организаций по всему миру, а джин выпущен из бутылки. Вопрос не в том, будет ли существовать мощный ИИ с открытым исходным кодом, а в том, как отрасль и регулирующие органы будут управлять его внедрением.
Точная настройка Llama 4: возможности для бизнеса
Самая значительная коммерческая возможность Llama 4 — это тонкая настройка для конкретных областей и вариантов использования. Тщательно настроенная модель Llama 4, обученная на внутренних документах, коде и процессах компании, может превзойти стандартные закрытые модели при решении конкретных задач компании, сохраняя при этом конфиденциальные данные локально.
Несколько корпоративных платформ искусственного интеллекта, в том числе Databricks, Scale AI и Anyscale, создали конвейеры тонкой настройки специально для Llama 4. Стоимость тонкой настройки модели Llama 4 для конкретной области упала примерно до 10 000–50 000 долларов США для типичного корпоративного набора данных, что делает его доступным для компаний среднего бизнеса, которые ранее не могли позволить себе разработку индивидуального ИИ.
Дальнейшее чтение
- Meta AI — официальная страница модели Llama, загрузка гирь и лицензия.
- Hugging Face — центр моделей Meta Llama с настройками и тестами сообщества
- arXiv — Технический отчет Llama 3 (основополагающий документ по архитектуре серии Llama)
- Together AI — облачная платформа вывода для Llama 4 и других моделей с открытым исходным кодом.