Apple представила на WWDC собственные ИИ-модели AFM 3 и масштабное обновление Siri.
В начале июня Apple провела ежегодную конференцию для разработчиков WWDC, где рассказала о грядущих обновлениях в сфере искусственного интеллекта.
Значительные улучшения получила Siri. Теперь она работает на относительно большой (по мобильным меркам) большой языковой модели, умеет вызывать инструменты и тесно связана с приложениями и экосистемой. Впечатляют её способности к обобщению: на демонстрациях были показаны запросы и сценарии, которые, скорее всего, не были предусмотрены разработчиками во время обучения модели, и Siri справилась с ними отлично. Для обычных пользователей, привыкших к ограниченному набору команд, такой уровень понимания контекста способен вызвать настоящий «вау-эффект».
На устройствах может работать одна из двух моделей: AFM 3 Core (3 миллиарда параметров) и AFM 3 Core Advanced для более мощных девайсов (Phone 17 Pro и выше, iPad с чипом M4 и выше, MacBook с чипами M3 и выше). Такое разделение обусловлено тем, что Advanced-версия действительно «Large»: она насчитывает 20 миллиардов параметров с микстурой экспертов (MoE). Реализована она хитро. Классический подход с MoE работает плохо из-за ограниченной пропускной способности между NAND (флеш-память для хранения файлов и весов модели) и DRAM (где хранятся активные параметры). В обычном MoE нельзя заранее узнать, какие эксперты понадобятся, поэтому приходится загружать всю модель, что занимает много времени и памяти.
Apple применила новый подход: для запроса пользователя модель предварительно выбирает набор экспертов на всю модель, а затем загружает только их. В итоге получается от 1 до 4 миллиардов активных параметров. Этот подход называется Instruction-Following Pruning for Large Language Models и описан в этой статье из начала 2025 года.
Эта же модель используется для распознавания голоса и для генерации нового голоса Siri. Оценить разницу можно по семплам «было/стало» в официальном блоге Apple.
Вторая часть анонса касается удвоения ставки на Private Cloud Compute (PCC), который был анонсирован два года назад. Идея в том, что для более сложных запросов, для которых не хватает мощности локальной модели, можно безопасно отправить промпт и контекст на зашифрованный сервер Apple, внутрь которого ни у кого нет доступа.
В PCC также обновилась модель. Теперь там работает AFM 3 Cloud, запущенная на серверах Apple с чипами M-серии. Кроме того, существует AFM 3 Cloud Pro, которая ещё умнее и развернута на серверах Google на Nvidia GPU. Такой гибридный подход, объединяющий вычисления на устройстве и в защищенном облаке, выглядит как перспективный паттерн для будущего, ведь смартфоны и умные девайсы в ближайшее время не сравнятся по чипам с серверными стойками, но спрос на мощные модели будет расти.
Все эти модели созданы самой компанией Apple, это не модели Gemini. Сообщается, что Apple усовершенствовала некоторые из них, дистиллируя Gemini, но все они являются совершенно новыми, и в них используются собственные знания и технологии Apple.
Ключевой момент для разработчиков: доступ к этим большим языковым моделям открыт как на смартфонах, так и на макбуках. Можно написать приложение, не обучая свою модель, и вызывать её. Для локальной модели это бесплатно, а для облачных моделей бесплатно до определенного порога. Посмотреть на скорость генерации на разных девайсах можно здесь и здесь.

