Google и Samsung внедряют функции искусственного интеллекта
Publicēts: 1. марта 2026
Google и Samsung сделали важный шаг вперед в развитии искусственного интеллекта для смартфонов, представив новые так называемые агентные функции ИИ, способные самостоятельно выполнять многоэтапные задачи вместо пользователя. В отличие от традиционных голосовых помощников, которые в основном реагируют на отдельные запросы, новый подход предполагает, что система способна понимать контекст, принимать последовательные решения и взаимодействовать с несколькими приложениями для достижения конкретного результата. На практике это означает, что пользователь может дать задачу более высокого уровня, например, организовать ужин или заказать транспорт, а остальной процесс помощник выполняет сам - анализирует информацию, выбирает подходящие варианты и подготавливает действия к выполнению.
Это развитие особенно значимо, так как оно происходит в то время, когда Apple до сих пор не внедрила подобные функции для своего голосового помощника Siri, хотя о них широко рассказывалось на предыдущих презентациях. Apple продемонстрировала видение помощника, который мог бы понимать содержимое экрана, выполнять действия между различными приложениями и использовать личный контекст пользователя, например, электронные письма или сообщения. Однако внедрение этих возможностей было отложено, и они еще не доступны конечным пользователям. В результате Google и Samsung в настоящее время перехватывают инициативу, превращая идеи, до сих пор демонстрировавшиеся на концептуальном уровне, в реальный продукт.
В контексте отрасли это сигнализирует о переходе от «эры чат-ботов» к эре агентов продуктивности. Новые функции позиционируются не как простой инструмент «вопрос-ответ», а как цифровой помощник, способный планировать, координировать и частично автоматизировать повседневные процессы. Такой подход потенциально меняет отношения пользователя с устройством: оно становится не только точкой доступа к информации, но и активным исполнителем задач. Если технология будет работать достаточно точно и безопасно, это может стать одним из самых значимых поворотных моментов в конкуренции мобильного искусственного интеллекта за последние годы.
Новые агентные (agentic) возможности Gemini на устройствах Android
Google со своей моделью ИИ Gemini внедряет агентные функции нового поколения в экосистему Android, существенно расширяя то, что смартфон способен сделать без прямого и детального участия пользователя. Эти возможности предполагают, что искусственный интеллект не только отвечает на вопросы или генерирует текст, но и самостоятельно планирует последовательность действий, взаимодействует с интерфейсами приложений и выполняет конкретные задачи от имени пользователя.
Суть агентности в этом контексте заключается в способности понимать цель более высокого уровня и разделять ее на несколько операционных шагов. Если традиционный помощник выполняет одну команду за раз, то Gemini может интерпретировать более сложную задачу, например, «организуй ужин для семьи», и превратить ее в структурированную цепочку действий - анализировать содержимое переписки, определить предпочтения, выбрать подходящий сервис и подготовить заказ к подтверждению.
Поддерживаемые устройства: Pixel 10, Pixel 10 Pro и Samsung Galaxy S26
Изначально эти функции будут доступны на ограниченном круге устройств, а именно Pixel 10, Pixel 10 Pro и Samsung Galaxy S26. Такое выборочное внедрение не случайно - агентные функции ИИ требуют высокой вычислительной мощности, эффективной поддержки нейронных процессоров (NPU) и тесной интеграции между оборудованием и операционной системой.
Устройства Google Pixel традиционно служат платформой для демонстрации инноваций Android, где компания может полностью контролировать оптимизацию как программного обеспечения, так и оборудования. В свою очередь, Samsung как один из крупнейших производителей Android обеспечивает масштабируемость технологии в премиальном сегменте. Такое партнерство позволяет тестировать и совершенствовать новую функциональность в контролируемой среде, прежде чем она потенциально станет доступна более широкому кругу устройств.
Автоматизация многоэтапных задач (заказ еды, вызов такси и т.д.)
На практическом уровне агентные возможности Gemini проявляются как способность автоматизировать процессы, которые до сих пор требовали ряда ручных действий. Например, в случае заказа еды система может анализировать содержимое группового чата, идентифицировать предпочтения каждого участника, структурировать заказ и затем перейти в приложение доставки, чтобы подготовить корзину. Пользователю остается только просмотреть и подтвердить подготовленный заказ.
Аналогичный принцип относится к транспортным услугам. Если пользователь указывает, что необходимо попасть в конкретное место, Gemini может идентифицировать пункт назначения из переписки или записи в календаре, открыть соответствующее приложение для совместных поездок, выбрать наиболее подходящий вариант и подготовить вызов. Здесь важна способность работать через границы приложений и воспринимать контекст из различных источников данных.
Демонстрация на сцене: заказ пиццы из семейного чата
Во время презентации новых агентных возможностей Google продемонстрировала практический сценарий, в котором Gemini помогает организовать заказ пиццы, основываясь на информации в семейном групповом чате. Демонстрация была предварительно записанным видео, однако в нем шаг за шагом было проиллюстрировано, как искусственный интеллект способен превратить переписку в свободной форме в конкретный, структурированный план действий.
Этот пример был выбран осознанно - это обыденная, относительно простая задача, однако она включает в себя несколько последовательных шагов: сбор предпочтений, уточнение выбора, конфигурирование заказа и подтверждение. Именно такая цепочка многоэтапных действий лучше всего иллюстрирует потенциал агентного ИИ.
Анализ разговора и создание заказа
В демонстрации пользователь попросил Gemini просмотреть ветку семейного чата и выяснить, что каждый хочет заказать. Система проанализировала сообщения в свободной форме, идентифицировала конкретные предпочтения (например, вид пиццы, добавки или диетические ограничения) и структурировала эту информацию в четкое резюме.
Технически это означает несколько одновременных процессов: понимание естественного языка, распознавание сущностей (например, названия блюд, количества), сохранение контекста и разрешение конфликтов. В результате пользователю был показан наглядный черновик заказа, в котором были обобщены предпочтения всех участников разговора. Этот шаг демонстрирует переход от простой генерации текста к структурированной поддержке принятия решений.
Интеграция с приложением доставки (Grubhub)
На следующем этапе Gemini была поставлена задача оформить заказ в конкретной пиццерии, используя платформу доставки Grubhub. На видео было видно, как система переходит в приложение, выбирает необходимые позиции и конфигурирует заказ в соответствии с ранее подготовленным резюме.
Это важный аспект, так как он подтверждает способность взаимодействовать со сторонними приложениями не только на уровне данных, но и на уровне пользовательского интерфейса. Gemini по сути действует как посредник между намерением пользователя и функциональностью конкретного приложения - он «кликает», выбирает опции и подготавливает корзину. Такая интеграция требует технического согласования с разработчиками приложений и соответствующих механизмов доступа для обеспечения безопасной и предсказуемой работы.
Подтверждение пользователя и завершение заказа
Несмотря на высокую степень автоматизации, окончательное решение по-прежнему остается в руках пользователя. Когда заказ был подготовлен, система отправила уведомление с приглашением просмотреть детали и подтвердить отправку. Только после подтверждения пользователя было выполнено окончательное действие.
Значение агентного искусственного интеллекта и направление развития
Агентный искусственный интеллект знаменует качественный переход от реактивных систем к проактивным цифровым агентам. Если до сих пор большинство решений ИИ функционировали как механизмы «вопрос-ответ» или генераторы контента, то новая парадигма предполагает способность интерпретировать цель пользователя, разделять ее на операционные шаги и выполнять эти шаги в реальных средах приложений. Это существенно меняет как технологическую архитектуру, так и дизайн пользовательского опыта.
Google с Gemini пытается позиционировать себя в авангарде этого перехода, акцентируя внимание не на наборе отдельных функций, а на новой модели взаимодействия между человеком и устройством. Этот подход основан на предположении, что будущая конкуренция в области ИИ будет происходить не только на уровне точности или скорости моделей, но и в способности безопасно и эффективно действовать в качестве цифрового посредника между пользователем и широкой экосистемой услуг.
Gemini как помощник продуктивности, а не просто чат-бот
Традиционный чат-бот реагирует на конкретный ввод и генерирует ответ. В свою очередь, Gemini позиционируется как помощник продуктивности - система, способная поддерживать контекст, анализировать несколько источников информации и выполнять действия от имени пользователя. Это различие фундаментально.
Модель помощника продуктивности означает, что взаимодействие с устройством становится целеориентированным. Пользователь формулирует намерение («забронируй столик», «найди самый выгодный перелет», «обобщи эту переписку»), и система сама определяет необходимые подзадачи. Это требует механизмов планирования более высокого уровня, более длительного поддержания контекста и более тесной интеграции с API приложений или пользовательскими интерфейсами.
С бизнес-перспективы это также меняет роль ИИ в устройстве. Вместо того чтобы быть дополнительной функцией или отдельным приложением, помощник становится центральным слоем координации между пользователем и цифровой средой. Если эта концепция закрепится, она может снизить частоту прямого взаимодействия с приложениями и переориентировать привычки пользователей на командно-ориентированный рабочий процесс.
Автоматический просмотр в Chrome и интеграция в среду Android
Важным шагом в этом направлении является способность Gemini автоматически просматривать веб-страницы от имени пользователя в браузере Google Chrome. Это означает, что система может самостоятельно открывать страницы, анализировать их содержимое, сравнивать информацию и возвращать структурированный результат. Эта функциональность служит основой для более широкой агентной деятельности - если ИИ способен безопасно навигировать в веб-среде, следующим логическим шагом является аналогичная способность оперировать на уровне операционной системы.
Интеграция в среду Android расширяет эту концепцию. В отличие от браузера, где действия происходят в одном приложении, на уровне Android необходима координация между несколькими приложениями, системными разрешениями и механизмами безопасности. Это делает техническую реализацию более сложной, но и гораздо более влиятельной, так как ИИ становится горизонтальным слоем во всей экосистеме устройства.
Apple Intelligence и нереализованные обещания Siri
Когда Apple представила свое видение искусственного интеллекта следующего поколения под брендом Apple Intelligence, это было позиционировано как фундаментальный поворот в экосистеме компании. Центральным элементом в этой стратегии была существенно улучшенная версия Siri, которая должна была быть способна понимать контекст пользователя, анализировать содержимое на экране и выполнять действия в нескольких приложениях. Однако, несмотря на амбициозные демонстрации, большинство этих функций до сих пор не стали публично доступными.
Функции, представленные на WWDC 2024
Во время WWDC 2024 Apple продемонстрировала ряд предварительно записанных сценариев, в которых Siri действовала как полноценный цифровой помощник. Была обещана глубокая интеграция на системном уровне, которая позволила бы помощнику получать доступ к данным приложений, анализировать содержимое и выполнять задачи от имени пользователя.
На презентациях Siri была способна реагировать на сложные, контекстуальные запросы, которые выходили за рамки выполнения простых команд. Было подчеркнуто, что новая архитектура объединит обработку, происходящую на устройстве, с ресурсами облачных вычислений, обеспечивая как конфиденциальность, так и высокую функциональность. Однако эти примеры остались на уровне демонстрации, и реальное внедрение функций было отложено.
Действия между приложениями и понимание содержимого экрана
Одним из самых впечатляющих продемонстрированных аспектов была способность Siri понимать то, что видно на экране, и действовать, основываясь на этой информации. Например, пользователь мог попросить добавить адрес из переписки в карточку контакта конкретного лица. В таком сценарии помощник идентифицировал бы необходимую информацию в сообщении, открыл бы приложение контактов и обновил бы соответствующую запись.
Эта функциональность означает переход от изолированного выполнения команд к семантическому пониманию рабочего пространства пользователя. Технически это требует анализа содержимого экрана, распознавания сущностей и выполнения безопасных действий между приложениями с соблюдением модели системных разрешений. Именно такой механизм действий между приложениями считается одним из главных элементов агентного ИИ.
Использование личного контекста (пример с электронной почтой и информацией о рейсе)
Еще одним важным обещанием была способность использовать личный контекст пользователя, например, электронные письма, записи в календаре или сообщения, чтобы предоставлять точные и персонализированные ответы. В демонстрации был показан сценарий, где пользователь спрашивает, когда прилетит рейс его матери. Siri была способна идентифицировать соответствующую информацию в электронном письме, извлечь детали рейса и сразу предоставить ответ.



