Нові Apple Watch зможуть допомагати згадати, що щойно сказав співрозмовник, підсумовувати розмови протягом дня та розпізнавати звуки навколо. На перший погляд це схоже на постійно увімкнений диктофон, але Apple побудувала систему за принципово іншою схемою: компанія заявляє, що звичайного аудіозапису пристрій не створює.
Йдеться про нову систему Audio Intelligence для Apple Watch Series 12 та Apple Watch Ultra 4. Її робота базується на чипі S11 та спеціальному захищеному середовищі Secure Exclave.
Чотири нові можливості Apple Watch
Audio Intelligence об’єднує чотири функції.
Siri Recap створює короткі підсумки розмов протягом дня. Live Rewind дозволяє повернутися до останніх 15 секунд розмови та побачити їх у вигляді тексту.
Ще дві функції працюють зі звуками навколо користувача. Music Recognition автоматично визначає музику за допомогою Shazam, а Sound Recognition розпізнає важливі звуки, зокрема сирени, сигналізації та дверні дзвінки.
Але найбільш незвичайна частина системи — не самі функції, а спосіб обробки аудіо.
Apple Watch аналізує звук, але не зберігає його як запис
У Apple пояснюють, що Audio Intelligence не створює аудіофайлів, до яких могли б отримати доступ watchOS, застосунки, користувач або сама Apple.
Мікрофон передає звук у захищений буфер усередині Secure Exclave. Це апаратно ізольована частина чипа, яка працює окремо від основної системи. Дані в цьому буфері постійно перезаписуються новими.
Якщо спростити, Apple Watch не працює як диктофон, який накопичує аудіофайли. Система тримає лише короткий потік даних для аналізу, після чого старий звук замінюється новим.
Що відбувається з розмовою
Для Siri Recap процес складається з кількох етапів.
Спочатку S11 визначає, чи є поблизу мовлення. На цьому етапі система не транскрибує розмову і не записує її.
Якщо виявлено розмову, звук потрапляє до захищеного буфера Secure Exclave на Apple Watch. Потім він шифрується та передається до Secure Exclave спареного iPhone.
На iPhone захищене середовище перетворює аудіо на текст. Далі локальна мовна модель скорочує його до менш ніж половини початкової довжини, залишаючи основний зміст і прибираючи повтори, слова-паразити та несуттєві фрагменти.
Після обробки сире аудіо видаляється. За документом Apple, воно більше не зберігається ні в Secure Exclave годинника, ні в Secure Exclave iPhone.
Навіщо тут Private Cloud Compute
Після скорочення тексту його зашифрована версія передається до Private Cloud Compute, де створюється підсумок розмови.
Для формування контексту система може використовувати додаткові дані. Наприклад, Now Playing допомагає зрозуміти, що джерелом звуку могла бути музика або подкаст, а календар може допомогти сформувати точнішу назву підсумку.
Також можуть використовуватися загальні відомості про місце — наприклад, дім, робота чи школа, а також місто, область або країна. Точне місцезнаходження та конкретні точки інтересу до цього процесу не включаються.
Apple заявляє, що дані в Private Cloud Compute не зберігаються та недоступні навіть самій компанії. Після створення підсумку результат повертається на пристрій.
Live Rewind: останні 15 секунд розмови
Інша функція — Live Rewind — працює за простішим сценарієм.
Уявімо, що співрозмовник швидко назвав книгу, рецепт або незнайомий термін, а ви не встигли запам’ятати. Подвійне натискання Digital Crown дозволяє отримати текст останніх 15 секунд розмови.
Apple Watch постійно підтримує циклічний буфер. Нові аудіодані замінюють старі, тому звук не накопичується.
При цьому Live Rewind не працює непомітно. Кожна активація потребує подвійного натискання Digital Crown. Після цього годинник видає звуковий сигнал, показує анімацію та індикатор мікрофона.
Отриманий текст відображається на Apple Watch, а через 30 секунд після згасання дисплея зникає. За бажання його можна зберегти в Siri.
Годинник також розпізнаватиме музику та важливі звуки
Audio Intelligence працює не лише з людською мовою.
Під час визначення музики Secure Exclave створює акустичний підпис композиції. Це компактне представлення звуку, яке, за описом Apple, не можна перетворити назад на оригінальний аудіозапис.
Саме цей підпис надсилається серверам Shazam для пошуку композиції. Якщо система знаходить збіг, Apple Watch показує назву пісні та виконавця.
Sound Recognition працює безпосередньо на годиннику. Він може визначати певні звуки, наприклад сигналізацію, дверний дзвінок або плач дитини, після чого надсилає користувачу сповіщення.
Apple окремо наголошує: звук для цієї функції не транскрибується і не передається.
Що відбувається із приватністю
Саме приватність є однією з центральних особливостей Audio Intelligence.
Apple стверджує, що необроблений звук не зберігається як доступний аудіофайл. Він проходить обробку в захищеному апаратному середовищі, а після виконання необхідного етапу видаляється.
Для збережених текстових результатів Siri Recap та Live Rewind використовується наскрізне шифрування iCloud за умови двофакторної автентифікації та встановленого коду пристрою. Apple заявляє, що ключів шифрування не має.
Користувач також може сам визначати, коли Siri Recap працюватиме. Функцію можна обмежити певними годинами або місцем, вимкнути через налаштування чи активувати вручну з Control Center.
Що буде, якщо Apple Watch або iPhone загублять
Apple передбачила окремий захист і для такого сценарію.
Ключі шифрування прив’язані до конкретного пристрою та мають обмежений термін дії. Вони регулярно змінюються й автоматично стають недійсними.
Якщо пристрій втрачено, його можна дистанційно стерти через Find My. Після цього ключі спарювання Secure Exclave також стають недійсними.
💡 Цікаво знати
Siri Recap не створює дослівну розшифровку розмови. Система формує стислий текстовий підсумок і не визначає, хто саме говорив.
Apple описує такий результат як короткі нотатки про зміст розмови, а не її повну стенограму.
❓ Чи означає це, що Apple Watch постійно слухатиме користувача?
Технічно мікрофон бере участь у постійному аналізі звуку для роботи відповідних функцій. Однак Apple стверджує, що сирий звук обробляється у захищеному середовищі та не створюється як звичайний аудіозапис, доступний системі чи застосункам.
Для Live Rewind додатково передбачене явне ручне ввімкнення кожного використання — подвійним натисканням Digital Crown.
Чому це важливо
Audio Intelligence показує інший підхід до голосових функцій на носимих пристроях. Apple хоче, щоб годинник міг аналізувати навколишній звук і допомагати користувачу згадувати сказане, але водночас обмежити існування сирого аудіо та ізолювати його обробку на апаратному рівні.
Саме Secure Exclave у S11 є ключовим елементом цієї схеми: він створює окремий захищений контур для роботи з аудіоданими.
У результаті Apple Watch отримує своєрідну «пам’ять» для звуку, але не у звичному сенсі. Годинник може допомогти відновити зміст розмови або визначити звук навколо, не перетворюючи весь навколишній світ на архів аудіозаписів.







