Диктовка выигрывает у клавиатуры там, где руки заняты или мысль надо поймать на ходу. Разрыв в скорости реальный: речь идёт порядка 150–200 слов в минуту, набор — около 51,56 слова в минуту по замеру 136 миллионов нажатий у 168 тысяч человек (Дхакал и др., CHI 2018, с оговорками про физическую клавиатуру и перепечатывание готового текста).
Вопрос не в том, диктовать или печатать. Вопрос в том, что именно уходит с устройства в момент диктовки и где оно остаётся.
Что уходит вместе со словами
Распознавание речи долгие годы было слишком тяжёлым для телефона, поэтому звук отправляли на сервер и получали обратно текст. На сервере при этом остаётся не только результат, но и исходник — аудиофайл.
Часть этих файлов слушают люди. Это не догадка: в 2019 году об этом отчитались три независимых редакции.
- 10 апреля 2019 года Bloomberg описал, как сотрудники Amazon прослушивают фрагменты записей Alexa.
- 10 июля 2019 года бельгийская общественная телерадиокомпания VRT NWS опубликовала расследование про подрядчиков, слушающих записи Google Assistant.
- 26 июля 2019 года The Guardian описал ту же практику у подрядчиков Apple по Siri, включая случайно записанные фрагменты.
Объём тогда назвала сама Google: изданию Wired компания сказала, что прослушивается около 0,2% всех записей. Цифра выглядит маленькой ровно до того момента, пока не подставить в неё общее количество обращений.
Задача прослушивающего — оценка качества: сработал ли помощник случайно или намеренно и мог ли он вообще помочь с этим запросом. То есть случайные записи не побочный эффект процесса, а его прямой предмет.
Случайные срабатывания измерены
Отдельный вопрос — сколько записей возникает без вашего намерения.
Это померили. Работа Шёнхерра, Голлы, Айзенхофера, Виле, Колоссы и Хольца (Рурский университет в Бохуме и Институт Макса Планка по безопасности и приватности), «Unacceptable, where is my privacy? Exploring Accidental Triggers of Smart Speakers», опубликована в августе 2020 года.
Метод: автоматический поиск случайных срабатываний на 11 умных колонках 8 производителей, материал — обычные медиа: телепередачи, новостные выпуски, наборы аудиоданных. Поиск строился на произносительном словаре и взвешенном фонемном расстоянии Левенштейна.
Результат: сотни случайных срабатываний в основном анализе и более тысячи проверенных триггеров в опубликованном исследовательском наборе.
Отсюда следует то, что редко проговаривают: отправка звука начинается не тогда, когда вы обратились к устройству, а тогда, когда устройство решило, что к нему обратились. Это разные события, и второе случается чаще первого.
Что настроено у вас на самом деле
Здесь нужно разделить две разные вещи, которые обычно путают.
Отправка звука на сервер ради распознавания — это работа. Без неё в облачном режиме текста не будет.
Хранение вашего аудио для улучшения сервиса — это отдельная настройка, и по документации производителей она устроена не так, как принято думать.
У Apple «Улучшение Siri и Диктовки» — необязательная настройка, которую нужно включить самому. В её описании прямо сказано: включая её, вы соглашаетесь, чтобы Apple хранила и проверяла выборку ваших аудиозаписей и расшифровок. Отдельно оговорено, что данные могут храниться до двух лет для развития Siri, Диктовки, Поиска и связанных функций. Если стороннее приложение использует системное распознавание речи для транскрипции, аудио может отправляться в Apple.
У Google настройка голосовой и аудиоактивности по умолчанию выключена — записи не сохраняются в аккаунт, пока вы её не включите. Если её выключить после того, как она была включена, ранее сохранённое аудио само не удаляется: это отдельное действие. Автоудаление настраивается на 3, 18 или 36 месяцев.
Практический вывод простой. Первое, что стоит проверить, — не «слушает ли меня телефон», а включено ли у вас хранение аудио и настроено ли автоудаление. Это две галочки, и они находятся не в приложении помощника, а в настройках аккаунта.
Распознавание на устройстве
Отдельный слой — распознавание, которое идёт целиком внутри телефона или компьютера. Тогда звук не уходит никуда, потому что превращение в текст происходит на месте.
Функция называется в настройках по-разному — «распознавание речи на устройстве», «офлайн-распознавание»; иногда требуется однократно скачать языковой пакет.
Проверить включённость можно за минуту и без чтения документации: включите режим полёта и попробуйте продиктовать. Появился текст — распознавание идёт внутри устройства. Не появился — оно облачное.
Честная оговорка: на длинных сложных конструкциях точность локального распознавания обычно ниже облачной. Для коротких заметок и сообщений разница малозаметна, для юридических формулировок и фамилий — заметна.
Где диктовка проигрывает по существу
Отдельно от приватности есть чисто практические границы, и их полезно знать заранее.
- Шум. В машине с открытым окном распознавание съедает часть слов, и вечером расшифровывать нечего.
- Присутствие людей. При свидетелях формулировки смягчаются автоматически, и запись выходит обтекаемой.
- Длинные конструкции. Придаточные и вложенные обороты распознаются хуже коротких фраз.
- Имена и цифры. Самая частая категория ошибок; всё, что касается сумм и фамилий, требует немедленной вычитки.
- Диктовка вместо мышления. Наговорить можно много и быстро, и возникает ощущение сделанной работы. Через неделю это двадцать минут потока, из которого смысл ещё предстоит извлечь.
Последний пункт — тот же механизм, что делает голосовые заметки нечитаемыми: запись дешёвая, извлечение дорогое. Рабочее ограничение здесь простое: одна мысль — одна запись на три-четыре предложения.
Что сделать сегодня
- Проверить, включено ли хранение аудиозаписей в настройках аккаунта, и выставить автоудаление.
- Проверить режимом полёта, идёт ли распознавание на устройстве, и включить его, если оно доступно.
- Развести материал: бытовое — куда удобно, рабочие формулировки, суммы и чужие имена — туда, откуда звук не уходит.
Диктовка сама по себе не проблема и от неё нет смысла отказываться. Проблема в том, что по умолчанию она устроена как разговор при открытой двери, а закрывается эта дверь двумя настройками.
Источники
- Dhakal V., Feit A. M., Kristensson P. O., Oulasvirta A., «Observations on Typing from 136 Million Keystrokes», CHI 2018: https://dl.acm.org/doi/10.1145/3173574.3174220
- Bloomberg, 10.04.2019 — прослушивание фрагментов записей Alexa сотрудниками Amazon (по обзору Voicebot.ai): https://voicebot.ai/2019/07/29/report-apple-contractors-listen-to-siri-recordings/
- VRT NWS, 10.07.2019 — подрядчики, прослушивающие записи Google Assistant (там же)
- The Guardian, 26.07.2019 — подрядчики Apple и записи Siri (там же); доля прослушиваемых записей, названная Google изданию Wired, — около 0,2%
- Schönherr L., Golla M., Eisenhofer T., Wiele J., Kolossa D., Holz T., «Unacceptable, where is my privacy? Exploring Accidental Triggers of Smart Speakers», 2020 — 11 колонок, 8 производителей, более 1 000 проверенных триггеров: https://arxiv.org/abs/2008.00508
- Apple, «Siri, Диктовка и конфиденциальность»: https://support.apple.com/en-us/HT210657
- Apple, включение и выключение «Улучшения Siri и Диктовки»: https://support.apple.com/en-us/127070
- Google, управление аудиозаписями в истории приложений и веб-поиска (настройка выключена по умолчанию, автоудаление 3/18/36 месяцев): https://support.google.com/accounts/answer/6030020