Siri是由苹果公司开发的一款智能语音助手,在英语里它的全称叫做“Speech Interpretation and Recognition Interface”,即“语音识别和理解接口”。不同于一般的语音转文字软件,它是集成了自然语言处理、机器学习以及系统的深度融合之后产生的交互中心,在2011年的iPhone 4S上首次亮相之后就遍布了整个iOS、iPadOS、macOS和watchOS四大平台之上,并且可以使用超过几十种的语言来工作;除了能够完成打电话、发送信息、设定闹钟等基本任务之外,还可以根据上下文做出反应、调用第三方应用程序并且进行多次对话,并且会随着用户的发音习惯的变化而不断调整自己。它的名字既体现了技术的本质也带有浓浓的人文关怀意味:英文名取自于北欧语系中的词汇,“胜利之引导者”正如同它一样静静地等待着被唤醒,在数亿台设备之中默默地倾听每一个声音并把它们变成实际行动。

Siri名称所包含的技术和人文学义要从这两个方面去理解
完整的名称是“Speech Interpretation and Recognition Interface”,它准确地描述了该技术的核心组成部分:Speech代表的是对语音信号进行采集以及建立声学模型的过程,Interpretation指的是对语义进行分析并识别出用户的意图(比如能够理解到“把明天早上10点的会提前半个小时”的含义),Recognition包括了声音特征匹配和多种语言发音鲁棒性的处理过程,Interface则是表示它是作为一个系统的接口来工作的,并不是单独存在的,在使用过程中会调用Core ML框架、设备端神经网络引擎以及iCloud同步用户的习惯数据等。而Siri这个名字来源于挪威语中的一个词,“Siri”在古代诺尔斯语里就是个女性的名字叫“胜利之导”,苹果公司的人在起名字的时候考虑到了发音简单易懂、没有宗教或者政治上的争议并且给人以亲切的感觉(短单词加上元音结尾)。
第二部分Siri功能实现所依靠的三个底层支撑系统
首先从设备端实时处理能力来看:自A11芯片之后的所有iPhone都配备了专门的神经网络引擎,在唤醒词“嘿 Siri”的全程本地识别过程中不需要联网;然后语音指令经过加密之后被上传到苹果服务器上,并且由分布式的ASR集群进行转写工作,之后再交给NLU模型来分析出用户的意图,最后通过System Services API去触发相应的系统模块。其次就是上下文感知机制了:Siri会保存最近三次对话的主题信息(比如先是询问了上海的天气情况,接着又询问了北京的情况),并且还会把用户的日历、通讯录以及邮件等隐私授权数据结合起来形成个性化的回答。最后则是持续的学习闭环过程:每当有人告诉Siri它犯了一个错误的时候(例如直接修改掉被识别出来的文字),那么这个例子就会被差分隐私脱敏之后加入到模型中去进行微调的工作当中来,但是原始的声音文件永远不会被保存下来——这样的做法已经得到了ISO/IEC 27001的认可。
第三部分中文Siri本地化的演变过程存在清晰的技术里程碑
在2012年的iOS 6中加入了简体中文的语音输入功能,但是只能用于简单的命令式的短句;到了2016年的iOS 10就加入了端到端的中文语音识别模型,并且可以识别出带有方言成分的普通话句子;到了2020年的iOS 14实现了离线语音识别,在没有网络的情况下也可以完成诸如“打开备忘录”、“静音”这样的高频操作;而到了2023年的iOS 17则对中文语境的理解能力进行了改进,在处理跨应用程序的操作时准确率达到92.7%,这是根据苹果官方开发者的统计数据得出的结果。
因此可以说,Siri是严谨的技术产品和人文主义的设计理念相结合的结果——它的技术参数可以被验证出来,它的人文表达很谨慎而且合乎逻辑,它的功能发展一直都在围绕着“减少操作的心智负担”的主要目的进行。






评论区 (0)
暂无评论,快来抢沙发吧!
发表评论