声纹很早便被用于刑侦手段和司法证据。

美国 1994 年电影《燃眉追击》中就描述了这样一个桥段:情报专家仅凭一小段录音,判断说话人可能是“古巴人,35-45 岁之间,在美国东部受教育”等,然后用计算机进行比对,给出一个可信度分数——这虽然带有相当的文学加工,但也反映了人们对声音鉴定在司法领域应用的期待。

目前,声纹在司法领域主要以两种方式出现:

(1)计算机分析 + 人工判断:提取重音、基频、共振峰等特征,再由人类专家结合更多上下文信息做综合判断。

(2)直接使用声纹识别系统进行对比匹配。

需要指出的是,声纹会受到个体状态、情绪、环境噪声等影响,与指纹相比并不稳定,因此在司法证据中应谨慎使用。

除了在司法领域的应用,声纹识别的便捷性,使其在银行、电信、智能家居中逐渐推广。例如:手机银行验证:无需记密码,说句话即可验证身份;智能音箱付款:主人说话才会执行支付命令;家庭门禁系统:用声音开门,符合某些场景对便利和安全的需求。

不过,声纹识别在复杂环境(如远距离、噪音大、跨语言等)下的性能仍有待提升。有研究尝试将声纹与其他生物特征(如人脸识别)结合,形成多模态认证,以显著提高可靠性。在图 29.8示例中,通过将人脸与说话人映射到同一向量空间,可以综合两种模态进行身份验证。

将人脸与声纹统一到同一身份空间,实现多模态身份认证

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐