让车听懂你:车载语音自然交互的工程真相
当我们谈论智能座舱时,真正改变体验的,往往不是又多了一项可被唤醒的功能,而是汽车能否在恰当的时刻,准确理解人的意图,并以自然、可靠的方式完成任务。
那么,车载语音自然交互的背后,究竟需要哪些关键能力?汽车如何在真实用车场景中更准确地理解用户意图?围绕这些问题,我们采访了赛轮思AI产品工程副总裁吴边。在本次访谈中,吴博士从工程实践出发,解读了车载语音自然交互背后的技术逻辑,以及智能座舱正在发生的变化。

我们的目标,是让汽车不只是被动响应指令,而是能够主动理解你的意图、所处场景,以及你真正想完成的任务。
以下为访谈内容节选,完整访谈请观看视频。
团队使命与聚焦方向
问:您团队的核心使命与研发重点是什么?
车载语音背后的工程真相
问:从工程视角看,稳定、响应与准确这三项能力应如何理解?
而从工程角度看,这绝不是依靠单一语音识别模块就能实现的。它背后是一整套车规级人车交互系统,且所有设计原则都必须以安全为前提。
稳定性,是在路噪、多人交谈和网络波动下,仍能可靠理解、执行任务,并保障离线或弱网时的核心功能可用。响应速度,是快速唤醒、实时理解、立即执行,减少驾驶员等待与注意力分散。准确性,则要求系统能够在复杂声学环境中,准确理解导航、车控、娱乐等多场景指令,以及多轮对话中的上下文。
归根结底,这三项能力都服务于驾驶安全:让驾驶员尽量手不离盘、眼不离路。
多音区交互突破——车内跨座位协作对话
问:最近有哪些令您印象深刻的车载交互体验?它是如何实现的?
传统多音区能力可以区分发声座位,但通常会把每一个请求视为独立任务。真实的车内对话却常常是协同发生的:一个人先提出目标,另一个人补充偏好,其他乘客再进一步提出具体要求。真正智能的助理,需要理解这些表达可能共同指向同一项任务。
这背后依赖音区感知、对话管理、座舱噪声鲁棒性和全座舱上下文理解等核心能力,同时还要应对多人重叠发声、环境噪声、跨座指代模糊等复杂场景。这样的能力不仅先进,也正在走向量产,并将应用于我们OEM合作伙伴的新车型。
OEM的真实痛点与工程回应
问:车企在落地车载大模型时,主要面临哪些挑战?赛轮思AI如何应对?
第二个挑战是全球化适配。同一款车型面向不同国家和地区销售时,既要理解当地语言表达、用户习惯与监管要求,又要保持统一的品牌体验。Cerence xUI通过持续迭代多语言能力与区域合规优化,支持OEM面向全球市场部署车载AI体验,有助于减少重复开发、缩短功能上市周期。
端云混合架构的真实价值
问:行业为何普遍发力端云混合AI?
端侧守住了基础交互的体验底线,云端则不断拓展交互能力的上限。依托自研的CaLLM® Edge端侧小模型,大量AI能力可以直接在车端本地运行,用户的直观感受是响应更快、网络波动时仍可稳定使用、个人数据得到更充分保护;对车企而言,这种架构能够提升系统整体韧性,帮助品牌打造差异化的智能座舱体验。
重塑车载语音体验的未来趋势
问:未来两年,哪些趋势将重塑车载语音体验?
第一,对话式任务导航。 未来,用户只需通过一次自然对话描述完整的行程需求——途经点、个人偏好、时间安排、充电需求或用餐选择——系统就能生成覆盖全链路的出行计划。随着大语言模型与地图、POI(兴趣点,即地图上的餐厅、景点等位置信息)、实时路况及用户偏好的深度融合,导航将从"输入目的地"升级为"智能出行规划",用户也可以随时调整行程,而无需重新发起任务。
第二,多模态情感交互的规模化落地。 以语音为核心基础,融合视觉、手势、触控等交互方式;结合驾驶员监测系统,车辆可以更准确地理解用户的疲劳程度、注意力状态与情绪变化。例如,当系统识别到长途驾驶中的疲劳迹象时,可主动建议就近休息,同步调整氛围灯或切换舒缓音乐,让用户感受到车辆正在主动提供关怀。
第三,座舱与智驾的跨域深度融合。 座舱将成为全域交互的核心入口,与智能驾驶系统之间的协同会更深入。通过打通数据链路与控制链路,车辆能够逐步形成"自主感知、智能决策、顺畅执行"的闭环,最终带来全场景下更无缝的交互体验。
这些并非抽象概念,而是正在发生的行业变化:车载交互正从单一语音指令,升级为理解意图、以任务完成为导向的AI;从单纯的语音对话,拓展为能够读懂情绪的多模态陪伴;从功能彼此割裂的座舱,演进为跨域协同的智能空间。在赛轮思AI,这些能力已在与车企和合作伙伴的协同中持续落地,并将成为Cerence xUI体验的重要组成部分。
受访人:
吴边(Brian Wu),赛轮思AI产品工程副总裁, 领导公司旗舰产品Cerence Assistant与Cerence xUI™的工程团队。
微信文章
探索更多
未来出行体验
