来源:中国产业新闻网 2026-09-22 15:15:13
展会人声鼎沸,酒会笑语喧哗,数十组对话相互交织,环境噪音常突破85分贝。对出海商务人士而言,这是高频真实场景,却是传统翻译设备的 "死亡测试场":手持翻译机、手机App、翻译耳机在安静会议室尚能应付,一旦置身嘈杂现场,多声源混杂、人声互相干扰,设备分不清该拾取哪段声音,错译、漏译、乱译接踵而至。跨语言沟通沦为反复复述的低效拉锯。翻译大模型已足够成熟,但"听不清",就谈不上 "译得准"。
讯飞AI眼镜,以5颗气导麦克风+1颗骨传导麦克风组成5+1麦克风阵列,创新落地唇动识别多模态降噪技术,实现 "看谁译谁" 的独特体验,把视觉感知融入拾音降噪链路,从源头破解嘈杂环境收音难题,让翻译从 "听得见" 进阶到 "译得准"。

5+1 麦克风阵列:构筑硬件拾音底座
整机约40g,在轻量化机身内布局5颗气导麦克风与1颗骨传导麦克风,构建六通道麦克风阵列。5颗气导麦克风分布于镜腿,依托波束成形算法区分远近声源、抑制侧后方杂音,增强目标方向人声,完成环境声音全景采集;1颗骨传导麦克风不依赖空气传声,通过振动拾取发声信号,过滤大量空气传播的背景噪音,弥补气导麦克风在强噪声下的信号缺损。
传统翻译工具(手持翻译机、翻译耳机)仅靠气导麦克风做声学降噪,当多人同时说话,多个有效人声混杂,单纯音频算法难以锁定翻译目标,极易把旁人对话纳入识别 —— 这正是展会翻车的核心根源。5+1阵列完成了声音维度的多层过滤,但讯飞并未止步,而是给AI"加上眼睛"。
唇动识别多模态降噪:复刻 "鸡尾酒会效应"
人类身处喧闹酒会,能盯着对话对象、观察其唇部神态,过滤周遭嘈杂听懂眼前人发言,这就是 "鸡尾酒会效应"。讯飞AI眼镜通过软硬自研,将这套感知机制移植到穿戴设备上。
眼镜搭载1200万109°广角前置摄像头,实时捕捉视野内人物唇部运动。系统一边接收多路音频流,一边解析唇部动态画面,将 "声音信号" 与 "视觉特征" 融合计算:当画面中某人嘴唇产生说话动作,系统即判定其为沟通目标,定向增强该方位音频,优先解析其语音并投射译文。视线看向谁,就拾取谁的声音 ——看谁译谁。唇动信号在此扮演 "目标锁定锚点",即便噪声严重干扰音频,只要捕捉到唇部动作即可锁定声源,显著降低识别错误。
落到真实场景:展台上多名客商交谈,目光看向海外客户,镜片实时呈现其发言译文;视线转向另一人,翻译源无缝切换,无需转动设备、手动切模式,跟随自然视线完成翻译切换,跨语言沟通回归人与人的平视对话。这套多模态降噪能力深度服务旁听同传、面对面翻译、线上同传、通话翻译四大体系,122种语种(包含方言及口音)互译在展会、酒会、跨境洽谈等复杂场景全程生效。

对比传统方案与竞品:全栈自研构筑壁垒

这套方案并非现成组件拼接,而是全栈自研成果:从麦克风阵列硬件布局、端侧图像处理、唇动特征提取,到多模态融合模型、语音识别、翻译大模型,全链路自主研发迭代。硬件层面约40g机身内容纳多麦克风、摄像模组、显示与电池;算法层面解决端侧算力约束,兼顾效果与功耗;上层对接讯飞星火翻译大模型,叠加17+1行业专业术语库,兼顾通用与商务专业场景精度。
权威评测印证了这套技术体系。IDC《中国AI翻译技术评估》中,科大讯飞在翻译速度、翻译效果、翻译专业度、翻译拟人度、产品应用成熟度、商业化规模、研发投入、用户推荐度8大维度全部登顶,拿下6项满分,充分证明其在技术、产品落地的综合领先。
优秀的穿戴翻译设备,不能只追求 "翻译算法强大",更要解决 "信号如何被清晰获取" 这一前置命题。从 "看谁译谁" 到 "看谁译准",5+1麦克风阵列叠加唇动识别多模态降噪,是讯飞给出的行业答案 —— 把实验室技术转化为展会、酒会等嘈杂场景可感知、可落地的沟通体验,让AI翻译真正走出安静房间,服务千变万化的现实世界。
【广告】本内容为广告,相关素材由广告主提供,广告主对本广告内容的真实性负责。本网发布目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,广告内容仅供读者参考。
茶香墨韵叙乡情 泉台一家庆中秋—— 丹福香承办 “泉台一家亲・名家书法茶文化交流活动”