Treble获1800万美元,为机器人补听觉感知
机器人感知领域,视觉和触觉近期讨论较多,听觉相对安静。Treble Technologies正在将声音在物理空间中的传播转化为可仿真、可生成的数据。
该公司2020年由Finnur Pind和Jesper Pedersen在冰岛雷克雅未克创立,近期完成1800万美元A-2轮融资,由Paladin Capital Group领投,老股东KOMPAS VC、Frumtak Ventures、欧洲创新委员会基金跟投。累计融资约3600万欧元。
Pind的判断是,在实验室表现良好的AI模型和设备,遇到混响、背景噪声或不熟悉的物理环境时就会失效。
声音是物理现象,不是信号处理问题。Treble的技术路线基于物理的声学建模,模拟声音如何在空间中传播,结合声学仿真、数字孪生和合成数据生成,让开发者在造出物理原型之前就能评估产品表现。
这与传统音频处理方法不同。传统方法主要在信号层面做降噪、增强、识别,而Treble从空间几何、材料属性、声源位置的物理关系出发,计算声音在特定空间里的传播效果。房间的墙壁材质、家具摆放、空间尺寸都会改变声音的反射和混响模式。将这些参数输入模型,就能生成接近真实空间的声学数据。
亚马逊和罗技已经在使用Treble的平台测试音频产品。亚马逊高级音频研究经理Wontak Kim表示,用虚拟声学环境评估音频质量、测试物理测试无法复现的场景,是他们开发Alexa的重要环节。这指出了实际需求:许多声学场景在真实环境中很难复现或控制。
例如,特定的混响条件、特定位置的背景噪声、多个声源同时存在的情况,要在真实房间里精确搭建成本很高。仿真环境让这些场景可以按需生成和反复测试。
机器人只靠视觉,听不到拐角后面的事。Paladin的投资者François Ruether认为,今天的机器人基本只靠视觉感知,能检测前方有什么,但无法解读有人在另一个房间摔倒或拐角处发生碰撞这类声音。这指向物理AI的一个能力缺口。
视觉有视线限制,拐角后面、墙后面、另一个房间里发生的事情,摄像头看不到,但声音能传过来。一个完整的感知系统需要同时处理看到和听到的信息,才能对周围环境有更完整的判断。Treble这笔融资的落点,是在美国市场扩张的同时加大物理AI方向的投入,因为语音和音频正在成为智能机器的重要接口。
声学仿真从音频产品测试延伸到机器人感知,中间隔着一层转换。测试音箱和耳机的声学表现,关心的是音质和降噪效果;机器人听觉关心的是事件识别和空间定位,比如声音从哪个方向来、是什么类型的声音、是否代表异常情况。
Treble已有的物理声学建模能力能否支撑这类任务,取决于其仿真数据能否覆盖机器人实际会遇到的声音场景。亚马逊和罗技的用例证明了它在消费音频领域的价值,机器人方向还在早期。