无法自然交流的机器人将难以被采用
人形机器人已成为大型科技活动中的常客,展示了令人印象深刻的运动和操作能力。然而,据专注于音频AI的Treble Technologies联合创始人贡纳·彼得·豪克松称,机器人的交流和听觉感知仍然明显落后。
豪克松认为,机器人要在现实世界中运行,需要的不仅仅是视觉。现实环境嘈杂混乱,充满背景噪音和混响。当前的机器人音频系统在此类条件下往往会失灵。机器人行业优先发展视觉,因为数据丰富、模拟工具成熟,但这导致音频被忽视。NVIDIA Isaac Sim等平台加速了视觉领域的进展,但用于训练的环境大多是无声的。
Treble从进化角度审视这一差距。人类将15%至20%的感官处理能力分配给听觉,仅次于视觉。这表明声音对于沟通和情境感知至关重要。如果没有强大的听觉感知,机器人将难以被人类接受。
机器人在沟通方面被要求的标准高于运动方面。听错或反应不当的机器人会令人沮丧,破坏信任。这就是音频在采用过程中显得格外重要的原因。问题不仅在于技术性能,还在于信任的破裂。
音频数据难以获取和扩展。与视觉数据不同,它需要空间关系和环境声学等上下文信息。模拟也具有挑战性,因为声音受波动物理学支配,精确建模计算要求高。许多现有系统依赖简化或非物理模型,限制了其泛化能力。
Treble正致力于通过构建物理精确的声学模拟来改变这一范式。该公司生成高保真声学数据用于训练,模拟到现实的差距极小。这已被多家全球领先科技公司采用。对机器人行业而言,这是一个转折点。随着视觉和运动能力变得司空见惯,沟通将成为差异化关键。
Treble正积极寻求与认识到这一转变的机器人及物理AI团队合作。该公司认为,成功的机器人将取决于其沟通的自然度和直观性。能工作的机器人与被接受的机器人之间的区别,很大程度上在于沟通,而沟通从根本上讲是听觉层面的。
贡纳·彼得·豪克松是Treble Technologies的联合创始人兼首席商务官。他在销售、市场营销和业务发展方面拥有十多年经验。Treble总部位于冰岛雷克雅未克,致力于构建高保真声学模拟基础设施,使声音从模拟走向现实,应用于建筑、设备、车辆和智能机器。