活动报名:OpenAI 和 Thinking Machines 都押注的实时交互模型,下一步往哪走?丨iRTE 2026

过去一年,OpenAI、Thinking Machines Lab 等多模态团队开始把注意力从「生成更拟人的语音回答」,迈向一个更难的问题:AI 如何真正参与一场实时发生的互动。

 

全双工模型让智能体边听边说,全模态让语音、视觉等信息协同判断,而交互模型又往前一步:此刻这场互动正在发生什么,下一步应该如何思考、响应和行动。

 

f1ad6e73e550f673dd3d8081607758e3

 

 

10 月 23 日下午,iRTE 2026「对话式 AI 技术专场」将围绕 「互动即智能:对话式 AI 与交互模型」,一起讨论这些正在发生的变化。

 

本场论坛由 西北工业大学计算机学院教授、博士生导师谢磊,与 声网多模态负责人吴渤 共同担任出品人。

 

从音频智能、多模态交互、多说话人语音识别,到语音生成与交互模型,来自高校与产业一线的研究者、开发者,将从不同技术路径回答一个共同的问题:AI 真正进入实时互动,还需要具备哪些能力?

主题分享丨AI 如何学会实时互动?

从音频智能、多模态交互,到多说话人识别、实时语音生成,再到下一代交互模型,五场主题分享将从不同环节拆解 AI 如何实现「实时互动」。

 

  • 谢磊@西北工业大学|基础模型时代的音频智能:从理解与生成走向交互与智能体

  • 王泽源@声网|多模态模型与实时语音交互

  • 李明@香港中文大学(深圳)|复杂多人交互场景下的目标人声抽取与多说话人语音识别

  • 王新升@Soul|Loxi-Speech:为实时交互而生的语音合成

  • 杨学锐@阶跃星辰|关于下一代交互模型的技术思考

圆桌|实时交互模型的落地和探索

来自模型、语音与产品一线的嘉宾将一起讨论:实时交互真正进入产品,还要跨过哪些模型、工程与体验门槛?

 

圆桌嘉宾

 

  • 徐广健|亮源新创音频技术负责人

  • 谢之非|NTU PhD,VoiceMem、Mega-ASR、Mini-Omni 作者

  • 杨斌丨BreezeBlue AI 创始人 & CEO

  • 王新升|Soul 洛希事业部负责人、Loxinity co-founder

 

主持人

 

  • 吴渤|声网多模态负责人

 

如果你正在做语音交互、多模态模型、实时 AI 应用,欢迎来到现场!

 

10 月 23 日 14:00–17:00,iRTE 2026 实时智能大会,北京悠唐皇冠假日酒店。

 

门票限时免费,点击阅读原文或扫描海报二维码报名,加入我们!

 

a736eb952702278ac35ebeb642d7b130

 

image

 

 

4b1fd6b4b3fdc8300365e6706fabb8ef

 

 

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

 

dea0bb281db564c16ddb1bcbf0225a2b

 

posted @ 2026-09-29 09:52  RTE开发者社区  阅读(10)  评论(0)    收藏  举报