09 2026 档案
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、语音智能体测试平台 Egma 开源:把模拟通话写进代码仓库,发布前自动跑回归测试 Egma 开源了一套面向 Voice Agent 的测试与生产监控平台,把原本依赖人工反复打电话、试听结果的 QA 流程,变成可以和 Agent 代码一起保存、版本管理
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、Cherry Embedded 开源 MCU 音视频处理库 CherryAVP:统一编解码、WebRTC 3A 与音频效果接口 Cherry Embedded 开源了面向 MCU 的音视频处理库 CherryAVP,希望用一套统一框架覆盖音频编解码、
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 双模型:实时语音可边聊边跑异步 Tool Call,Extended Thinking 支持后台多步推理 Google 推出
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、阶跃发布 StepAudio 3 系列:全双工 Realtime 可边聊边跑调用工具,Gen 统一生成人声、音效与音乐 阶跃星辰发布 StepAudio 3 系列,一次上线 Realtime、ASR、TTS、Gen 和 Music 五款模型。相比此前
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、CMU、台大、NVIDIA 提出 ASR 自纠错方法 Hybrid Search:用隐状态找出易错人名,只在必要位置调用基座 LLM 修正 卡内基梅隆大学、台湾大学与 NVIDIA 提出 Hybrid Search,让大音频语言模型在转写过程中自行判
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、OpenAI 将全双工语音模型 GPT-Live-1 开放 API:可边听边说,复杂推理交给 GPT-6 Astra 等后端模型 OpenAI 正式将 GPT-Live-1 开放至 API。该模型此前已于 7 月用于 ChatGPT Voice,这次
阅读全文
摘要:点击链接,扫码报名大会 2026年9月10日,OpenAI 正式宣布 GPT‑Live‑1 在 API 中可用,将全双工语音体验带给开发者。模型能够同时听说,并将需要推理和工具调用的任务委派给后端处理。 Agora 作为 OpenAI 的合作伙伴,已通过 Conversational AI 支持 G
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、蚂蚁开源百灵首个原生多模态模型 Ling-3.0-flash-VL:引入视觉反馈闭环,Agent 可边执行边观察并持续修正 蚂蚁开源百灵系列首个原生多模态模型 Ling-3.0-flash-VL。模型基于 Ling-3.0-flash 的 MoE 架
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、语音数据公司 The Agentic Data Company 发布全双工对话数据集 Open Yap 1K:1000 小时真实双人对话,可免费用于商业训练 语音数据公司 The Agentic Data Company 发布全双工自然对话数据集 O
阅读全文
摘要:OpenAI 最近发布了 GPT-6 Astra。 看过 Demo 视频的人应该会注意到:Astra 展示 Computer Use 的方式,已经不同于我们坐在电脑前打字、等待 Agent 执行任务——人在持续说,AI 一边听、一边操作电脑,也可以随时被打断、纠正和重新引导。 AI 正从「会思考」,
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、Vivix 推出流式多模态互动模型 Vivix-W1:生成过程中可随时加入语音、触控与图像,实时改变后续 Vivix 推出流式多模态互动模型 Vivix-W1,将视频生成从「输入提示词 → 生成固定片段」改成持续运行的音视频流。文本、语音、图像、视频
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、微软发布批量语音识别模型 MAI-Transcribe-2:新增说话人分离与逐词时间戳,1 小时音频约 10 秒完成转录 Microsoft AI 发布批量语音识别模型 MAI-Transcribe-2。相比 MAI-Transcribe-1.5,新
阅读全文
摘要:iRTE2026 实时智能大会定档 10月23-24日 北京见 15+论坛、100+场深度演讲 更有丰富的 Side Event 与 RTE+AI 展区 等你来体验👇 阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、Inworld AI 发布实时 TTS 模型 Realtime TTS-2:从单句合成升级为多轮音频感知,可用自然语言控制语气 Inworld AI 发布 Realtime TTS-2,相比 Realtime TTS 1.5 主要根据当前文本生成语音
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、Meta 发布实时音频感知模型 Muse Voice Transcribe:单模型完成流式 ASR、20+ 人说话人分离与端点检测 Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcr
阅读全文
摘要:单次推理优化或速度本身从不是护城河。我们最关心的是:面对新的模型和架构,我们能多快跟进?——Batuhan Taskaya,Fal 创始工程师 MiniMax H3 MAX 「24 小时直播、无限 AI 生成」的爆火,让训练该模型的公司 Fal 进入开发者视野。 基于 MiniMax H3 后训练而
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、AI 视频生成公司 Runway 发布首个「界面世界模型」 Solaris:不用生成代码,直接逐帧实时生成可交互 App 和网页 AI 视频生成公司 Runway 发布 Solaris,并将其定义为首个 Interface World Model(界
阅读全文
摘要:本期编辑:@三水、@鲍勃 01 有话题的技术 1、Anthropic 开放硬件标准 MHS 研究预览:让 AI Agent 统一操控实验设备,硬件集成从数周缩短到数小时 Anthropic 开放 Model Hardware Standard(MHS)研究预览,一套让 AI Agent 安全操作现实
阅读全文
摘要:WebRTC 里很多机制最初是针对人类感官调优的……那些专为人类会议场景打造的设计,搬到 AI 时代都需要重新审视与校准。——Justin Uberti 如果你在浏览器里打过视频电话、开过在线会议,背后大概率都有 WebRTC 的影子。Justin 是 WebRTC 最初的架构师之一,曾任 Goog
阅读全文
浙公网安备 33010602011771号