1 2 3 4 5 ··· 120 下一页
摘要: 大家好,我是声网 RTE 开发者社区作者 @小曾同学。 如果你想实现 iOS 平台的音视频通话,想在音视频通话中添加虚拟背景,那这篇文章完全可以借鉴。使用 swift 语言,集成声网 SDK 实现音视频通话,并调用 enableVirtualBackground 接口添加虚拟背景,小伙伴们赶快跟着小 阅读全文
posted @ 2023-03-30 10:26 RTE开发者社区 阅读(353) 评论(0) 推荐(0)
摘要: 本期编辑:@三水、@鲍勃 01 有话题的技术 1、阿里云栖大会期间 Qwen 连发两款实时语音模型:Qwen3.8-Omni-Flash-Realtime 加入多通道音频、视频聚合与远程 MCP,Qwen-Audio 3.1 Realtime Plus 新增 8 个系统音色 近 4 日,Qwen 密 阅读全文
posted @ 2026-09-22 22:43 RTE开发者社区 阅读(8) 评论(0) 推荐(0)
摘要: 本期编辑:@三水、@鲍勃 01 有话题的技术 1、Voice AI 公司 Lokutor 推出 CPU 原生 Voice Agent 技术栈:转写、轮次判断与语音合成无需 GPU,可部署到本地和设备端 马德里的 Voice AI 公司 Lokutor 正在把整套语音智能体链路重做到普通 CPU 上。 阅读全文
posted @ 2026-09-21 23:06 RTE开发者社区 阅读(10) 评论(0) 推荐(0)
摘要: 理想的自动化,应该在后台运行,甚至让你根本不需要看它。 ——TypeSafe 创始人 Diego Almeida 用户刚说出「go back」,浏览器就已经返回了上一页,甚至没等他把话说完。 这是开发者 Moritz Kremb 最近制作的一个语音控制浏览器实验。他将实时语音转写与 TypeSafe 阅读全文
posted @ 2026-09-21 22:44 RTE开发者社区 阅读(19) 评论(0) 推荐(0)
摘要: 本期编辑:@三水、@鲍勃 01 有话题的技术 1、TypeSafe AI 发布决策模型 Jev:不生成文本,直接返回概率和结构化判断 TypeSafe AI 发布首个 System One 模型 Jev,面向软件里的分类、评分、路由和决策任务。与先让 LLM 生成一段文本、再解析成结构化结果不同,J 阅读全文
posted @ 2026-09-21 22:08 RTE开发者社区 阅读(11) 评论(0) 推荐(0)
摘要: 本期编辑:@三水、@鲍勃 01 有话题的技术 1、语音智能体测试平台 Egma 开源:把模拟通话写进代码仓库,发布前自动跑回归测试 Egma 开源了一套面向 Voice Agent 的测试与生产监控平台,把原本依赖人工反复打电话、试听结果的 QA 流程,变成可以和 Agent 代码一起保存、版本管理 阅读全文
posted @ 2026-09-20 18:36 RTE开发者社区 阅读(10) 评论(0) 推荐(0)
摘要: 本期编辑:@三水、@鲍勃 01 有话题的技术 1、Cherry Embedded 开源 MCU 音视频处理库 CherryAVP:统一编解码、WebRTC 3A 与音频效果接口 Cherry Embedded 开源了面向 MCU 的音视频处理库 CherryAVP,希望用一套统一框架覆盖音频编解码、 阅读全文
posted @ 2026-09-18 20:12 RTE开发者社区 阅读(13) 评论(0) 推荐(0)
摘要: 本期编辑:@三水、@鲍勃 01 有话题的技术 1、Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 双模型:实时语音可边聊边跑异步 Tool Call,Extended Thinking 支持后台多步推理 Google 推出 阅读全文
posted @ 2026-09-16 23:19 RTE开发者社区 阅读(8) 评论(0) 推荐(0)
摘要: 本期编辑:@三水、@鲍勃 01 有话题的技术 1、阶跃发布 StepAudio 3 系列:全双工 Realtime 可边聊边跑调用工具,Gen 统一生成人声、音效与音乐 阶跃星辰发布 StepAudio 3 系列,一次上线 Realtime、ASR、TTS、Gen 和 Music 五款模型。相比此前 阅读全文
posted @ 2026-09-16 22:47 RTE开发者社区 阅读(11) 评论(0) 推荐(0)
摘要: 本期编辑:@三水、@鲍勃 01 有话题的技术 1、CMU、台大、NVIDIA 提出 ASR 自纠错方法 Hybrid Search:用隐状态找出易错人名,只在必要位置调用基座 LLM 修正 卡内基梅隆大学、台湾大学与 NVIDIA 提出 Hybrid Search,让大音频语言模型在转写过程中自行判 阅读全文
posted @ 2026-09-15 23:09 RTE开发者社区 阅读(9) 评论(0) 推荐(0)
摘要: 本期编辑:@三水、@鲍勃 01 有话题的技术 1、OpenAI 将全双工语音模型 GPT-Live-1 开放 API:可边听边说,复杂推理交给 GPT-6 Astra 等后端模型 OpenAI 正式将 GPT-Live-1 开放至 API。该模型此前已于 7 月用于 ChatGPT Voice,这次 阅读全文
posted @ 2026-09-13 23:43 RTE开发者社区 阅读(12) 评论(0) 推荐(0)
1 2 3 4 5 ··· 120 下一页