
本站推荐电影
本站推荐电视剧
电影下载排行
电视剧下载排行

一 | 每经记者:李宇彤 每经编辑:杨翼
语音大模型迭代速度明显加快,从最初的基础语音合成到实时对话,再到如今具备情绪表达的拟人化语音,技术边界不断扩展。 Hundreds of Eritrean government supporters and opponents clashed with each other and with Israeli police Saturday, leaving dozens injured in one of the most violent street confrontations among African asylum seekers and migrants in Tel Aviv in recent memory. Among those hurt were 30 police officers and three protesters hit by police fire.Eritreans from both sides faced off with construction lumber, pieces of metal, rocks and at least one axe, tearing through a neighborhood of south Tel Aviv where many asylum seekers live. Protesters smashed shop windows and police cars, and blood spatter was seen on sidewalks. One government supporter was lying in a puddle of blood in a children's playground. Israeli police in riot gear shot tear gas, stun grenades and live rounds while officers on horseback tried to control the protesters, who broke through barricades and hurled chunks rocks at the police. Police said officers resorted to live fire when they felt their lives were in danger.The clashes came as Eritrean government supporters marked the 30th anniversary of the current ruler's rise to power. The event was held near the Eritrean embassy in south Tel Aviv. Eritrea has one of the world's worst human rights records. Asylum seekers in Israel and elsewhere say they fear death if they were to return.

二 | 语音能力已成“资格赛”门槛 2026年,从字节跳动的大模型迭代节奏来看,Seed Audio 1.0诞生背后是其越来越清晰的全模态布局轮廓。 2026年2月,字节跳动发布Seedance 2.0,同年4月开放模型API;同年6月,该模型再一次升级,Seedance 2.5面世,同时还发布了Seedream 5.0 Pro,在数月内完成全模态能力升级。与此同时,豆包大模型系列的迭代,也始终围绕推理能力和多模态理解等能力持续升级。

三 | 这种全栈布局的优势在于协同。视频生成需要配音,图文内容可以转语音,智能体需要语音交互接口。当所有模态的模型都掌握在手中,自然会提升跨模态应用的打通效率。 事实上,押注语音赛道的大厂,不止字节跳动一家。就在Seed Audio 1.0发布的同一天,即2026年7月20日,阿里千问推出Qwen-Audio-3.0-TTS,同样瞄准下一代语音合成。

四 | 阿里千问TTS包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,在细粒度标签控制、“freestyle”指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升。

五 | 阿里千问TTS发布后,还登上了“Artificial Analysis”全球语音合成榜单首位。 《每日经济新闻》记者注意到,阶跃星辰则走了另一条路线。2026年4月发布的StepAudio 2.5 TTS主打语境感知能力,首次把语境理解引入语音生成全流程,通过全局语境控制定义整段语音的情绪基调、角色状态和场景氛围,发布约一个月后即跻身Artificial Analysis榜单前三。 由此来看,语音合成的技术竞争已经进入精细化比拼阶段,各家在数据、算法和工程化上持续投入。 在田丰看来,三家解决的,其实是三个不同层级的问题:Seed Audio的建模对象是“场景”,优化目标是多要素编排的协调性,解决批量生产音频内容的问题;阿里千问TTS的建模对象是“单人语音表演”,优化目标是单条语音的表现力,解决如何让合成语音更像专业配音演员的问题;StepAudio 2.5 TTS的建模对象是“实时对话中的人”,核心是副语言感知,解决AI在实时对话中如何更像真人的问题。 那么,头部厂商为什么都在加码语音能力? 《每日经济新闻》记者了解到,原因在于交互入口的争夺。当下,不论是智能助手、车载系统还是智能家居都离不开高质量语音交互。

六 | 但田丰指出,在“文本-图像-视频-音频”的多模态矩阵中,语音是技术链条最长的一环,同时涉及ASR、NLU、推理、TTS四个环节,每个环节的延迟叠加直接决定用户体验。 而这一战场还在延伸。7月15日,阿里千问宣布将集成至Apple智能设备,为iOS、iPadOS、macOS和visionOS的中国用户提供服务。对此,田丰认为,这意味着语音大模型的竞争,正从云端API向端侧设备渗透,对延迟和功耗的要求会更加极端。 从产业视角看,田丰进一步指出,还有一个被忽略的背景,AI公司的估值逻辑正在从模型能力转向多模态覆盖度,没有语音能力的大模型公司,可能会在下一轮融资中处于结构性劣势,语音已经从锦上添花变成“资格赛”门槛。

七 | 语音大模型的竞赛还远没到终局,技术路线仍在分化,应用场景也在持续探索。但田丰判断,单纯比音质的窗口期已经结束,价格和融合深度才是下一轮淘汰赛的筛子。真正的竞争转折点,在于谁能率先实现语音理解和语义推理在同一个神经网络内端到端联合训练,而非“先想清楚再说出来”的两段式流程。 每日经济新闻。
Current article:http://no8e.tourunbiaodubaicubangninan.shop/list_5uys9i3/agnf.html
Published on:17:01:48