MOSS-Audio
音频理解模型
面向真实场景的开源音频理解模型,支持语音识别、说话人与情绪分析、环境声与音乐理解、音频描述、时间感知问答,以及基于思维链的复杂推理。
面向类人交互的MOSS系列模型方案
音频理解模型
面向真实场景的开源音频理解模型,支持语音识别、说话人与情绪分析、环境声与音乐理解、音频描述、时间感知问答,以及基于思维链的复杂推理。
语音合成模型
面向实际生产的语音生成模型家族,支持高保真音色克隆、富有表现力的对话合成、环境声生成以及实时流式语音生成。
音视频同步生成模型
MOVA 是一个多模态基座模型,能够原生生成高保真且音画同步的视频与音频。它具备逼真的口型同步和环境感知音效,旨在为沉浸式多媒体内容创作提供支持。
多说话人语音转写模型
一款能够同时输出高精度转录文本、说话人身份及其对应时间戳的模型,适用于会议、访谈、播客以及影视内容等多说话人场景。
关注模型发布、产品迭代与企业发展。
