模思智能

联接AI、人与物理世界

多模态 • 开放生态 • 超级智能

即刻体验

我们的模型

面向类人交互的MOSS系列模型方案

MOSS-Audio

音频理解模型

面向真实场景的开源音频理解模型,支持语音识别、说话人与情绪分析、环境声与音乐理解、音频描述、时间感知问答,以及基于思维链的复杂推理。

了解更多

MOSS-TTS-Family

语音合成模型

面向实际生产的语音生成模型家族,支持高保真音色克隆、富有表现力的对话合成、环境声生成以及实时流式语音生成。

MOVA

音视频同步生成模型

MOVA 是一个多模态基座模型,能够原生生成高保真且音画同步的视频与音频。它具备逼真的口型同步和环境感知音效,旨在为沉浸式多媒体内容创作提供支持。

了解更多

MOSS-Transcribe-Diarize

多说话人语音转写模型

一款能够同时输出高精度转录文本、说话人身份及其对应时间戳的模型,适用于会议、访谈、播客以及影视内容等多说话人场景。

了解更多

新闻动态

关注模型发布、产品迭代与企业发展。

加入模思

模思智能致力于构建情境智能,用多模态大模型重新定义下一代智能人机交互。在这里,你将与顶尖工程师和研究员一起,探索智能的边界。在这里,限制你的不是算力和数据,而是你对问题的想象力。