新闻资讯


MiniMax-Remover:开源视频目标移除框架,利用AI擦除视频指定物体
MiniMax-Remover是一款开源的视频目标移除框架,专注于通过AI技术实现视频中指定物体的高效擦除与场景修复。该项目基于扩散模型与噪声控制优化技术,能够在6次采样步骤内完成...
2025-06-10 新闻资讯
1589

UniRig:清华大学与VAST-AI(Tripo)联合开源的自动骨骼绑定框架
UniRig是由清华大学与VAST-AI(Tripo)联合研发的开源自动骨骼绑定框架,旨在通过AI技术彻底革新3D模型动画制作流程。该项目基于大型自回归模型(如GPT架构的Transformer)和...
2025-06-09 新闻资讯
901

PixelFlow:香港大学与Adobe联合开发的像素空间端到端生成模型
PixelFlow是由香港大学与Adobe联合开发的像素空间端到端生成模型,彻底颠覆了当前主流的潜在扩散模型(LDM)范式。不同于Stable Diffusion等依赖预训练VAE压缩图像到潜在空间...
2025-06-09 新闻资讯
671

MiniCPM:清华大学与面壁智能联合开发的端侧大语言模型
MiniCPM是由清华大学自然语言处理实验室与面壁智能联合开发的端侧大语言模型系列,定位为“小钢炮”模型,以极低参数量(0.5B-8B)实现接近百亿级模型的性能。项目核心目标是...
2025-06-09 新闻资讯
1111

HeadTTS:开源免费文本转语音系统,支持多语言语音合成与个性化音色定制
HeadTTS是由met4citizen团队开发的开源文本转语音(TTS)系统,基于微软Azure Cognitive Services技术构建,支持中英文双语合成及个性化音色定制。该项目专注于解决传统TTS技...
2025-06-07 新闻资讯
1267

Magentic-UI:微软开源的一款人机协作网页自动化工具
Magentic-UI是微软研究院于2025年5月在Build开发者大会上正式开源的一款革命性人机协作网页自动化工具。作为基于Magentic-One系统和AutoGen框架开发的创新项目,它重新定义了...
2025-06-07 新闻资讯
1054

MoonCast:开源对话式语音合成模型,零样本生成高质量播客音频
MoonCast是由中科大、月之暗面等团队联合开源的对话式语音合成模型,专注于将文本、PDF、网页等多模态输入源转化为具有高度自然感的中英双语播客音频。其核心突破在于解决了传...
2025-06-07 新闻资讯
982

PlayDiffusion:Play AI团队开源的基于扩散模型的语音编辑工具
PlayDiffusion是由Play AI团队开源的基于扩散模型的语音编辑工具,其核心创新在于支持对现有语音进行局部修改(如替换、删除或调整特定片段),而无需重新生成整段音频。
2025-06-05 新闻资讯
924

OmniAudio:阿里通义开源的空间音频生成框架
OmniAudio是由阿里通义实验室语音团队开发的开源空间音频生成框架,其核心目标是通过AI技术直接从360°全景视频生成一阶Ambisonics(FOA)格式的3D空间音频。这一技术突破了传...
2025-06-05 新闻资讯
790

OCode:一款基于终端原生环境的AI编程助手
OCode是一款基于终端原生环境的AI编程助手,专为开发者设计,通过集成本地或远程的Ollama模型,提供智能化的代码库分析与自动化任务执行能力。其核心目标是无缝嵌入开发者的终...
2025-06-05 新闻资讯
658

MiMo-VL:小米公司开源的多模态视觉语言模型(VLM)
MiMo-VL是小米公司LLM-Core团队开源的多模态视觉语言模型(VLM),作为MiMo-7B系列的重要扩展,该模型以仅7B参数的紧凑规模,在40多项多模态任务评测中超越Qwen2.5-VL-72B等10倍...
2025-06-04 新闻资讯
1193

TEN VAD:超低延迟、轻量化且高精度的开源语音活动检测模型
TEN VAD(Voice Activity Detection)是由声网(Agora)与RTE开发者社区联合推出的开源语音活动检测模型,旨在为实时语音交互提供高精度、低延迟、低功耗的语音检测能力。作为...
2025-06-04 新闻资讯
1406