ai模型
Vui是Fluxions-AI团队开发的革命性语音交互框架,作为"NotebookLM"风格的轻量级语音模型,它实现了设备端自然对话生成能力,于2025年6月正式开源。该项目突破性地解决了传统语...
2025-06-12
新闻资讯
890
PartCrafter是由卡内基梅隆大学(CMU)与北京大学联合研发的全球首个结构化3D生成模型,其革命性突破在于能够从单张RGB图像直接生成可分解的3D部件,而非传统的整体3D模型。与传...
2025-06-11
新闻资讯
1108
ContentV是字节跳动研发的一款高效文本到视频生成模型,其核心创新在于通过极简架构改造和流匹配训练策略,实现了在有限计算资源下训练80亿参数大模型的目标。该项目针对当前...
2025-06-11
新闻资讯
938
MonkeyOCR是由华中科技大学VLR实验室与金山办公联合研发的轻量级文档解析大模型,其核心创新在于采用"结构-识别-关系"(Structure-Recognition-Relation, SRR)三元组范式,将非...
2025-06-10
新闻资讯
1317
PixelFlow是由香港大学与Adobe联合开发的像素空间端到端生成模型,彻底颠覆了当前主流的潜在扩散模型(LDM)范式。不同于Stable Diffusion等依赖预训练VAE压缩图像到潜在空间...
2025-06-09
新闻资讯
668
MiniCPM是由清华大学自然语言处理实验室与面壁智能联合开发的端侧大语言模型系列,定位为“小钢炮”模型,以极低参数量(0.5B-8B)实现接近百亿级模型的性能。项目核心目标是...
2025-06-09
新闻资讯
1099
MoonCast是由中科大、月之暗面等团队联合开源的对话式语音合成模型,专注于将文本、PDF、网页等多模态输入源转化为具有高度自然感的中英双语播客音频。其核心突破在于解决了传...
2025-06-07
新闻资讯
976
PlayDiffusion是由Play AI团队开源的基于扩散模型的语音编辑工具,其核心创新在于支持对现有语音进行局部修改(如替换、删除或调整特定片段),而无需重新生成整段音频。
2025-06-05
新闻资讯
922
MiMo-VL是小米公司LLM-Core团队开源的多模态视觉语言模型(VLM),作为MiMo-7B系列的重要扩展,该模型以仅7B参数的紧凑规模,在40多项多模态任务评测中超越Qwen2.5-VL-72B等10倍...
2025-06-04
新闻资讯
1189
TEN VAD(Voice Activity Detection)是由声网(Agora)与RTE开发者社区联合推出的开源语音活动检测模型,旨在为实时语音交互提供高精度、低延迟、低功耗的语音检测能力。作为...
2025-06-04
新闻资讯
1400
DeepEyes是由小红书与西安交通大学联合研发的开源多模态视觉语言模型(VLM),旨在赋予AI“边看图边思考”的能力,即通过动态调用视觉工具(如图像局部放大)在推理过程中主动...
2025-06-04
新闻资讯
868
Jodi是由中国科学院计算技术研究所VIPL-GENUN团队开发的视觉理解与生成大一统模型,于2025年5月正式开源。该项目基于扩散模型架构,通过联合建模图像域和多个标签域,实现了视...
2025-05-30
新闻资讯
672
Ming-Lite-Omni是蚂蚁集团百灵大模型团队(InclusionAI)开源的一款原生全模态多模态大语言模型(MLLM),基于MoE(Mixture of Experts)架构设计,总参数18B,激活参数3B。作为蚂蚁...
2025-05-30
新闻资讯
791
LLaDA-V是由中国人民大学高瓴人工智能学院与蚂蚁集团联合研发的开源多模态大语言模型(MLLM)框架,首次将纯扩散模型架构成功应用于视觉-语言多模态理解任务。其核心创新在于突...
2025-05-28
新闻资讯
907
Dolphin 是字节跳动开源的一款轻量级多模态文档解析模型,全称为"Document Image Parsing via Heterogeneous Anchor Prompting"。该项目致力于解决复杂文档(如学术论文、财务...
2025-05-26
新闻资讯
1281













