ai框架
OmniAudio是由阿里通义实验室语音团队开发的开源空间音频生成框架,其核心目标是通过AI技术直接从360°全景视频生成一阶Ambisonics(FOA)格式的3D空间音频。这一技术突破了传...
2025-06-05
新闻资讯
787
VRAG-RL是由阿里巴巴通义实验室自然语言智能团队研发并开源的多模态推理框架,旨在解决传统检索增强生成(RAG)方法在处理视觉丰富信息时的核心痛点——现有方法无法有效理解...
2025-06-04
新闻资讯
707
Paper2Poster是由滑铁卢大学联合牛津大学与新加坡国立大学研发的开源学术海报生成系统,该项目基于Apache 2.0许可证开源,旨在通过多智能体协作框架解决学术研究者面临的论文...
2025-06-03
新闻资讯
942
MagicTryOn是由VIVO Camera Research团队及浙大等机构联合开发的全球首个视频扩散Transformer试穿框架,该项目基于arXiv论文《MagicTryOn: Harnessing Diffusion Transformer...
2025-06-03
新闻资讯
1091
SearchAgent-X是由南开大学与伊利诺伊大学厄巴纳-香槟分校联合研发的高效搜索智能体推理框架,旨在解决大型语言模型(LLM)驱动的搜索智能体在复杂任务中面临的效率瓶颈问题。作...
2025-06-02
新闻资讯
674
OmniSync是由中国人民大学、快手科技与清华大学联合研发的下一代唇形同步(Lip Sync)技术框架,其核心创新在于突破了传统方法对人工标注唇部掩码(mask)的依赖,实现了端到...
2025-06-02
新闻资讯
857
HunyuanVideo-Avatar是腾讯混元团队与腾讯音乐天琴实验室联合研发的开源语音驱动数字人视频生成框架,该项目基于多模态扩散Transformer(MM-DiT)架构,实现了从单张图像和音...
2025-05-30
新闻资讯
1241
WonderPlay 是由斯坦福大学研究团队开发的物理仿真与视频生成融合的动态3D场景合成框架,该项目通过创新的混合生成模拟器技术,实现了从单张静态图像生成具有真实物理效果的动...
2025-05-30
新闻资讯
1069
HunyuanPortrait是由腾讯混元团队与清华大学联合开发的基于扩散模型的肖像动画生成框架,于2025年3月首次公开发布,并于5月28日正式开源。该项目通过创新的隐式条件控制技术,...
2025-05-30
新闻资讯
708
LLaDA-V是由中国人民大学高瓴人工智能学院与蚂蚁集团联合研发的开源多模态大语言模型(MLLM)框架,首次将纯扩散模型架构成功应用于视觉-语言多模态理解任务。其核心创新在于突...
2025-05-28
新闻资讯
908
LMEval 是由谷歌公司于2025年5月27日正式发布的开源框架,旨在为大型语言模型(LLM)和多模态模型提供标准化的评测工具,解决AI模型评估领域长期存在的比较壁垒问题。该项目基于...
2025-05-28
新闻资讯
853
QwenLong-L1 是由阿里巴巴通义千问团队(Qwen-Doc团队)开发并开源的首个基于强化学习(RL)训练的长上下文大型推理模型(LRM)框架,旨在解决当前大型语言模型在长文本推理任务中面...
2025-05-28
新闻资讯
922
Direct3D-S2是由南京大学等研究机构联合开发的一种基于稀疏体积的可扩展3D生成框架,它能够在大幅降低训练成本的情况下实现卓越的3D输出质量。该项目旨在解决当前3D生成领域面...
2025-05-28
新闻资讯
719
Vid2World是由清华大学与重庆大学联合开发的开源世界模型转换框架,其突破性在于首次实现了将非因果视频扩散模型转化为自回归交互式世界模型的技术路径。在机器人操作和游戏模...
2025-05-27
新闻资讯
604
Pixel Reasoner是由TIGER AI Lab开发的开源视觉推理框架,其革命性在于首次将"像素空间操作"(如放大、框选、对比)与多模态大模型结合,实现了人类级别的细粒度视觉理解能力...
2025-05-27
新闻资讯
959













