新闻资讯


DeepEyes:小红书和西安交大联开源的多模态视觉语言模型(VLM)
DeepEyes是由小红书与西安交通大学联合研发的开源多模态视觉语言模型(VLM),旨在赋予AI“边看图边思考”的能力,即通过动态调用视觉工具(如图像局部放大)在推理过程中主动...
2025-06-04 新闻资讯
874

VRAG-RL:阿里通义开源的多模态RAG推理框架
VRAG-RL是由阿里巴巴通义实验室自然语言智能团队研发并开源的多模态推理框架,旨在解决传统检索增强生成(RAG)方法在处理视觉丰富信息时的核心痛点——现有方法无法有效理解...
2025-06-04 新闻资讯
709

Paper2Poster:基于多智能体框架的学术论文自动化海报生成系统
Paper2Poster是由滑铁卢大学联合牛津大学与新加坡国立大学研发的开源学术海报生成系统,该项目基于Apache 2.0许可证开源,旨在通过多智能体协作框架解决学术研究者面临的论文...
2025-06-03 新闻资讯
949

MagicTryOn:基于扩散Transformer的视频虚拟试穿框架
MagicTryOn是由VIVO Camera Research团队及浙大等机构联合开发的全球首个视频扩散Transformer试穿框架,该项目基于arXiv论文《MagicTryOn: Harnessing Diffusion Transformer...
2025-06-03 新闻资讯
1097

WebAgent:阿里巴巴开源的自主搜索AI智能体
WebAgent 是阿里巴巴NLP团队开源的一款自主搜索AI智能体,基于Apache 2.0许可证发布。该项目包含两大核心模块:WebDancer(端到端智能体训练框架)和WebWalker(Web遍历的LLM...
2025-06-03 新闻资讯
1226

Chatterbox:Resemble AI开源的多模态语音合成系统,支持情感夸张控制与零样本克隆
Chatterbox是由Resemble AI团队开发的开源文本到语音(TTS)系统,旨在提供企业级的零样本语音合成能力。该项目基于0.5B参数的Llama模型架构,在50万小时清洗数据集上进行训练...
2025-06-03 新闻资讯
944

SearchAgent-X:南开大学与伊利诺伊大学联合发布的智能搜索代理框架
SearchAgent-X是由南开大学与伊利诺伊大学厄巴纳-香槟分校联合研发的高效搜索智能体推理框架,旨在解决大型语言模型(LLM)驱动的搜索智能体在复杂任务中面临的效率瓶颈问题。作...
2025-06-02 新闻资讯
675

OmniSync:跨模态通用唇形同步视频生成框架
OmniSync是由中国人民大学、快手科技与清华大学联合研发的下一代唇形同步(Lip Sync)技术框架,其核心创新在于突破了传统方法对人工标注唇部掩码(mask)的依赖,实现了端到...
2025-06-02 新闻资讯
859

Darwin Gödel Machine(DGM):基于达尔文进化与哥德尔完备性的自改进智能体
Darwin Gödel Machine(DGM)是由普林斯顿大学与加州大学伯克利分校联合开发的新型自改进智能体系统,其核心创新在于将达尔文进化论的"适者生存"机制与哥德尔完备性理论相结...
2025-06-02 新闻资讯
770

HunyuanVideo-Avatar:腾讯混元与天琴联合开源的语音驱动数字人视频生成框架
HunyuanVideo-Avatar是腾讯混元团队与腾讯音乐天琴实验室联合研发的开源语音驱动数字人视频生成框架,该项目基于多模态扩散Transformer(MM-DiT)架构,实现了从单张图像和音...
2025-05-30 新闻资讯
1246

WonderPlay:物理仿真与视频生成融合的动态3D场景合成框架
WonderPlay 是由斯坦福大学研究团队开发的物理仿真与视频生成融合的动态3D场景合成框架,该项目通过创新的混合生成模拟器技术,实现了从单张静态图像生成具有真实物理效果的动...
2025-05-30 新闻资讯
1075

Jodi:中国科学院开源的视觉理解与生成大一统模型
Jodi是由中国科学院计算技术研究所VIPL-GENUN团队开发的视觉理解与生成大一统模型,于2025年5月正式开源。该项目基于扩散模型架构,通过联合建模图像域和多个标签域,实现了视...
2025-05-30 新闻资讯
677