开源项目
MiMo-VL是小米公司LLM-Core团队开源的多模态视觉语言模型(VLM),作为MiMo-7B系列的重要扩展,该模型以仅7B参数的紧凑规模,在40多项多模态任务评测中超越Qwen2.5-VL-72B等10倍...
2025-06-04
新闻资讯
1189
TEN VAD(Voice Activity Detection)是由声网(Agora)与RTE开发者社区联合推出的开源语音活动检测模型,旨在为实时语音交互提供高精度、低延迟、低功耗的语音检测能力。作为...
2025-06-04
新闻资讯
1400
VRAG-RL是由阿里巴巴通义实验室自然语言智能团队研发并开源的多模态推理框架,旨在解决传统检索增强生成(RAG)方法在处理视觉丰富信息时的核心痛点——现有方法无法有效理解...
2025-06-04
新闻资讯
707
Paper2Poster是由滑铁卢大学联合牛津大学与新加坡国立大学研发的开源学术海报生成系统,该项目基于Apache 2.0许可证开源,旨在通过多智能体协作框架解决学术研究者面临的论文...
2025-06-03
新闻资讯
941
WebAgent 是阿里巴巴NLP团队开源的一款自主搜索AI智能体,基于Apache 2.0许可证发布。该项目包含两大核心模块:WebDancer(端到端智能体训练框架)和WebWalker(Web遍历的LLM...
2025-06-03
新闻资讯
1217
SearchAgent-X是由南开大学与伊利诺伊大学厄巴纳-香槟分校联合研发的高效搜索智能体推理框架,旨在解决大型语言模型(LLM)驱动的搜索智能体在复杂任务中面临的效率瓶颈问题。作...
2025-06-02
新闻资讯
674
Darwin Gödel Machine(DGM)是由普林斯顿大学与加州大学伯克利分校联合开发的新型自改进智能体系统,其核心创新在于将达尔文进化论的"适者生存"机制与哥德尔完备性理论相结...
2025-06-02
新闻资讯
766
HunyuanVideo-Avatar是腾讯混元团队与腾讯音乐天琴实验室联合研发的开源语音驱动数字人视频生成框架,该项目基于多模态扩散Transformer(MM-DiT)架构,实现了从单张图像和音...
2025-05-30
新闻资讯
1241
Jodi是由中国科学院计算技术研究所VIPL-GENUN团队开发的视觉理解与生成大一统模型,于2025年5月正式开源。该项目基于扩散模型架构,通过联合建模图像域和多个标签域,实现了视...
2025-05-30
新闻资讯
672
HunyuanPortrait是由腾讯混元团队与清华大学联合开发的基于扩散模型的肖像动画生成框架,于2025年3月首次公开发布,并于5月28日正式开源。该项目通过创新的隐式条件控制技术,...
2025-05-30
新闻资讯
708
QwenLong-L1 是由阿里巴巴通义千问团队(Qwen-Doc团队)开发并开源的首个基于强化学习(RL)训练的长上下文大型推理模型(LRM)框架,旨在解决当前大型语言模型在长文本推理任务中面...
2025-05-28
新闻资讯
921
MTVCrafter是由中国科学院深圳先进技术研究院Yanbo Ding团队开发的开源4D运动建模框架,其革命性在于首次实现从原始3D动作序列(SMPL参数)直接生成开放世界人像动画,彻底摆...
2025-05-27
新闻资讯
868
HRAvatar(High-Quality and Relightable Gaussian Head Avatar)是由清华大学深圳国际研究生院与国际数字经济学院(IDEA)联合开发的开源3D头像重建系统,其核心突破在于通过...
2025-05-26
新闻资讯
894
Dolphin 是字节跳动开源的一款轻量级多模态文档解析模型,全称为"Document Image Parsing via Heterogeneous Anchor Prompting"。该项目致力于解决复杂文档(如学术论文、财务...
2025-05-26
新闻资讯
1281
Graphiti是由Zep团队开发的开源知识图谱框架(Apache-2.0协议),专为动态环境下的AI智能体设计。与传统的检索增强生成(RAG)技术不同,Graphiti通过双时态数据模型和混合检...
2025-05-23
新闻资讯
1195













