新闻资讯
HunyuanPortrait是由腾讯混元团队与清华大学联合开发的基于扩散模型的肖像动画生成框架,于2025年3月首次公开发布,并于5月28日正式开源。该项目通过创新的隐式条件控制技术,...
2025-05-30
新闻资讯
711
Ming-Lite-Omni是蚂蚁集团百灵大模型团队(InclusionAI)开源的一款原生全模态多模态大语言模型(MLLM),基于MoE(Mixture of Experts)架构设计,总参数18B,激活参数3B。作为蚂蚁...
2025-05-30
新闻资讯
797
LLaDA-V是由中国人民大学高瓴人工智能学院与蚂蚁集团联合研发的开源多模态大语言模型(MLLM)框架,首次将纯扩散模型架构成功应用于视觉-语言多模态理解任务。其核心创新在于突...
2025-05-28
新闻资讯
914
LMEval 是由谷歌公司于2025年5月27日正式发布的开源框架,旨在为大型语言模型(LLM)和多模态模型提供标准化的评测工具,解决AI模型评估领域长期存在的比较壁垒问题。该项目基于...
2025-05-28
新闻资讯
857
QwenLong-L1 是由阿里巴巴通义千问团队(Qwen-Doc团队)开发并开源的首个基于强化学习(RL)训练的长上下文大型推理模型(LRM)框架,旨在解决当前大型语言模型在长文本推理任务中面...
2025-05-28
新闻资讯
923
Direct3D-S2是由南京大学等研究机构联合开发的一种基于稀疏体积的可扩展3D生成框架,它能够在大幅降低训练成本的情况下实现卓越的3D输出质量。该项目旨在解决当前3D生成领域面...
2025-05-28
新闻资讯
723
AgenticSeek是一个开源的、完全本地运行的AI助手项目,旨在成为知名云端AI服务Manus AI的隐私优先替代方案。该项目基于Deepseek R1模型构建,所有数据处理和任务执行均在用户...
2025-05-28
新闻资讯
1043
Vid2World是由清华大学与重庆大学联合开发的开源世界模型转换框架,其突破性在于首次实现了将非因果视频扩散模型转化为自回归交互式世界模型的技术路径。在机器人操作和游戏模...
2025-05-27
新闻资讯
608
Pixel Reasoner是由TIGER AI Lab开发的开源视觉推理框架,其革命性在于首次将"像素空间操作"(如放大、框选、对比)与多模态大模型结合,实现了人类级别的细粒度视觉理解能力...
2025-05-27
新闻资讯
963
MTVCrafter是由中国科学院深圳先进技术研究院Yanbo Ding团队开发的开源4D运动建模框架,其革命性在于首次实现从原始3D动作序列(SMPL参数)直接生成开放世界人像动画,彻底摆...
2025-05-27
新闻资讯
877
HRAvatar(High-Quality and Relightable Gaussian Head Avatar)是由清华大学深圳国际研究生院与国际数字经济学院(IDEA)联合开发的开源3D头像重建系统,其核心突破在于通过...
2025-05-26
新闻资讯
897
Dolphin 是字节跳动开源的一款轻量级多模态文档解析模型,全称为"Document Image Parsing via Heterogeneous Anchor Prompting"。该项目致力于解决复杂文档(如学术论文、财务...
2025-05-26
新闻资讯
1288













