ai模型
MMaDA(Multimodal Model with Diffusion Architecture)是由普林斯顿大学、北京大学和字节跳动联合研发的一款多模态大模型,它采用创新的统一扩散架构,实现了文本与图像等多...
2025-05-23
新闻资讯
747
MoviiGen1.1是由ZulutionAI团队开发的开源视频生成模型,基于Wan2.1框架微调而成,专注于电影级视觉质量的输出。该模型通过11位专业电影制作人和AIGC创作者的60项美学维度评估...
2025-05-23
新闻资讯
993
BAGEL是字节跳动Seed团队开发的统一多模态基础大模型,其核心定位是成为首个真正实现理解与生成一体化的开源多模态架构。与传统的单一模态模型或仅支持理解或生成其中一种功能...
2025-05-22
新闻资讯
1759
WorldPM是一个基于Transformer架构的大规模偏好建模框架,其技术核心在于通过自然偏好信号挖掘与多粒度评估体系构建端到端的对齐解决方案。与传统RLHF(基于人类反馈的强化学...
2025-05-20
新闻资讯
1112
Matrix-Game是昆仑万维开源的交互式世界生成大模型,项目基于先进的扩散模型技术,能够根据用户输入的键盘指令和鼠标操作生成连贯、可控的互动视频,在Minecraft等游戏环境中...
2025-05-16
新闻资讯
744
DreamFit 是由字节跳动团队开发的开源轻量级服装为中心的人体生成模型,专注于通过AI技术实现高质量服装生成、虚拟试穿和创意换装。该项目采用创新的轻量化架构,结合自适应注...
2025-05-15
新闻资讯
1126
Insert Anything是由浙江大学、哈佛大学与南洋理工大学联合开发的开源图像编辑框架,专注于通过上下文感知扩散变换器(Diffusion Transformer, DiT)实现图像内容的精准插入。...
2025-05-09
新闻资讯
802
ACE-Step 是一个革命性的开源音乐生成基础模型,旨在通过其全面的架构设计克服现有方法的局限性,并在音乐生成领域实现最先进的性能。该项目由 ACE Studio 和 StepFun 共同领...
2025-05-07
新闻资讯
1028
LiveCC是一个开源的实时视频解说大模型,由字节跳动与新加坡国立大学合作推出。该项目基于Qwen2-VL-7B模型开发,通过大规模流式语音文本学习,实现了视频内容的实时理解与解说...
2025-04-27
新闻资讯
1041
Kimi-VL是由月之暗面(MoonshotAI)团队开发的一款高效开源的多模态视觉语言模型(Vision-Language Model, VLM)。该模型采用了混合专家(Mixture-of-Experts, MoE)架构,旨在...
2025-04-25
新闻资讯
1181
Describe Anything是一个开创性的开源项目,由NVIDIA、UC Berkeley和UCSF等机构的研究人员共同开发。该项目旨在创建一个能够理解和描述图像和视频中特定区域的模型,为用户提...
2025-04-25
新闻资讯
886
SocioVerse是一个开创性的社会模拟项目,它利用大型语言模型(LLMs)作为智能代理,构建了一个能够高精度模拟真实人类社会行为的数字世界。该项目由复旦大学主导,联合上海创...
2025-04-24
新闻资讯
845
MAGI-1是一款基于自回归算法的大规模视频生成模型,旨在通过预测一系列视频块(chunks)来生成高质量视频。它能够根据文本指令或图像输入生成连贯且逼真的视频内容,同时支持...
2025-04-23
新闻资讯
895
SimpleAR 是由复旦大学与字节跳动联合开发并开源的一个简单自回归(Autoregressive, AR)图像生成模型。它在文本到图像(T2I)生成领域中取得了显著的成果,尤其是在高分辨率...
2025-04-22
新闻资讯
888
InternVL是一个开源的多模态对话模型,由OpenGVLab团队开发。该项目旨在通过大规模预训练和微调,实现一个高性能、多语言支持的对话模型,接近GPT-4V的表现。InternVL可以用于...
2025-04-20
新闻资讯
1115













