ai模型


MMaDA:普林斯顿与北大联合开源的多模态统一扩散架构大模型
MMaDA(Multimodal Model with Diffusion Architecture)是由普林斯顿大学、北京大学和字节跳动联合研发的一款多模态大模型,它采用创新的统一扩散架构,实现了文本与图像等多...
2025-05-23 新闻资讯
747

MoviiGen1.1:基于Wan2.1微调的开源电影级视频生成模型
MoviiGen1.1是由ZulutionAI团队开发的开源视频生成模型,基于Wan2.1框架微调而成,专注于电影级视觉质量的输出。该模型通过11位专业电影制作人和AIGC创作者的60项美学维度评估...
2025-05-23 新闻资讯
993

BAGEL:字节跳动开源的多模态基础大模型,统一理解与生成的下一代AI架构
BAGEL是字节跳动Seed团队开发的统一多模态基础大模型,其核心定位是成为首个真正实现理解与生成一体化的开源多模态架构。与传统的单一模态模型或仅支持理解或生成其中一种功能...
2025-05-22 新闻资讯
1759

WorldPM:基于1500万自然偏好数据的大规模对齐模型框架
WorldPM是一个基于Transformer架构的大规模偏好建模框架,其技术核心在于通过自然偏好信号挖掘与多粒度评估体系构建端到端的对齐解决方案。与传统RLHF(基于人类反馈的强化学...
2025-05-20 新闻资讯
1112

Matrix-Game:基于17B参数的开源交互式世界生成大模型
Matrix-Game是昆仑万维开源的交互式世界生成大模型,项目基于先进的扩散模型技术,能够根据用户输入的键盘指令和鼠标操作生成连贯、可控的互动视频,在Minecraft等游戏环境中...
2025-05-16 新闻资讯
744

DreamFit:字节跳动开源的轻量级服装为中心的人体生成模型
DreamFit 是由字节跳动团队开发的开源轻量级服装为中心的人体生成模型,专注于通过AI技术实现高质量服装生成、虚拟试穿和创意换装。该项目采用创新的轻量化架构,结合自适应注...
2025-05-15 新闻资讯
1126

Insert Anything:基于上下文感知扩散变换器的图像插入解决方案
Insert Anything是由浙江大学、哈佛大学与南洋理工大学联合开发的开源图像编辑框架,专注于通过上下文感知扩散变换器(Diffusion Transformer, DiT)实现图像内容的精准插入。...
2025-05-09 新闻资讯
802

ACE-Step:ACE Studio 和 StepFun开源的音乐生成基础模型
ACE-Step 是一个革命性的开源音乐生成基础模型,旨在通过其全面的架构设计克服现有方法的局限性,并在音乐生成领域实现最先进的性能。该项目由 ACE Studio 和 StepFun 共同领...
2025-05-07 新闻资讯
1028

LiveCC:字节跳动与新加坡国立大学联合开源的实时视频解说大模型
LiveCC是一个开源的实时视频解说大模型,由字节跳动与新加坡国立大学合作推出。该项目基于Qwen2-VL-7B模型开发,通过大规模流式语音文本学习,实现了视频内容的实时理解与解说...
2025-04-27 新闻资讯
1041

Kimi-VL:月之暗面开源的多模态视觉语言模型
Kimi-VL是由月之暗面(MoonshotAI)团队开发的一款高效开源的多模态视觉语言模型(Vision-Language Model, VLM)。该模型采用了混合专家(Mixture-of-Experts, MoE)架构,旨在...
2025-04-25 新闻资讯
1181

Describe Anything:开源的图像与视频本地化描述模型
Describe Anything是一个开创性的开源项目,由NVIDIA、UC Berkeley和UCSF等机构的研究人员共同开发。该项目旨在创建一个能够理解和描述图像和视频中特定区域的模型,为用户提...
2025-04-25 新闻资讯
886

SocioVerse:LLM驱动的社会模拟世界模型
SocioVerse是一个开创性的社会模拟项目,它利用大型语言模型(LLMs)作为智能代理,构建了一个能够高精度模拟真实人类社会行为的数字世界。该项目由复旦大学主导,联合上海创...
2025-04-24 新闻资讯
845

Magi-1:Sand-AI开源的大规模自回归视频生成模型
MAGI-1是一款基于自回归算法的大规模视频生成模型,旨在通过预测一系列视频块(chunks)来生成高质量视频。它能够根据文本指令或图像输入生成连贯且逼真的视频内容,同时支持...
2025-04-23 新闻资讯
895

SimpleAR:复旦大学和字节跳动开源的简单自回归图像生成模型
SimpleAR 是由复旦大学与字节跳动联合开发并开源的一个简单自回归(Autoregressive, AR)图像生成模型。它在文本到图像(T2I)生成领域中取得了显著的成果,尤其是在高分辨率...
2025-04-22 新闻资讯
888

InternVL:OpenGVLab开源的多模态对话模型,接近GPT-4V表现
InternVL是一个开源的多模态对话模型,由OpenGVLab团队开发。该项目旨在通过大规模预训练和微调,实现一个高性能、多语言支持的对话模型,接近GPT-4V的表现。InternVL可以用于...
2025-04-20 新闻资讯
1115