开源项目


MMaDA:普林斯顿与北大联合开源的多模态统一扩散架构大模型
MMaDA(Multimodal Model with Diffusion Architecture)是由普林斯顿大学、北京大学和字节跳动联合研发的一款多模态大模型,它采用创新的统一扩散架构,实现了文本与图像等多...
2025-05-23 新闻资讯
747

MoviiGen1.1:基于Wan2.1微调的开源电影级视频生成模型
MoviiGen1.1是由ZulutionAI团队开发的开源视频生成模型,基于Wan2.1框架微调而成,专注于电影级视觉质量的输出。该模型通过11位专业电影制作人和AIGC创作者的60项美学维度评估...
2025-05-23 新闻资讯
993

Pixel3DMM:基于DINO ViT的单图像3D人脸重建系统,几何精度超越基线15%
由慕尼黑工业大学、Synthesia公司和伦敦大学学院联合发布的Pixel3DMM项目,通过创新的"屏幕空间先验"技术,将这一领域的性能边界推向新高度。该项目基于DINOv2视觉Transforme...
2025-05-22 新闻资讯
973

AutoBE:AI驱动的后端服务器代码生成引擎
AutoBE是一个AI驱动的全栈后端代码生成系统,其核心使命是消除业务需求与工程实现之间的鸿沟。与传统低代码平台不同,AutoBE基于独特的"瀑布-螺旋混合模型",通过持续集成编译...
2025-05-22 新闻资讯
867

BAGEL:字节跳动开源的多模态基础大模型,统一理解与生成的下一代AI架构
BAGEL是字节跳动Seed团队开发的统一多模态基础大模型,其核心定位是成为首个真正实现理解与生成一体化的开源多模态架构。与传统的单一模态模型或仅支持理解或生成其中一种功能...
2025-05-22 新闻资讯
1759

MagicTailor:基于动态掩码退化与双流平衡的组件可控图像个性化框架
MagicTailor是一个基于扩散模型的组件可控个性化框架,其技术核心在于解耦概念学习与组件编辑。与传统个性化方法不同,该系统允许用户通过参考图像定义目标概念(如人物),同...
2025-05-21 新闻资讯
779

NLWeb:基于MCP协议的网站自然语言交互标准化框架
NLWeb是一个开放协议与工具集的组合,其核心使命是降低网站部署自然语言交互的门槛。与传统需要复杂开发的对话系统不同,NLWeb通过标准化接口和语义数据映射,使开发者能够快...
2025-05-21 新闻资讯
958

Steamer-I2V:百度开源的多模态条件控制图像到视频生成框架
Steamer-I2V是一个基于扩散模型的图像到视频生成框架,其技术核心在于通过多模态条件输入(包括图像、文本和引导信号)实现像素级精确的视频合成。与传统的端到端生成方法不同...
2025-05-20 新闻资讯
1227

SketchVideo:基于扩散模型的草图驱动视频生成与编辑框架
SketchVideo是一个基于扩散模型的草图驱动视频生成与编辑框架,其核心技术价值在于将稀疏草图控制与稠密视频生成这两个看似矛盾的需求完美统一。该系统允许用户通过1-2帧手绘...
2025-05-20 新闻资讯
820

DICE-Talk:基于身份-情感解耦的智能说话人视频生成框架
DICE-Talk(Disentangle Identity, Cooperate Emotion)是一个基于扩散模型的情感化说话人视频生成框架,其名称准确概括了该技术的两大核心特点:身份解耦与情感协同。与传统...
2025-05-19 新闻资讯
820

ShotAdapter:基于扩散模型的文本生成多镜头视频框架
ShotAdapter是一个基于扩散模型(Diffusion Models)的文本到多镜头视频生成框架,它能够将预训练的单镜头文本到视频(T2V)扩散模型通过轻量级微调转化为多镜头视频(T2MSV)...
2025-05-19 新闻资讯
663

Matrix-Game:基于17B参数的开源交互式世界生成大模型
Matrix-Game是昆仑万维开源的交互式世界生成大模型,项目基于先进的扩散模型技术,能够根据用户输入的键盘指令和鼠标操作生成连贯、可控的互动视频,在Minecraft等游戏环境中...
2025-05-16 新闻资讯
744

FaceShot:同济大学开源的一款无需训练的跨角色肖像动画生成框架
FaceShot是由同济大学研究团队开发并开源的一款创新型肖像动画框架,该项目在ICLR2025会议上正式发布并引起学术界广泛关注。作为计算机视觉领域的前沿研究成果,FaceShot突破...
2025-05-16 新闻资讯
738

Muyan-TTS:高效零样本语音合成与播客级长文本朗读技术
Muyan-TTS是一款开源文本转语音(TTS)模型,专为播客、有声书及长视频场景设计。该模型基于大规模预训练技术,具备零样本语音合成能力,可在0.33秒内生成1秒高质量音频,并支...
2025-05-13 新闻资讯
1034

字节跳动开源深度研究框架DeerFlow
字节跳动宣布正式开源其全新研发的社区驱动深度研究框架 DeerFlow,这一举措迅速引发了AI研究领域的广泛关注。作为一款基于LangChain和LangGraph框架构建的智能研究助手,Dee...
2025-05-10 新闻资讯
851