开源项目
MMaDA(Multimodal Model with Diffusion Architecture)是由普林斯顿大学、北京大学和字节跳动联合研发的一款多模态大模型,它采用创新的统一扩散架构,实现了文本与图像等多...
2025-05-23
新闻资讯
747
MoviiGen1.1是由ZulutionAI团队开发的开源视频生成模型,基于Wan2.1框架微调而成,专注于电影级视觉质量的输出。该模型通过11位专业电影制作人和AIGC创作者的60项美学维度评估...
2025-05-23
新闻资讯
993
由慕尼黑工业大学、Synthesia公司和伦敦大学学院联合发布的Pixel3DMM项目,通过创新的"屏幕空间先验"技术,将这一领域的性能边界推向新高度。该项目基于DINOv2视觉Transforme...
2025-05-22
新闻资讯
973
AutoBE是一个AI驱动的全栈后端代码生成系统,其核心使命是消除业务需求与工程实现之间的鸿沟。与传统低代码平台不同,AutoBE基于独特的"瀑布-螺旋混合模型",通过持续集成编译...
2025-05-22
新闻资讯
867
BAGEL是字节跳动Seed团队开发的统一多模态基础大模型,其核心定位是成为首个真正实现理解与生成一体化的开源多模态架构。与传统的单一模态模型或仅支持理解或生成其中一种功能...
2025-05-22
新闻资讯
1759
MagicTailor是一个基于扩散模型的组件可控个性化框架,其技术核心在于解耦概念学习与组件编辑。与传统个性化方法不同,该系统允许用户通过参考图像定义目标概念(如人物),同...
2025-05-21
新闻资讯
779
NLWeb是一个开放协议与工具集的组合,其核心使命是降低网站部署自然语言交互的门槛。与传统需要复杂开发的对话系统不同,NLWeb通过标准化接口和语义数据映射,使开发者能够快...
2025-05-21
新闻资讯
958
Steamer-I2V是一个基于扩散模型的图像到视频生成框架,其技术核心在于通过多模态条件输入(包括图像、文本和引导信号)实现像素级精确的视频合成。与传统的端到端生成方法不同...
2025-05-20
新闻资讯
1227
SketchVideo是一个基于扩散模型的草图驱动视频生成与编辑框架,其核心技术价值在于将稀疏草图控制与稠密视频生成这两个看似矛盾的需求完美统一。该系统允许用户通过1-2帧手绘...
2025-05-20
新闻资讯
820
DICE-Talk(Disentangle Identity, Cooperate Emotion)是一个基于扩散模型的情感化说话人视频生成框架,其名称准确概括了该技术的两大核心特点:身份解耦与情感协同。与传统...
2025-05-19
新闻资讯
820
ShotAdapter是一个基于扩散模型(Diffusion Models)的文本到多镜头视频生成框架,它能够将预训练的单镜头文本到视频(T2V)扩散模型通过轻量级微调转化为多镜头视频(T2MSV)...
2025-05-19
新闻资讯
663
Matrix-Game是昆仑万维开源的交互式世界生成大模型,项目基于先进的扩散模型技术,能够根据用户输入的键盘指令和鼠标操作生成连贯、可控的互动视频,在Minecraft等游戏环境中...
2025-05-16
新闻资讯
744
FaceShot是由同济大学研究团队开发并开源的一款创新型肖像动画框架,该项目在ICLR2025会议上正式发布并引起学术界广泛关注。作为计算机视觉领域的前沿研究成果,FaceShot突破...
2025-05-16
新闻资讯
738
Muyan-TTS是一款开源文本转语音(TTS)模型,专为播客、有声书及长视频场景设计。该模型基于大规模预训练技术,具备零样本语音合成能力,可在0.33秒内生成1秒高质量音频,并支...
2025-05-13
新闻资讯
1034
字节跳动宣布正式开源其全新研发的社区驱动深度研究框架 DeerFlow,这一举措迅速引发了AI研究领域的广泛关注。作为一款基于LangChain和LangGraph框架构建的智能研究助手,Dee...
2025-05-10
新闻资讯
851













