新闻资讯


WorldPM:基于1500万自然偏好数据的大规模对齐模型框架
WorldPM是一个基于Transformer架构的大规模偏好建模框架,其技术核心在于通过自然偏好信号挖掘与多粒度评估体系构建端到端的对齐解决方案。与传统RLHF(基于人类反馈的强化学...
2025-05-20 新闻资讯
1117

Index-AniSora:基于时空掩码机制的动画视频生成全链路系统
Index-AniSora是一个基于扩散Transformer(DiT)架构的动画视频生成框架,其技术核心在于通过时空掩码机制实现多任务统一的生成控制。与传统视频生成系统不同,该系统专门针对...
2025-05-20 新闻资讯
1072

Steamer-I2V:百度开源的多模态条件控制图像到视频生成框架
Steamer-I2V是一个基于扩散模型的图像到视频生成框架,其技术核心在于通过多模态条件输入(包括图像、文本和引导信号)实现像素级精确的视频合成。与传统的端到端生成方法不同...
2025-05-20 新闻资讯
1233

CustomSvg:基于两级分离架构的样式可控SVG生成框架
CustomSvg是一个基于深度学习的两阶段SVG生成与编辑框架,其技术核心在于将传统T2V流程拆解为内容建模与样式迁移两个独立可控的阶段。与直接生成SVG的端到端方法不同,该系统...
2025-05-20 新闻资讯
879

SketchVideo:基于扩散模型的草图驱动视频生成与编辑框架
SketchVideo是一个基于扩散模型的草图驱动视频生成与编辑框架,其核心技术价值在于将稀疏草图控制与稠密视频生成这两个看似矛盾的需求完美统一。该系统允许用户通过1-2帧手绘...
2025-05-20 新闻资讯
822

Sketch2Anim:基于多条件控制的2D分镜转3D动画生成框架
Sketch2Anim是一个基于深度学习框架的2D分镜到3D动画自动转换系统,其名称源自"Sketch to Animation"的技术目标缩写。与传统的动画制作流程不同,该系统能够直接解析艺术家绘...
2025-05-19 新闻资讯
1050

DICE-Talk:基于身份-情感解耦的智能说话人视频生成框架
DICE-Talk(Disentangle Identity, Cooperate Emotion)是一个基于扩散模型的情感化说话人视频生成框架,其名称准确概括了该技术的两大核心特点:身份解耦与情感协同。与传统...
2025-05-19 新闻资讯
827

ShotAdapter:基于扩散模型的文本生成多镜头视频框架
ShotAdapter是一个基于扩散模型(Diffusion Models)的文本到多镜头视频生成框架,它能够将预训练的单镜头文本到视频(T2V)扩散模型通过轻量级微调转化为多镜头视频(T2MSV)...
2025-05-19 新闻资讯
668

Matrix-Game:基于17B参数的开源交互式世界生成大模型
Matrix-Game是昆仑万维开源的交互式世界生成大模型,项目基于先进的扩散模型技术,能够根据用户输入的键盘指令和鼠标操作生成连贯、可控的互动视频,在Minecraft等游戏环境中...
2025-05-16 新闻资讯
745

ChatUI:阿里开源的智能对话领域专业级React组件库
ChatUI是阿里巴巴达摩院旗下阿里小蜜团队开发并维护的开源对话式UI设计语言与React组件库,专为构建智能对话界面而生。该项目基于阿里在智能客服领域的最佳实践,特别是在双1...
2025-05-16 新闻资讯
963

FaceShot:同济大学开源的一款无需训练的跨角色肖像动画生成框架
FaceShot是由同济大学研究团队开发并开源的一款创新型肖像动画框架,该项目在ICLR2025会议上正式发布并引起学术界广泛关注。作为计算机视觉领域的前沿研究成果,FaceShot突破...
2025-05-16 新闻资讯
743

AgentCPM-GUI:首个面向中文应用的端侧GUI智能体框架
AgentCPM-GUI是由清华大学自然语言处理实验室(THUNLP)与ModelBest联合开发的开源本地化GUI智能体模型,代表了当前中文图形用户界面(GUI)智能体领域的最前沿技术。该项目基于8...
2025-05-15 新闻资讯
1014