开源项目


InftyThink:基于分段推理与总结机制的大模型无限深度推理框架
InftyThink是由浙江大学REAL实验室与北京大学联合研发的创新性大模型推理框架,其核心突破在于通过分段推理与总结机制,解决了传统大模型在长上下文推理中面临的"内存溢出"问...
2025-06-11 新闻资讯
820

PartCrafter:全球首个支持单图生成可分解3D部件的结构化生成模型
PartCrafter是由卡内基梅隆大学(CMU)与北京大学联合研发的全球首个结构化3D生成模型,其革命性突破在于能够从单张RGB图像直接生成可分解的3D部件,而非传统的整体3D模型。与传...
2025-06-11 新闻资讯
1108

ContentV:字节跳动开源的一款高效文本到视频生成模型
ContentV是字节跳动研发的一款高效文本到视频生成模型,其核心创新在于通过极简架构改造和流匹配训练策略,实现了在有限计算资源下训练80亿参数大模型的目标。该项目针对当前...
2025-06-11 新闻资讯
938

MonkeyOCR:华中科技大学与金山办公联合开源的轻量级文档解析大模型
MonkeyOCR是由华中科技大学VLR实验室与金山办公联合研发的轻量级文档解析大模型,其核心创新在于采用"结构-识别-关系"(Structure-Recognition-Relation, SRR)三元组范式,将非...
2025-06-10 新闻资讯
1317

Playmate:基于3D隐式空间引导扩散模型的高可控肖像动画生成框架
Playmate是由广州趣丸科技团队提出的一种基于3D隐式空间引导扩散模型的双阶段训练框架,旨在生成高质量且可控的肖像动画视频。该项目通过解耦面部属性(如表情、唇部动作和头...
2025-06-10 新闻资讯
596

Time-R1:伊利诺伊大学开源的时间推理框架
Time-R1是由伊利诺伊大学香槟分校(UIUC)团队开发的开源时间推理框架,旨在赋予中等规模语言模型(3B参数)全面理解、预测和生成时间相关内容的能力。该项目通过创新的三阶段...
2025-06-10 新闻资讯
707

MiniMax-Remover:开源视频目标移除框架,利用AI擦除视频指定物体
MiniMax-Remover是一款开源的视频目标移除框架,专注于通过AI技术实现视频中指定物体的高效擦除与场景修复。该项目基于扩散模型与噪声控制优化技术,能够在6次采样步骤内完成...
2025-06-10 新闻资讯
1580

UniRig:清华大学与VAST-AI(Tripo)联合开源的自动骨骼绑定框架
UniRig是由清华大学与VAST-AI(Tripo)联合研发的开源自动骨骼绑定框架,旨在通过AI技术彻底革新3D模型动画制作流程。该项目基于大型自回归模型(如GPT架构的Transformer)和...
2025-06-09 新闻资讯
891

PixelFlow:香港大学与Adobe联合开发的像素空间端到端生成模型
PixelFlow是由香港大学与Adobe联合开发的像素空间端到端生成模型,彻底颠覆了当前主流的潜在扩散模型(LDM)范式。不同于Stable Diffusion等依赖预训练VAE压缩图像到潜在空间...
2025-06-09 新闻资讯
668

MiniCPM:清华大学与面壁智能联合开发的端侧大语言模型
MiniCPM是由清华大学自然语言处理实验室与面壁智能联合开发的端侧大语言模型系列,定位为“小钢炮”模型,以极低参数量(0.5B-8B)实现接近百亿级模型的性能。项目核心目标是...
2025-06-09 新闻资讯
1099

Magentic-UI:微软开源的一款人机协作网页自动化工具
Magentic-UI是微软研究院于2025年5月在Build开发者大会上正式开源的一款革命性人机协作网页自动化工具。作为基于Magentic-One系统和AutoGen框架开发的创新项目,它重新定义了...
2025-06-07 新闻资讯
1046

MoonCast:开源对话式语音合成模型,零样本生成高质量播客音频
MoonCast是由中科大、月之暗面等团队联合开源的对话式语音合成模型,专注于将文本、PDF、网页等多模态输入源转化为具有高度自然感的中英双语播客音频。其核心突破在于解决了传...
2025-06-07 新闻资讯
976

PlayDiffusion:Play AI团队开源的基于扩散模型的语音编辑工具
PlayDiffusion是由Play AI团队开源的基于扩散模型的语音编辑工具,其核心创新在于支持对现有语音进行局部修改(如替换、删除或调整特定片段),而无需重新生成整段音频。
2025-06-05 新闻资讯
922

OmniAudio:阿里通义开源的空间音频生成框架
OmniAudio是由阿里通义实验室语音团队开发的开源空间音频生成框架,其核心目标是通过AI技术直接从360°全景视频生成一阶Ambisonics(FOA)格式的3D空间音频。这一技术突破了传...
2025-06-05 新闻资讯
787

OCode:一款基于终端原生环境的AI编程助手
OCode是一款基于终端原生环境的AI编程助手,专为开发者设计,通过集成本地或远程的Ollama模型,提供智能化的代码库分析与自动化任务执行能力。其核心目标是无缝嵌入开发者的终...
2025-06-05 新闻资讯
654