新闻资讯


CombatVLA:专为3D动作游戏设计的视觉-语言-动作模型开源框架
CombatVLA 是由阿里巴巴淘天集团未来生活实验室团队开发的一款高效视觉-语言-动作模型(Vision-Language-Action Model, VLA),专为3D动作角色扮演游戏(ARPG)中的战斗任务优化设...
2025-08-20 新闻资讯
962

Parlant:专为实际应用设计的LLM(大型语言模型)智能体框架
Parlant 是由emcie-co团队开发的一款专为实际应用设计的LLM(大型语言模型)智能体框架,其核心目标是解决传统AI代理在面向客户场景中行为不可预测、难以控制的痛点。通过创新...
2025-08-19 新闻资讯
1498

MemU:NevaMind-AI团队专为AI伴侣打造的开源长期记忆框架
MemU(Memory Unit)是由NevaMind-AI团队开发的一款专注于AI伴侣场景的下一代开源记忆框架,其核心目标是解决当前AI系统普遍存在的"健忘"问题。与传统的静态数据存储不同,Me...
2025-08-19 新闻资讯
1870

AudioGenie:多模态输入驱动的无训练多智能体音频生成框架
AudioGenie 是由腾讯AI Lab与香港科技大学(广州)联合研发的无需训练的多智能体系统,专注于多模态到多音频生成(MultiModality-to-MultiAudio, MM2MA)任务。它能够从视频、...
2025-08-19 新闻资讯
974

VeOmni:字节跳动与火山引擎开源的全模态AI训练框架
VeOmni 是字节跳动Seed团队与火山引擎联合研发并开源的一款全模态PyTorch原生训练框架,旨在解决当前AI领域从单一文本模态向多模态(文本、图像、语音、视频)演进过程中的系...
2025-08-18 新闻资讯
960

CodeFormer:基于VQGAN与Transformer的开源人脸修复工具
CodeFormer是由南洋理工大学-商汤科技联合研究中心S-Lab团队开发的一款先进的人脸修复工具,该项目通过创新的深度学习架构,将变分量化生成对抗网络(VQGAN)与Transformer技术...
2025-08-18 新闻资讯
1019

MultiAgentPPT:基于多智能体协作的自动化PPT生成系统
MultiAgentPPT 是一款开源的智能PPT演示文稿生成系统,它基于多智能体协作架构(Multi-Agent System, MAS),通过A2A(Ask-to-Answer)、MCP(Multi-agent Control Protocol)...
2025-08-15 新闻资讯
869

VLMEvalKit:OpenCompass推出的开源多模态大模型评测工具包
VLMEvalKit 是由OpenCompass团队开发的一个专注于多模态大模型(Vision-Language Models, VLMs)评测的开源工具包。作为CompassKit大模型评测全栈工具链的重要组成部分,它旨在...
2025-08-15 新闻资讯
1029

Genie Envisioner:全球首个面向真实世界机器人操控的开源世界模型平台
Genie Envisioner(简称GE)是由智元机器人(AgibotTech)团队开发的全球首个面向真实世界机器人操控的开源世界模型平台,它创新性地将未来帧预测、策略学习与仿真评估整合进...
2025-08-15 新闻资讯
798

Marco-Voice:支持情感解耦与语音克隆的多功能语音合成系统
Marco-Voice 是由阿里巴巴国际数字商务团队开源的一款多功能语音合成系统,作为新一代文本到语音(TTS)技术的代表,Marco-Voice通过创新的说话者-情感解耦机制,成功将语音克...
2025-08-14 新闻资讯
862

RynnRCP:阿里巴巴达摩院开源的一套机器人上下文协议及框架
RynnRCP 是阿里巴巴达摩院自主研发并开源的一套机器人上下文协议及框架,全称为Robotics Context Protocol。它首次将模型上下文协议(MCP)理念引入具身智能领域,旨在打通从传...
2025-08-14 新闻资讯
827

Voost:NXN实验室开源的一款双向虚拟试衣框架
Voost 是由NXN实验室开发的一款创新性虚拟试衣框架,它通过单个扩散变换器(DiT)实现了虚拟试穿(Virtual Try-On, VTON)与逆向试穿(Virtual Try-Off)的联合学习,解决了传统方法...
2025-08-14 新闻资讯
825