新闻资讯


MOSS-TTSD:开源的文本到口语对话生成模型
MOSS-TTSD 是由上海创智学院、复旦大学和模思智能的OpenMOSS团队联合推出的一个开源的文本到口语对话生成模型,专为多人对话场景设计,能够将完整的对话脚本直接转换为自然流...
2025-07-07 新闻资讯
918

Magnitude:基于视觉AI的开源浏览器自动化工具
Magnitude 是一个基于视觉人工智能(Vision AI)的开源浏览器自动化工具,旨在让用户通过自然语言控制浏览器界面。它不仅可以理解网页界面内容,还能根据用户的指令执行精准操作...
2025-07-04 新闻资讯
1020

Gemma:Google DeepMind开源的多模态轻量级AI模型
Gemma 是由Google DeepMind主导开发的一系列轻量级开源AI模型,该项目基于谷歌旗舰模型Gemini的技术架构,旨在为开发者、研究人员及企业提供高性能、低部署门槛的AI工具。
2025-07-04 新闻资讯
789

GLM-4.1V-Thinking:智谱AI与清华大学联合开源的多模态推理大模型
GLM-4.1V-Thinking 是由智谱AI(Zhipu AI)与清华大学联合研发的开源视觉语言大模型(Vision-Language Model, VLM),专注于提升AI系统在复杂认知任务中的推理能力。该项目包...
2025-07-04 新闻资讯
928

VideoLingo:开源全自动视频翻译工具,一站式AI视频本地化神器
VideoLingo 是是一款开源的全自动视频翻译与本地化工具,旨在通过人工智能技术解决跨语言视频内容传播的障碍。它集成了语音识别、大语言模型翻译、字幕优化和文本转语音(TTS...
2025-07-03 新闻资讯
933

MirrorMe:阿里通义推出的实时、高保真、可控的音频驱动肖像动画框架
MirrorMe 是由阿里通义实验室开发的一款实时、高保真、可控的音频驱动肖像动画框架,该项目旨在解决当前音频驱动肖像动画领域存在的高延迟、时间一致性差、身份保持困难和控制...
2025-07-03 新闻资讯
787

BlenderFusion:谷歌DeepMind开发的2D图像转换为可编辑3D场景框架
BlenderFusion 是由谷歌DeepMind团队开发的一项革命性技术,它能够将普通的2D照片转换成完全可编辑的3D场景。它能够精确控制图片中每个物体的位置、角度、大小,改变颜色材质...
2025-07-03 新闻资讯
785

ML-Master:上海交大开发的一款面向机器学习(Machine Learning)的AI专家智能体系统
ML-Master 是由上海交通大学人工智能学院Agents团队开发的一款面向机器学习(Machine Learning)的AI专家智能体系统,旨在通过创新的"探索-推理深度融合"范式,实现AI系统自主...
2025-07-02 新闻资讯
830

XVerse:字节跳动开源的多主体可控文生图框架
XVerse 是字节跳动AI实验室开源的一款创新性多主体可控文本到图像生成框架,旨在解决传统扩散变换器(DiTs)在多主题生成场景中面临的身份混淆和属性纠缠问题。该项目基于先进的...
2025-07-02 新闻资讯
946

ThinkSound:阿里巴巴通义实验室开源的一款多模态音频生成与编辑模型
ThinkSound是什么ThinkSound 是阿里巴巴通义实验室开源的一款多模态音频生成与编辑模型,它首次将"思维链"(Chain-of-Thought, CoT)推理机制引入多模态音频生成领域,构建了...
2025-07-02 新闻资讯
985

WorldVLA:阿里巴巴达摩院开发的统一视觉-语言-动作自回归世界模型
WorldVLA(World Visual-Language-Action)是阿里巴巴达摩院开发的统一视觉-语言-动作自回归世界模型,它创造性地将两类原本独立发展的AI模型——视觉语言动作(VLA)模型与世界模...
2025-07-01 新闻资讯
1053

AnimaX:基于文本驱动的通用3D动画生成系统
AnimaX是由北京航空航天大学黄泽欢团队领导开发的一项革命性3D动画生成技术,研究团队还包括来自清华大学、香港大学和VAST公司的研究人员。其核心目标是通过简单的文字描述让...
2025-07-01 新闻资讯
847