开源项目
Gen-CLI是一个开源的命令行编程工具,旨在为国内开发者提供类似于谷歌Gemini-CLI的AI辅助编程体验。该项目基于开源的Gemini-CLI进行改造,通过调用硅基流动(SiliconCloud)平台...
2025-07-09
新闻资讯
1474
Agent Zero是一个革命性的开源AI代理框架,不同于传统的预编程AI工具,Agent Zero被设计为一个"个人化、有机(organic)的智能体框架",其核心理念是与用户共同成长和学习。这个...
2025-07-08
新闻资讯
746
EarthMind 是由意大利特伦托大学、德国柏林工业大学、慕尼黑工业大学以及保加利亚INSAIT研究院联合开发的开源多模态大模型项目,专门针对地球观测(Earth Observation, EO)数据...
2025-07-07
新闻资讯
736
MOSS-TTSD 是由上海创智学院、复旦大学和模思智能的OpenMOSS团队联合推出的一个开源的文本到口语对话生成模型,专为多人对话场景设计,能够将完整的对话脚本直接转换为自然流...
2025-07-07
新闻资讯
909
Magnitude 是一个基于视觉人工智能(Vision AI)的开源浏览器自动化工具,旨在让用户通过自然语言控制浏览器界面。它不仅可以理解网页界面内容,还能根据用户的指令执行精准操作...
2025-07-04
新闻资讯
1014
Gemma 是由Google DeepMind主导开发的一系列轻量级开源AI模型,该项目基于谷歌旗舰模型Gemini的技术架构,旨在为开发者、研究人员及企业提供高性能、低部署门槛的AI工具。
2025-07-04
新闻资讯
789
GLM-4.1V-Thinking 是由智谱AI(Zhipu AI)与清华大学联合研发的开源视觉语言大模型(Vision-Language Model, VLM),专注于提升AI系统在复杂认知任务中的推理能力。该项目包...
2025-07-04
新闻资讯
924
ML-Master 是由上海交通大学人工智能学院Agents团队开发的一款面向机器学习(Machine Learning)的AI专家智能体系统,旨在通过创新的"探索-推理深度融合"范式,实现AI系统自主...
2025-07-02
新闻资讯
825
XVerse 是字节跳动AI实验室开源的一款创新性多主体可控文本到图像生成框架,旨在解决传统扩散变换器(DiTs)在多主题生成场景中面临的身份混淆和属性纠缠问题。该项目基于先进的...
2025-07-02
新闻资讯
937
ThinkSound是什么ThinkSound 是阿里巴巴通义实验室开源的一款多模态音频生成与编辑模型,它首次将"思维链"(Chain-of-Thought, CoT)推理机制引入多模态音频生成领域,构建了...
2025-07-02
新闻资讯
976
WorldVLA(World Visual-Language-Action)是阿里巴巴达摩院开发的统一视觉-语言-动作自回归世界模型,它创造性地将两类原本独立发展的AI模型——视觉语言动作(VLA)模型与世界模...
2025-07-01
新闻资讯
1046
AnimaX是由北京航空航天大学黄泽欢团队领导开发的一项革命性3D动画生成技术,研究团队还包括来自清华大学、香港大学和VAST公司的研究人员。其核心目标是通过简单的文字描述让...
2025-07-01
新闻资讯
846
FairyGen是一个基于AI技术的自动化动画生成系统,它能够将儿童手绘的角色草图自动转化为风格一致、剧情驱动的卡通动画视频。与传统的动画制作工具不同,FairyGen只需用户提供...
2025-07-01
新闻资讯
693
OmniGen2是由北京人工智能研究院开发的一款开源统一多模态图像生成模型,代表了当前多模态AI领域的最新技术突破。作为OmniGen系列的第二代产品,它通过创新的双轨制架构设计,...
2025-07-01
新闻资讯
931
VLN-R1是由香港大学与上海AI Lab联合提出的视觉语言导航(Vision-Language Navigation, VLN)开源框架,其核心目标是实现智能体通过自然语言指令在复杂环境中完成连续动作的自...
2025-06-30
新闻资讯
977













