新闻资讯


WeKnora:腾讯开源的的模块化文档理解与智能检索框架
WeKnora(中文名"维娜拉")是腾讯公司开源的一款基于大语言模型的新一代文档理解与检索框架,专为解决结构复杂、内容异构的文档场景中的智能问答需求而设计。
2025-08-08 新闻资讯
1436

Wassette:微软开源的一款专为AI Agent设计的安全工具
Wassette 是微软开源的一款专为AI Agent设计的安全工具扩展运行时,基于Rust语言和WebAssembly(Wasm)技术构建。其核心目标是解决AI Agent在动态加载外部工具时的安全性问题...
2025-08-08 新闻资讯
879

GPT-OSS:OpenAI开源的高效稀疏激活大语言模型
GPT-OSS(Open-Source Series)是OpenAI发布的两款开源大型语言模型系列,包括GPT-OSS-120B和GPT-OSS-20B两个版本。这是OpenAI自2019年发布GPT-2以来,时隔6年首次回归开源阵...
2025-08-07 新闻资讯
993

KittenTTS:轻量级开源文本转语音(TTS)引擎
KittenTTS 是由KittenML团队开发的一款轻量级开源文本转语音(Text-to-Speech, TTS)引擎,其核心定位是提供高效、低资源消耗的语音合成解决方案。主打“小巧精悍”的特点,模...
2025-08-07 新闻资讯
1937

Chunkr: Lumina AI 开源的一款文档智能处理工具
Chunkr 是由 Lumina AI 公司开发并开源的一款文档智能处理工具,专为将复杂文档转换为适合 RAG(检索增强生成)和 LLM(大语言模型)处理的结构化数据而设计,Chunkr 能够对 ...
2025-08-07 新闻资讯
807

MixGRPO:腾讯混元团队开源的图像生成框架
MixGRPO 是腾讯混元团队开源的一项突破性的图像生成框架,通过融合随机微分方程(SDE)与常微分方程(ODE)的混合采样策略,在文本到图像(Text-to-Image, T2I)生成任务中实...
2025-08-06 新闻资讯
852

Qwen-Image:阿里巴巴通义千问开源的首个图像生成基础模型
Qwen-Image 是阿里巴巴通义千问团队开源的首个图像生成基础模型,属于Qwen系列的重要成员。作为一个200亿参数的多模态扩散变换器(MMDiT)模型,它在复杂文本渲染和精确图像编...
2025-08-06 新闻资讯
1032

AudioGen-Omni:多模态音频生成与编辑框架
AudioGen-Omni 是一个多模态音频生成与编辑框架,旨在为用户提供一站式音频内容创作解决方案。该项目基于先进的深度学习技术构建,能够实现多种音频生成任务,包括但不限于音...
2025-08-06 新闻资讯
706

XBai-o4:问小白推出的第四代开源大语言模型,以反思型生成范式重塑复杂推理能力
XBai-o4 是由国内AI厂商"问小白"推出的第四代开源大语言模型,其核心创新在于引入了独创的"反思型生成范式"(Reflective Generative Form)架构,通过深度融合Long-CoT强化学习...
2025-08-05 新闻资讯
1097

MiDashengLM:小米开源的跨场景声音理解大模型
MiDashengLM 是小米集团旗下"MiLM Plus"团队于2025年8月4日正式发布并全量开源的声音理解大模型,该模型以Xiaomi Dasheng音频编码器为核心,结合Qwen2.5-Omni-7B Thinker自回...
2025-08-05 新闻资讯
1094

Windows-MCP:开源轻量级连接AI与Windows操作系统的MCP服务器
Windows-MCP 是一个开源的轻量级MCP服务器项目,旨在实现人工智能代理(如大型语言模型)与Windows操作系统之间的无缝集成。作为模型上下文协议(Model Context Protocol, MCP)的...
2025-08-05 新闻资讯
893

ScreenCoder:开源多智能体UI截图生成前端代码框架
ScreenCoder 是一个革命性的前端自动化开发工具,由香港科技大学、香港中文大学、CUHK MMLab和ARISELab联合研发,旨在通过多模态人工智能技术将用户界面(UI)设计图自动转换为...
2025-08-04 新闻资讯
1324