登录社区云,与社区用户共同成长
邀请您加入社区
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
智谱 AI 连续发布 GLM-5 系列两款模型。GLM-5.3 定位能力旗舰,通过极限后训练扩展在编码和网络安全基准上达到开源最强,并在真实代码库中发现 2,436 个漏洞。GLM-5.3-Flash 定位效率旗舰,全新 320B/18B 激活架构以 1⁄10 成本在编码和智能体任务上接近 Claude Opus 4.8。GLM-5.3-Flash 已以 MIT 协议开源,GLM-5.3 计划明天
大模型 RL 后训练正从单轮偏好优化和可验证推理,走向长上下文、Agentic RL 等持续与环境交互的任务。当前研究的热点随之转向:如何处理多轮交互中长尾轨迹和工具调用带来的时延,如何让样本生成、奖励计算和模型训练高效并行,以及如何通过更细粒度的信用分配稳定学习。ROLL 面向这些系统与算法问题,提供统一、可扩展的 RL 流水线,为使 ROLL 在昇腾上完整运行,昇腾团队完成了从平台层到工程化工
Qwen 家族开源 Qwen3.8-Flash-Next,这是一个开源权重的多模态 MoE 模型,同时作为 Qwen4 所用模型结构的先导预览。Qwen3.8-Flash-Next 的主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。原生支持 262,144 Token 上下文,并可通过 YaRN 扩展至 1,000,000 Tok
DiffSynth-Studio 团队开源 DiffSynth-WebUI,一套可私有化部署的扩散模型 LoRA 训练界面。它把魔搭 AIGC 专区背后的训练引擎搬到本地,训练 Krea2、MiniMax H3、Qwen-Image 等主流模型的 LoRA 无需写 Python 脚本、改 YAML 或记命令行参数,数据不出本机、权重私有。 当前支持 20 个模型系列、100+
小红书 FireRed 团队开源语音生成与编辑模型 FireRedTTS3,用同一套框架完成三类任务:多语言、多方言的零样本音色克隆,基于自然语言描述的声音设计,以及针对指定区域的精准语音编辑。 给定几秒钟的参考音频,模型可以用该音色说 24 种语言、21 种中文方言;给定一句文字描述,可以生成一个此前不存在的声音;给定一段现成语音,可以只修改指定的片段,其余部分与音色保持不变。克隆、设计、编辑三
腾讯视频智能创作团队,开源了组合指令视频编辑数据集 CoinVE-200K。该数据集包含 20 万组视频编辑样本对,每个视频均为 1080p 分辨率,最长可达 201 帧。每个样本包含 2 至 5 个原子编辑操作,涵盖多个目标主体,包括人物、物体和背景,并覆盖广泛的编辑类型,包括添加、移除、修改以及风格化。 团队同时开源了基于 Wan2.1-T2V-14B 与 Qwen
8 月以来,Ling-3.0 系列模型陆续开放。灵波先后开源 Ling-3.0-flash 和 Ling-3.0-tiny,希望为开发者提供覆盖不同规模、不同任务需求的开放模型选择。 开源之后,越来越多开发者开始基于 Ling-3.0 探索自己的应用场景,灵波也收到了很多来自社区真实的使用和反馈。大家普遍反馈:希望拥有一个更开放、更具可塑性的 Base Model,以便基于自己的数据、任务和目标开
Ornith AI 团队开源 Ornith-1.5 系列模型,包含 397B MoE(旗舰)、35B-A3B MoE(每 token 激活 3B)和 9B Dense(含手机端量化版本)三个规格,均采用 MIT 协议。Ornith-1.5 的核心方法是端到端自改进:模型自行提出任务、生成评测脚手架、产出解题轨迹,三者用 GRPO 联合优化形成闭环,不再依赖人工策划的训练任务和固定评测
Inco AI 团队开源面向 Qwen3.8-27B 的投机解码草稿模型 Qwen3.8-27B-DFlash2。该草稿模型参数量 1.92B、约 3.85GB,与目标模型 Qwen3.8-27B 配合使用,沿用 DFlash 系列一次前向传播并行预测整块 token 的草稿设计,并在此基础上新增轻量路径选择器和双抽头动态卷积,把草稿准确率保持到整块末尾。 在单张 NVIDIA H200、SGLa
FastFlowLM(FLM)发布 v0.9.46,正式接入魔搭社区(ModelScope)。它是首个专为 AMD Ryzen™ AI NPU 打造的开箱即用推理运行时,使用方式与 Ollama 类似——一行命令拉取模型、一行命令运行,但底层完全针对 NPU 硬件重新设计。此前模型默认从 Hugging Face 拉取,本次新增 --modelscope 1 参数,国内用户可将下载源切换到魔搭,无