登录社区云,与社区用户共同成长
邀请您加入社区
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
SparkLLM 正式开源 Spark-X2.5 系列,包含 4B 与 1.7B 两档参数规模。该系列采用混合注意力架构,原生支持最长 1M token 上下文,覆盖 200 余种语言,并针对代码、工具调用和智能体工作流进行了后训练。两档模型均提供发布版、Base 版和 GGUF 版,可分别用于直接推理、继续训练与本地运行。 Spark-X2.5 多项能力基准测试 模型合集 https://mod
rg 凭借出色的性能与穷尽式匹配能力,已成为开发者和 Agent 检索本地内容的重要基础工具。对于函数名、配置名、错误信息或文档原文等明确目标,rg 能够提供快速、准确且可验证的结果。 随着 Agent 开始处理代码理解、故障定位、知识问答和资料分析等复杂任务,检索输入逐渐从明确的符号或文本,转变为对业务现象、实现意图和知识概念的自然语言描述。 这类查询与代码或文档中的实际表述往往缺乏直
腾讯混元团队正式开源新一代旗舰 MoE 模型 Hy4 preview,总参数 770B、每 token 激活 49B、上下文长度 1M,采用 Apache 2.0 协议,在代码、办公、科学等真实生产力任务上展现出卓越能力。 Hy4 preview 基准测试总览 开源地址 模型开源包括 BF16 与 FP8 两个版本: Hy4 preview:https://models
过去几个月,实时视频世界模型突然成为一张拥挤的牌桌。PixVerse、LingBot、阿里「快乐生蚝」、智象未来等团队先后发布实时视频世界模型 Demo,并不约而同地将第一站指向互动娱乐/AI 游戏——当视频能够持续生成、实时响应,人就不再只是观看一段内容,而是可以“进入”一个由模型生成的世界。 在这个拥挤的牌桌上,Loopit 带来了一个值得注意的突破:其发布的实时互动世界模型 Z
智谱 AI 连续发布 GLM-5 系列两款模型。GLM-5.3 定位能力旗舰,通过极限后训练扩展在编码和网络安全基准上达到开源最强,并在真实代码库中发现 2,436 个漏洞。GLM-5.3-Flash 定位效率旗舰,全新 320B/18B 激活架构以 1⁄10 成本在编码和智能体任务上接近 Claude Opus 4.8。GLM-5.3-Flash 已以 MIT 协议开源,GLM-5.3 计划明天
大模型 RL 后训练正从单轮偏好优化和可验证推理,走向长上下文、Agentic RL 等持续与环境交互的任务。当前研究的热点随之转向:如何处理多轮交互中长尾轨迹和工具调用带来的时延,如何让样本生成、奖励计算和模型训练高效并行,以及如何通过更细粒度的信用分配稳定学习。ROLL 面向这些系统与算法问题,提供统一、可扩展的 RL 流水线,为使 ROLL 在昇腾上完整运行,昇腾团队完成了从平台层到工程化工
Qwen 家族开源 Qwen3.8-Flash-Next,这是一个开源权重的多模态 MoE 模型,同时作为 Qwen4 所用模型结构的先导预览。Qwen3.8-Flash-Next 的主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。原生支持 262,144 Token 上下文,并可通过 YaRN 扩展至 1,000,000 Tok
DiffSynth-Studio 团队开源 DiffSynth-WebUI,一套可私有化部署的扩散模型 LoRA 训练界面。它把魔搭 AIGC 专区背后的训练引擎搬到本地,训练 Krea2、MiniMax H3、Qwen-Image 等主流模型的 LoRA 无需写 Python 脚本、改 YAML 或记命令行参数,数据不出本机、权重私有。 当前支持 20 个模型系列、100+
小红书 FireRed 团队开源语音生成与编辑模型 FireRedTTS3,用同一套框架完成三类任务:多语言、多方言的零样本音色克隆,基于自然语言描述的声音设计,以及针对指定区域的精准语音编辑。 给定几秒钟的参考音频,模型可以用该音色说 24 种语言、21 种中文方言;给定一句文字描述,可以生成一个此前不存在的声音;给定一段现成语音,可以只修改指定的片段,其余部分与音色保持不变。克隆、设计、编辑三
腾讯视频智能创作团队,开源了组合指令视频编辑数据集 CoinVE-200K。该数据集包含 20 万组视频编辑样本对,每个视频均为 1080p 分辨率,最长可达 201 帧。每个样本包含 2 至 5 个原子编辑操作,涵盖多个目标主体,包括人物、物体和背景,并覆盖广泛的编辑类型,包括添加、移除、修改以及风格化。 团队同时开源了基于 Wan2.1-T2V-14B 与 Qwen