登录社区云,与社区用户共同成长
邀请您加入社区
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
当数百B参数的大模型全速轰鸣,只为了处理一个极其简单的步骤时——昂贵的算力就像一个拧不紧的水龙头,大部分资源在无意义的低效消耗中白白流走。 奥特曼预测,全球人均月Token消耗将从今天的约10万飙升至5000亿,推理需求每年增长十倍。与此同时,成本正在击穿企业——有公司一个季度花光全年AI预算,微软被迫削减AI工具权限...当AI进入Agent、复杂推理和企业生产环境,高频调用和长链路任务让&qu
Qwen 团队开源 Qwen-Drive-1.0-4B,一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型。这是首个面向自动驾驶的视觉语言基础模型,在预训练阶段统一了 3D 感知与视觉问答,并进一步扩展至运动规划,同时保持预训练 VLM 的原始架构不变。 模型采用分阶段训练方案,将驾驶监督与通用视觉语言数据结合,在获得驾驶特定能力的同时,保留通用视觉理解与指令遵循能力。Qwen-Drive
SparkLLM 正式开源 Spark-X2.5 系列,包含 4B 与 1.7B 两档参数规模。该系列采用混合注意力架构,原生支持最长 1M token 上下文,覆盖 200 余种语言,并针对代码、工具调用和智能体工作流进行了后训练。两档模型均提供发布版、Base 版和 GGUF 版,可分别用于直接推理、继续训练与本地运行。 Spark-X2.5 多项能力基准测试 模型合集 https://mod
rg 凭借出色的性能与穷尽式匹配能力,已成为开发者和 Agent 检索本地内容的重要基础工具。对于函数名、配置名、错误信息或文档原文等明确目标,rg 能够提供快速、准确且可验证的结果。 随着 Agent 开始处理代码理解、故障定位、知识问答和资料分析等复杂任务,检索输入逐渐从明确的符号或文本,转变为对业务现象、实现意图和知识概念的自然语言描述。 这类查询与代码或文档中的实际表述往往缺乏直
腾讯混元团队正式开源新一代旗舰 MoE 模型 Hy4 preview,总参数 770B、每 token 激活 49B、上下文长度 1M,采用 Apache 2.0 协议,在代码、办公、科学等真实生产力任务上展现出卓越能力。 Hy4 preview 基准测试总览 开源地址 模型开源包括 BF16 与 FP8 两个版本: Hy4 preview:https://models
过去几个月,实时视频世界模型突然成为一张拥挤的牌桌。PixVerse、LingBot、阿里「快乐生蚝」、智象未来等团队先后发布实时视频世界模型 Demo,并不约而同地将第一站指向互动娱乐/AI 游戏——当视频能够持续生成、实时响应,人就不再只是观看一段内容,而是可以“进入”一个由模型生成的世界。 在这个拥挤的牌桌上,Loopit 带来了一个值得注意的突破:其发布的实时互动世界模型 Z
智谱 AI 连续发布 GLM-5 系列两款模型。GLM-5.3 定位能力旗舰,通过极限后训练扩展在编码和网络安全基准上达到开源最强,并在真实代码库中发现 2,436 个漏洞。GLM-5.3-Flash 定位效率旗舰,全新 320B/18B 激活架构以 1⁄10 成本在编码和智能体任务上接近 Claude Opus 4.8。GLM-5.3-Flash 已以 MIT 协议开源,GLM-5.3 计划明天
大模型 RL 后训练正从单轮偏好优化和可验证推理,走向长上下文、Agentic RL 等持续与环境交互的任务。当前研究的热点随之转向:如何处理多轮交互中长尾轨迹和工具调用带来的时延,如何让样本生成、奖励计算和模型训练高效并行,以及如何通过更细粒度的信用分配稳定学习。ROLL 面向这些系统与算法问题,提供统一、可扩展的 RL 流水线,为使 ROLL 在昇腾上完整运行,昇腾团队完成了从平台层到工程化工
Qwen 家族开源 Qwen3.8-Flash-Next,这是一个开源权重的多模态 MoE 模型,同时作为 Qwen4 所用模型结构的先导预览。Qwen3.8-Flash-Next 的主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。原生支持 262,144 Token 上下文,并可通过 YaRN 扩展至 1,000,000 Tok
DiffSynth-Studio 团队开源 DiffSynth-WebUI,一套可私有化部署的扩散模型 LoRA 训练界面。它把魔搭 AIGC 专区背后的训练引擎搬到本地,训练 Krea2、MiniMax H3、Qwen-Image 等主流模型的 LoRA 无需写 Python 脚本、改 YAML 或记命令行参数,数据不出本机、权重私有。 当前支持 20 个模型系列、100+