登录社区云,与社区用户共同成长
邀请您加入社区
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
基元律动(TokenRhythm)联合无问芯穹,与清华大学、北京大学、香港中文大学、阿里巴巴等合作伙伴发布 NeoHorse-1,包含 4B 和 9B 两个版本。该系列面向 Agent 场景训练,覆盖工具调用、任务规划、深度搜索和代码生成。 NeoHorse-1 4B 在 Agent 任务上的表现已超过多个参数量显著更大的通用模型;9B 版本在更复杂的推理与长程规划任务上表现更优。两个规模的后训练
DeepSeek 正式发布并开源 DeepSeek-V4.1-Flash。这是一款采用 552B 骨干参数的多模态 MoE 模型,原生支持图文输入,最长上下文达到 100 万 token。 模型采用全新的 非对称Causal-Encoder-Decoder 结构,使模型在预填充期间每个 token 激活 8B 参数,在解码期间激活 16B 参数,对输入占主导的智能体场景尤其具备成本效
回声与多人重叠讲话,是语音交互和实时通信中两类常见的信号干扰。扬声器回放进入麦克风会形成声学回声,多人同时发声则会产生语音混叠,直接影响语音识别、语音唤醒、对话系统和会议通话的输入质量。 Qwen Audio 团队开源两项语音增强成果:FLASepformer 面向 8 kHz 单声道双说话人分离,通过线性复杂度注意力提升长序列处理效率;JAEC 面向 16 kHz 实时声学回声消除,以 10 m
Nex-AGI 是由上海创智学院发起的创新联盟,旨在建设一个可持续的能动性闭环开源生态。今天,Nex-AGI 正式开源 Nex-N2.5,一个面向真实环境长程任务的智能体模型家族,包含 Mini、Pro、Max 三个版本。 Nex-N2.5 三档模型 三款模型共享“智能体后训练”这一主线,按任务与部署规模形成组合: Mini 与 Pro 延续 Nex-N2 的多模态底座,重点强化计算
9 月 8 日,面壁智能联合 OpenBMB 开源 MiniCPM5-2B。模型采用 2B 参数高密度架构,支持工具调用、深度搜索、代码生成等任务,面向手机、PC、车机和机器人等端侧设备,初步形成通用 Agent 能力。 Artificial Analysis Intelligence Index 最新评测显示,MiniCPM5-2B 综合能力得分为 23 分,在全球 4B 参
H3-World 是首个基于 MiniMax-H3 构建的交互式世界模型。给定同一张首帧图像,模型可以根据不同的按键序列,生成对应的角色移动与相机运动。 该工作将视频模型已有的语言动作理解用于控制,通过轻量微调,只用 8k 条数据和 0.199% 的可训练参数,在保留底模原有的生成能力的同时,使模型拥有角色和相机控制能力。 H3-World H3-World 将角色与相机动作转换为文本指令,沿用
Institute of Foundation Models(IFM)是由穆罕默德·本·扎耶德人工智能大学(MBZUAI)于 2025 年创立的全球 AI 研究机构,在阿布扎比、硅谷和巴黎设有研究团队,专注于开放、独立的前沿基础模型研发。 IFM 此次发布 K2 Horizon 系列,一次覆盖 0.9B、3.7B、7B、32B、36B-A4B 和 375B-A23B 六种规模,
OpenVDN 团队开源 VDN-Minimax-H3(VDN-H3),同时公开模型权重、训练代码与优化后的推理实现。该工作基于 MiniMax-H3,将局部 Softmax 注意力与按帧更新的线性注意力结合,再通过少步蒸馏降低视频生成开销。 在官方测试中,VDN-H3 使用 8 张 NVIDIA B200,以 8 步完成一段约 14.4 秒、768p 视频的去噪,耗时 11.23 秒。 官方同时
当数百B参数的大模型全速轰鸣,只为了处理一个极其简单的步骤时——昂贵的算力就像一个拧不紧的水龙头,大部分资源在无意义的低效消耗中白白流走。 奥特曼预测,全球人均月Token消耗将从今天的约10万飙升至5000亿,推理需求每年增长十倍。与此同时,成本正在击穿企业——有公司一个季度花光全年AI预算,微软被迫削减AI工具权限...当AI进入Agent、复杂推理和企业生产环境,高频调用和长链路任务让&qu
Qwen 团队开源 Qwen-Drive-1.0-4B,一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型。这是首个面向自动驾驶的视觉语言基础模型,在预训练阶段统一了 3D 感知与视觉问答,并进一步扩展至运动规划,同时保持预训练 VLM 的原始架构不变。 模型采用分阶段训练方案,将驾驶监督与通用视觉语言数据结合,在获得驾驶特定能力的同时,保留通用视觉理解与指令遵循能力。Qwen-Drive