登录社区云,与社区用户共同成长
邀请您加入社区
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
9月13日,在2026浦江创新论坛(第十九届)人工智能赋能科学研究专题论坛上,上海人工智能实验室(上海AI实验室)发布书生多模态大模型 S2(以下简称“书生-S2”)。重点提升了长程科研能力与智能体能力,并通过创新架构设计探索科学专业知识的持续扩展,为长周期科研任务提供更坚实的能力基础。 书生-S2在知识、代码、智能体等通用能力上达到了开源模型第一梯队,同时在Biology-Inst
NeuG v0.2.0 在事务一致性之上统一图遍历、向量检索和全文检索。三种检索共用一份数据,通过 Cypher 组合;代码以 Apache 2.0 开源。 请关注加星:https://github.com/alibaba/neug Agent 应用离不开检索,而检索有三种诉求 Agent 应用要检索的对象各不相同:私有文档、代码库、智能体的长期记忆,或是商品、工单、日志。但要做的事
基元律动(TokenRhythm)联合无问芯穹,与清华大学、北京大学、香港中文大学、阿里巴巴等合作伙伴发布 NeoHorse-1,包含 4B 和 9B 两个版本。该系列面向 Agent 场景训练,覆盖工具调用、任务规划、深度搜索和代码生成。 NeoHorse-1 4B 在 Agent 任务上的表现已超过多个参数量显著更大的通用模型;9B 版本在更复杂的推理与长程规划任务上表现更优。两个规模的后训练
DeepSeek 正式发布并开源 DeepSeek-V4.1-Flash。这是一款采用 552B 骨干参数的多模态 MoE 模型,原生支持图文输入,最长上下文达到 100 万 token。 模型采用全新的 非对称Causal-Encoder-Decoder 结构,使模型在预填充期间每个 token 激活 8B 参数,在解码期间激活 16B 参数,对输入占主导的智能体场景尤其具备成本效
回声与多人重叠讲话,是语音交互和实时通信中两类常见的信号干扰。扬声器回放进入麦克风会形成声学回声,多人同时发声则会产生语音混叠,直接影响语音识别、语音唤醒、对话系统和会议通话的输入质量。 Qwen Audio 团队开源两项语音增强成果:FLASepformer 面向 8 kHz 单声道双说话人分离,通过线性复杂度注意力提升长序列处理效率;JAEC 面向 16 kHz 实时声学回声消除,以 10 m
Nex-AGI 是由上海创智学院发起的创新联盟,旨在建设一个可持续的能动性闭环开源生态。今天,Nex-AGI 正式开源 Nex-N2.5,一个面向真实环境长程任务的智能体模型家族,包含 Mini、Pro、Max 三个版本。 Nex-N2.5 三档模型 三款模型共享“智能体后训练”这一主线,按任务与部署规模形成组合: Mini 与 Pro 延续 Nex-N2 的多模态底座,重点强化计算
9 月 8 日,面壁智能联合 OpenBMB 开源 MiniCPM5-2B。模型采用 2B 参数高密度架构,支持工具调用、深度搜索、代码生成等任务,面向手机、PC、车机和机器人等端侧设备,初步形成通用 Agent 能力。 Artificial Analysis Intelligence Index 最新评测显示,MiniCPM5-2B 综合能力得分为 23 分,在全球 4B 参
H3-World 是首个基于 MiniMax-H3 构建的交互式世界模型。给定同一张首帧图像,模型可以根据不同的按键序列,生成对应的角色移动与相机运动。 该工作将视频模型已有的语言动作理解用于控制,通过轻量微调,只用 8k 条数据和 0.199% 的可训练参数,在保留底模原有的生成能力的同时,使模型拥有角色和相机控制能力。 H3-World H3-World 将角色与相机动作转换为文本指令,沿用
Institute of Foundation Models(IFM)是由穆罕默德·本·扎耶德人工智能大学(MBZUAI)于 2025 年创立的全球 AI 研究机构,在阿布扎比、硅谷和巴黎设有研究团队,专注于开放、独立的前沿基础模型研发。 IFM 此次发布 K2 Horizon 系列,一次覆盖 0.9B、3.7B、7B、32B、36B-A4B 和 375B-A23B 六种规模,
OpenVDN 团队开源 VDN-Minimax-H3(VDN-H3),同时公开模型权重、训练代码与优化后的推理实现。该工作基于 MiniMax-H3,将局部 Softmax 注意力与按帧更新的线性注意力结合,再通过少步蒸馏降低视频生成开销。 在官方测试中,VDN-H3 使用 8 张 NVIDIA B200,以 8 步完成一段约 14.4 秒、768p 视频的去噪,耗时 11.23 秒。 官方同时