登录社区云,与社区用户共同成长
邀请您加入社区
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
至知创新研究院开源 IQuest-Q1—— 一款定位于提升智能体 CLI 系统的基础能力的智能体基座模型。它采用稀疏 MoE 架构,总参数 320B、激活 15B,上下文 524,288 token;训练在合成环境中进行:任务与环境一并合成,同一策略在多种脚手架中训练(保留各脚手架原生的工具与上下文管理,只有策略自身的错误才作为学习信号),四个专家模型再由多教师在线策略蒸馏(MOPD)整合进同一学
近日,上海人工智能实验室(上海AI实验室)推出决策模型书生·明决(Decision),性能超越Jev及同类开源模型,包含0.8B、2B、4B三档参数版本。 智能体在动态环境执行任务时,决策的速度与精度,直接决定交互的质量与任务落地的效果。书生·明决将原生视觉感知与指令遵循融为一体——在“看见”画面的同时做出精准决断。实测显示: 单卡4090环境中决策速度达30次/秒:书
9 月 23 日,斯坦福大学与 NVIDIA Research 联合团队发布 Contrastive Language Models(CLM),一类用对比学习目标训练的System One决策模型。首发版本 CLM-8B 用一个状态编码器加一个动作编码器,把当前状态与候选动作映射进同一嵌入空间,按余弦相似度打分,直接充当零样本动作分类器和验证器:骨干是冻结的 Qwen3-8B,只训练 2000 万
训不起 2.8T 的 K3,玩够了 124M 的 nanoGPT,想试试十亿参数、万亿 token 的预训练,门槛有多高? 这类模型被广泛使用,例如经典的 Qwen 系列(Qwen2-1.5B、Qwen2.5-1.5B、Qwen3-1.7B……)。不过 Qwen 系列尽管开源了权重,却未完整公开预训练配方。而 OLMo、SmolLM 等进一步开放了数据和训练细节,但复现依然昂贵:据估计,即使只有
中国电信星辰通用人工智能实验室开源文档解析模型 TeleOCR。该模型采用约 1.2B 参数的轻量级视觉语言架构,在单一框架内统一处理数字文档与相机拍摄文档,并将文字、版面、表格、公式和科学图表转换为可直接使用的结构化结果。 TeleOCR 在 OmniDocBench v1.6 取得 96.87 总分,登顶 OmniDocBench v1.6 榜单,超越 MinerU2.5-Pro、Paddle
HF 珞 https://huggingface.co/jinaai/jina-ocr-v1 魔搭 慄 https://modelscope.cn/models/jinaai/jina-ocr-v1 技术报告 https://arxiv.org/abs/2609.03181 API https://jina.ai/models/jina-ocr-v1 Jina-OCR-v1正式开源! 这
把一个视觉语言大模型部署到机器人本体上,是不少具身开发团队面临的工程难题。 模型在云端或仿真环境里跑通了,到了端侧,还要面对算力、内存和功耗的限制,以及机器人对响应时延的要求。算子适配、张量布局、内存分配和数值对齐,都需要逐项处理。对缺少推理系统专家的团队来说,这些工作往往拖慢了自研模型从 Demo 走向实际部署的进度。 缩短这段部署过程,模型的进步才能更快转化为机器人在真实任务中的能力。 为解决
举个例子:装修一套房子,各支队伍依次进场,每位师傅都能把手头的活做好,但如果交接时没说清“哪里要留线、哪里不能封、哪里需要避让”,麻烦就会在最后冒出来:预埋的线路没用上,柜子装上挡住了插座、开关与灯对不上号。每支队伍都完成了自己的任务,合在一起却不是原本想要的家。问题就在“局部正确、全局失联”。长文档解析也面临同样的困境。 模型可以识别每一页的文字、表格和图片,但如果翻页就“重新开工”,段落可能断
近日,小米团队正式发布并开源 Xiaomi MiMo-V2.6 系列。这是小米探索 RSI(递归自我改进)路径的关键一步:以可验证的复杂任务为基础,规模化扩展强化学习(RL)算力,让模型在持续的探索与反馈中不断拓展智能边界。 夫夷以近,则游者众;险以远,则至者少。在一个智能容易被复制的时代,团队选择把算力投进真实环境,让模型在反馈中一次次试错、自己学会。这条路更慢,也更少被看见。MiMo-V2.6
Convai Innovations 开源了非自回归 System 1 决策模型 Laya。开源不到 2 天,Laya 已升至 HuggingFace 热门模型榜第三名,GitHub 获得 2.1k Stars。 Laya 是一款面向分类与决策任务的非自回归模型,主要用于从文本中快速识别类别、风险等级和处理优先级。它不需要像大语言模型一样逐字生成回答,而是直接输出判断结果及对应概率