登录社区云,与社区用户共同成长
邀请您加入社区
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
训不起 2.8T 的 K3,玩够了 124M 的 nanoGPT,想试试十亿参数、万亿 token 的预训练,门槛有多高? 这类模型被广泛使用,例如经典的 Qwen 系列(Qwen2-1.5B、Qwen2.5-1.5B、Qwen3-1.7B……)。不过 Qwen 系列尽管开源了权重,却未完整公开预训练配方。而 OLMo、SmolLM 等进一步开放了数据和训练细节,但复现依然昂贵:据估计,即使只有
中国电信星辰通用人工智能实验室开源文档解析模型 TeleOCR。该模型采用约 1.2B 参数的轻量级视觉语言架构,在单一框架内统一处理数字文档与相机拍摄文档,并将文字、版面、表格、公式和科学图表转换为可直接使用的结构化结果。 TeleOCR 在 OmniDocBench v1.6 取得 96.87 总分,登顶 OmniDocBench v1.6 榜单,超越 MinerU2.5-Pro、Paddle
HF 珞 https://huggingface.co/jinaai/jina-ocr-v1 魔搭 慄 https://modelscope.cn/models/jinaai/jina-ocr-v1 技术报告 https://arxiv.org/abs/2609.03181 API https://jina.ai/models/jina-ocr-v1 Jina-OCR-v1正式开源! 这
把一个视觉语言大模型部署到机器人本体上,是不少具身开发团队面临的工程难题。 模型在云端或仿真环境里跑通了,到了端侧,还要面对算力、内存和功耗的限制,以及机器人对响应时延的要求。算子适配、张量布局、内存分配和数值对齐,都需要逐项处理。对缺少推理系统专家的团队来说,这些工作往往拖慢了自研模型从 Demo 走向实际部署的进度。 缩短这段部署过程,模型的进步才能更快转化为机器人在真实任务中的能力。 为解决
举个例子:装修一套房子,各支队伍依次进场,每位师傅都能把手头的活做好,但如果交接时没说清“哪里要留线、哪里不能封、哪里需要避让”,麻烦就会在最后冒出来:预埋的线路没用上,柜子装上挡住了插座、开关与灯对不上号。每支队伍都完成了自己的任务,合在一起却不是原本想要的家。问题就在“局部正确、全局失联”。长文档解析也面临同样的困境。 模型可以识别每一页的文字、表格和图片,但如果翻页就“重新开工”,段落可能断
近日,小米团队正式发布并开源 Xiaomi MiMo-V2.6 系列。这是小米探索 RSI(递归自我改进)路径的关键一步:以可验证的复杂任务为基础,规模化扩展强化学习(RL)算力,让模型在持续的探索与反馈中不断拓展智能边界。 夫夷以近,则游者众;险以远,则至者少。在一个智能容易被复制的时代,团队选择把算力投进真实环境,让模型在反馈中一次次试错、自己学会。这条路更慢,也更少被看见。MiMo-V2.6
Convai Innovations 开源了非自回归 System 1 决策模型 Laya。开源不到 2 天,Laya 已升至 HuggingFace 热门模型榜第三名,GitHub 获得 2.1k Stars。 Laya 是一款面向分类与决策任务的非自回归模型,主要用于从文本中快速识别类别、风险等级和处理优先级。它不需要像大语言模型一样逐字生成回答,而是直接输出判断结果及对应概率
Qwen 团队开源 Qwen-Image-2.1,将文生图与图像编辑统一在一个模型中。模型视觉生成部分仅 7B 参数,采用 32 层 Single-Stream DiT,在官方 Qwen-Image-Bench 公开评测中获得 60.28 分,并原生支持透明图生成与最多 10 张参考图编辑。 开源地址: 模型链接 https://modelscope.cn/models/Qwen/Qwen-Ima
近日,中电信人工智能科技有限公司正式发布 Xing4.0-29B-A4B——面向智能体时代的新一代星辰大模型。这是一款总参数量 29B、激活参数仅 4B 的 MoE 智能体大模型,原生支持 256K 上下文,可扩展至 512K,是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。 作为新一代星辰大模型,Xing4.0 在 TeleChat1-3 系列基础上全面升级,
Prism ML由一支 Caltech 研究团队创立,长期研究"压缩神经网络而不牺牲推理能力";Ternary Bonsai 2 27B是继 7 月首代模型之后,开源的新一代三元多模态模型。它基于 Qwen3.8-27B 构建,权重被压到三值 {−1, 0, +1},体积 5.93GB(全精度为 53.80GB,约 1/9),在 20 项基准上平均 83.9 分,保留全精度基线