登录社区云,与社区用户共同成长
邀请您加入社区
近期国产OCR技术迎来爆发式发展,DeepSeek-OCR和PaddleOCR-VL成为焦点。PaddleOCR-VL在OmniBenchDoc V1.5榜单中取得综合性能全球第一,具备轻量高效(仅0.9B参数)、109种语言支持和卓越的版面理解能力。实测表现突出,能精准识别复杂公式、医生手写处方、草书等传统OCR难以处理的场景。该技术已开源5年,GitHub星标超50k,累计下载量突破900万,
Context engineering是AI agent开发中的核心方法论,旨在解决海量工具调用和长推理导致的上下文瓶颈问题。文章系统梳理了五大策略:Offload(转移)、Reduce(压缩)、Retrieve(检索)、Isolate(隔离)和Cache(缓存),帮助开发者优化context管理,提升agent性能与效率。同时,文章结合The Bitter Lesson启示,指出随着模型能力提升
Qwen-Agent:从多模态理解到自主执行的AI框架革命 阿里巴巴开源的Qwen-Agent项目代表了AI从被动对话到主动执行的重要进化。与传统AI助手(如豆包、Kimi)不同,Qwen-Agent是一个开发框架,而非成品应用,它让开发者能构建具备多模态理解、工具调用和规划能力的智能体。 核心突破: 多模态处理能力,支持图片、文字混合输入和复杂推理 从问答到执行的任务自主规划能力 高度可定制化,
本文详细介绍了在ModelScope社区下载模型的三种主要方式:使用命令行工具、ModelScope SDK以及Git。默认情况下,模型会下载到~/.cache/modelscope/hub目录,但可以通过设置环境变量MODELSCOPE_CACHE来修改缓存路径。命令行工具支持下载整个模型仓库或指定文件,并允许通过--include和--exclude参数进行文件过滤