登录社区云,与社区用户共同成长
邀请您加入社区
本文介绍了使用SWIFT框架对Qwen2.5-3B-Instruct模型进行微调的完整流程。训练完成后,在交互式推理测试中,模型能够正确回答问题,并按要求生成带注释的示例代码(如快速排序实现)。
本文手把手带你从零微调大模型。大模型微调复杂且技术难度高,本文仅带你走一遍微调过程,不涉过多技术细节,希望助你了解微调流程 。
阿里云魔塔社区(ModelScope)是一个AI模型共享平台,提供丰富的预训练模型资源。用户可通过简单命令(如pip install modelscope)安装SDK,并使用modelscope download指令下载指定模型(示例中下载了facebook的data2vec-audio-large-960h模型到本地./dir目录)。该平台降低了AI模型使用门槛,支持开发者快速获取和应用先进模型
近期国产OCR技术迎来爆发式发展,DeepSeek-OCR和PaddleOCR-VL成为焦点。PaddleOCR-VL在OmniBenchDoc V1.5榜单中取得综合性能全球第一,具备轻量高效(仅0.9B参数)、109种语言支持和卓越的版面理解能力。实测表现突出,能精准识别复杂公式、医生手写处方、草书等传统OCR难以处理的场景。该技术已开源5年,GitHub星标超50k,累计下载量突破900万,
task: 额外的task参数,可选,指定后不会使用默认的task,比如模型configuration.json中指定了task='backbone',在此指定task='text-classification',则会尝试使用text-classification模型加载checkpoint。SOTA model:state-of-the-art model,并不是特指某个具体的模型,而是指在该项
Qwen-Agent:从多模态理解到自主执行的AI框架革命 阿里巴巴开源的Qwen-Agent项目代表了AI从被动对话到主动执行的重要进化。与传统AI助手(如豆包、Kimi)不同,Qwen-Agent是一个开发框架,而非成品应用,它让开发者能构建具备多模态理解、工具调用和规划能力的智能体。 核心突破: 多模态处理能力,支持图片、文字混合输入和复杂推理 从问答到执行的任务自主规划能力 高度可定制化,
modelscope魔塔社区snapshot_download下载模型文件电脑默认保存位置
本文介绍两种将大模型上传到魔塔社区的方法。
【代码】modelscope方式下载大模型。
介绍常用的两种在模型社区如魔塔(ModelScope)和抱抱脸(Hugging Face),下载预训练模型的方法,然后说明各种方法里面的小细节。
/mmcv安装报错,可以去官网下载来安装https://mmcv.readthedocs.io/en/latest/get_started/installation.html,或在官网配置条件获得安装指令,如下图。安装出错可以考虑直接调整mmcv到底版本:pip install mmcv==1.7 -f https://download.openmmlab.com/mmcv/dist/cu121/