vocab_size = 154856parameters = 1,309,190,144约 1309.19M这里有一个必须写进博客的数字:154856 × 2048 ≈ 3.17e8词表 Embedding 约占 24% 参数也就是说,V5 的“1B”有将近四分之一花在 Embedding 上。这...
OpsLM Phase3:一次夭折的 Instruct 实验——为什么 33M Base 没被 SFT 救回来前两阶段,我已经从零实现了一个 Decoder-only Transformer,并完成了一轮面向 Linux、Kubernetes、Docker、Prometheus、vLLM 等技术文档...
从几十 KB 到 2300 万 Token:我把 OpsLM-Toy 真正训练成了一个领域 Base ModelOpsLM-Toy 第二阶段训练记录:数据工程、Tokenizer V2、Packed Dataset、33M Transformer、10000 Step 预训练,以及一次非常重要的失败...
我从零训练了一个 30M 的运维小模型:OpsLM-Toy 第一阶段复盘这不是一篇“调用现成框架训练模型”的教程,而是我真的从 Tokenizer、Embedding、Self-Attention、Multi-Head Attention、MLP、Transformer Block 一层一层写起,最...
环境介绍GPU: 4090 24G显存下载模型安装下载工具apt install -y aria2 -i https://mirrors.cloud.tencent.com/pypi/simple下载模型aria2c -x 16 -s 16 -k 1M https://www.modelscope...
模型Qwen2.5-14B-Instruct-AWQ 是阿里云 Qwen2.5 系列中的一个14B(140亿参数)指令微调大语言模型的4bit AWQ量化版本,专为高效推理部署优化,在保持较强的中文、英文理解与生成能力的同时,大幅降低显存占用与计算成本,适合在单卡GPU(如4090/5090)上进行...
前置环境租用4090gpu https://ppio.com cuda12.8.1版本安装conda下载wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh安装安装过程中注意:一路回车看到 Do you ...
本文介绍了如何在消费级显卡上使用SGLang框架推理千问最新发布Qwen3.5-9B版本的小模型,无坑版本,可直接运行,显卡是autodl租的,官网:https://autodl.com配置参数如下:创建虚拟环境SGLang + FlashAttention 在 3.10 最稳conda creat...
部署集群参考文档: https://blog.csdn.net/weixin_32089639/article/details/148162370部署存储SClocal-pathkubectl apply -f https://raw.githubusercontent.com/rancher/lo...