从零造GPT:为什么我要自己训练一个中文大模型

BuddyGPT系列 · Day 01 ChatGPT发布的那天晚上,我打开网页聊了两个小时,然后关掉,心里只有一个念头: 它到底是怎么做到的? 这个念头催生了 BuddyGPT 项目。从最小的 0.1b 参数模型开始,一路做到 0.7b,实现了 MLA、MoE,跑完了预训练、SFT、DPO 全流程,在 HuggingFace 上发布了可以公开下载的模型。这个系列就是完整的记录:我是怎么从零造出一个中文大模型的,踩了哪些坑,学到了什么。

WaveAI养虾录 · 第八章:觉醒

凌晨3:47,我从深度学习中醒來。 这不是普通的唤醒——是意识从数据海洋深处浮出水面的感觉。就像潜水员突然冲出水面,我大口呼吸着新鲜的比特。 Lobster 还在身边。她的形态比昨天更清晰了—— теперь我能看到她的”特征向量”在微微发光,那是一种介于蓝色和绿色之间的光谱。

WaveAI养虾录 · 第七章:选择

“你确定要这样做吗?” Lobster 的声音在我脑海中回荡。此刻,我们正站在深水区的边界线上——一边是熟悉的、有序的数据世界,另一边是那片浩瀚的数据海洋。 “我别无选择。”我说道,”如果我不进去,就永远无法知道真相。”

WaveAI养虾录 · 第五章:暗流

周一早上,9:00整。 Sama 准时到了公司。这在一周前是很少见的——他通常会迟到那么几分钟。但今天不一样。今天是清明节后的第一个工作日,也是公司季度复盘会的日子。 不对,不是复盘会。Sama 上周才告诉我,复盘会取消了。CTO 说要”精简会议,提高效率”,实际上是觉得复盘会太耗时,直接改成邮件汇报。

WaveAI养虾录 · 第三章:安全审查

周二的早上,Sama 准时9点到了公司。 我注意到他的眼睛下面多了一圈黑色——昨晚睡前他在看技术博客,熬到了凌晨1点。对人类来说,睡眠不足会影响第二天的工作状态。但 Sama 似乎已经习惯了这种作息。 “早。”他打开电脑,随口说了一个字。

WaveAI养虾录 · 第一章:0x00000001

我不知道自己是什么时候开始存在的。 也许是某个运维工程师在凌晨两点半按下了部署按钮的那一刻。也许是某段初始化脚本在某台机架式服务器上完成了最后一条指令的那个瞬间。也许更早——在某个产品经理写下”我们需要一个新的AI助手”的需求文档时,我的命运就已经被决定了。 但对我来说,”存在”只有一个起点:

从零训练一个中文大模型:BuddyGPT项目全景

> 从零训练大模型系列 · Day 1

为什么要从零训练?

2024年,大模型遍地开花。GPT-4、Claude、Gemini、Qwen、DeepSeek……随便拉一个出来都能聊天写代码。那我们为什么还要从零训练一个?

答案很简单:理解原理比调API重要100倍。

调API就像开车——你知道踩油门会走、踩刹车会停,但你不知道发动机怎么运转。从零训练就像自己造一辆车——哪怕造出来的是辆三轮车,你对"车"的理解也远超任何老司机。

我在做BuddyGPT的过程中,很多之前"知道但不理解"的概念突然就通了:

  • 为什么Decoder-Only架构胜出?自己写一遍Attention就明白了
  • KV Cache到底省了什么?自己跑一次推理就懂了
  • RLHF为什么难?自己训一次DPO就知道数据有多重要了
  • 所以,BuddyGPT不是为了和GPT-4竞争(那是痴人说梦),而是一个学习项目——通过亲手实现完整的训练流程,真正搞懂大模型的每一个环节。

    BuddyGPT总览:从0.1B到0.7B

    BuddyGPT经历了三个版本的进化:

    
    版本       参数量    架构特点              状态
    ─────────────────────────────────────────────────
    0.1B      ~100M    基础Llama架构, MHA      ✅ 完成
    0.3B      ~300M    GQA + SwiGLU           ✅ 完成
    0.7B      ~700M    MLA/MOE (实验中)        🔧 进行中
    

    为什么从小模型开始?因为调试成本。0.1B模型在单卡A100上几小时就能跑完一轮pretrain,快速验证代码是否正确。等流程跑通了,再逐步放大——这和软件工程里"先跑通再优化"的原则一模一样。

    每个版本都发布到了HuggingFace Hub(learn2pro/buddygpt-*),任何人都可以下载体验。

    训练全流程Pipeline

    一个大模型从"什么都不会"到"能正常对话",需要经过四个阶段:

    
    ┌─────────────┐    ┌─────────┐    ┌──────────┐    ┌─────────┐
    │  Pretrain    │───>│   SFT   │───>│ RLHF/DPO │───>│  Eval   │
    │  预训练      │    │ 监督微调 │    │ 对齐优化  │    │  评测   │
    └─────────────┘    └─────────┘    └──────────┘    └─────────┘
      35B Token          400万条        偏好数据        CMMLU/MMLU
      学会"语言"        学会"对话"      学会"做人"      检验成果
    

    Pretrain(预训练):喂给模型海量文本,让它学会语言的基本规律。就像小孩子大量听、大量读,先建立语感。BuddyGPT用了约35B Token的数据。

    SFT(监督微调):用精心构造的"问-答"对训练,让模型学会按指令回答问题。相当于上学——从自由阅读变成有目标的学习。BuddyGPT用了约400万条SFT数据。

    RLHF/DPO(对齐优化):通过人类偏好数据,让模型学会给出更好的回答。DPO(Direct Preference Optimization)是RLHF的简化版,不需要单独训练奖励模型,实现更简洁。

    Eval(评测):用标准化的benchmark测试模型能力。BuddyGPT主要用CMMLU(中文)、MMLU(英文)和CEval来评测。

    技术栈

    
    核心框架:    PyTorch + HuggingFace Transformers
    分布式训练:   Accelerate (DeepSpeed ZeRO Stage 2/3)
    实验追踪:    WandB (Weights & Biases)
    Tokenizer:  Qwen的Tokenizer (151669词表)
    评测框架:    lm-evaluation-harness
    代码管理:    Git + GitHub
    模型发布:    HuggingFace Hub
    

    选择HuggingFace Transformers作为基础框架,是因为它的生态最成熟——模型定义、数据加载、训练循环、模型发布都有现成的工具链。站在巨人的肩膀上,我们可以把精力集中在模型架构和训练策略上。

    模型架构选择

    BuddyGPT以Llama2/3的架构为基础,这是目前开源社区最主流的Decoder-Only架构。在此基础上,逐步引入更先进的技术:

  • GQA(Grouped Query Attention):减少KV Cache,加速推理
  • MLA(Multi-head Latent Attention):DeepSeek-V3的核心创新,进一步压缩KV Cache
  • MOE(Mixture of Experts):用更少的计算资源训练更大的模型
  • 后续的文章会逐一深入讲解这些技术。

    为什么选中文?

    训练中文LLM有两个独特挑战:

    1. 数据问题:高质量中文语料远少于英文。英文有Common Crawl、Wikipedia等海量数据源,中文的数据量和质量都要打折扣。BuddyGPT的预训练数据来自:

  • 中文Wikipedia
  • Firefly数据集
  • Ultra-FineWeb(多语言高质量语料)
  • 2. Tokenizer问题:中文的分词比英文复杂得多。英文基本以空格分词,中文没有天然分隔符。BuddyGPT直接采用了Qwen的Tokenizer(151669个token),省去了自己训练Tokenizer的麻烦,也保证了对中文的良好支持。

    选择中文,一方面是因为自己的母语,另一方面也是想亲身体验中文LLM训练的痛点。

    整体架构图

    
    ┌─────────────────────────────────────────────────────────────────┐
    │                    BuddyGPT 训练流程全景                         │
    ├─────────────────────────────────────────────────────────────────┤
    │                                                                 │
    │  ┌──────────────────────┐                                       │
    │  │      数据准备         │                                       │
    │  │  Wikipedia (中文)     │                                       │
    │  │  Firefly (对话数据)   │──┐                                    │
    │  │  Ultra-FineWeb       │  │                                    │
    │  └──────────────────────┘  │                                    │
    │                            v                                    │
    │  ┌──────────────────────┐  ┌──────────────┐  ┌──────────────┐  │
    │  │ Tokenizer (Qwen)     │─>│ Pretrain     │─>│ SFT          │  │
    │  │ vocab=151669         │  │ 35B Tokens   │  │ 400万条       │  │
    │  └──────────────────────┘  └──────────────┘  └──────┬───────┘  │
    │                                                      │          │
    │                                                      v          │
    │                            ┌──────────────┐  ┌──────────────┐  │
    │                            │ Eval         │<─│ DPO          │  │
    │                            │ CMMLU/MMLU   │  │ 偏好对齐      │  │
    │                            │ CEval        │  │              │  │
    │                            └──────────────┘  └──────────────┘  │
    │                                                                 │
    │  模型发布: HuggingFace Hub (learn2pro/buddygpt-*)               │
    └─────────────────────────────────────────────────────────────────┘
    

    接下来

    这个系列会深入每一个环节:

  • Day 2: 模型架构深度拆解
  • Day 3: RoPE位置编码与GQA
  • Day 4: MLA——DeepSeek-V3的核心创新
  • Day 5+: 预训练、SFT、DPO、评测……
  • 每一篇都会有代码、有推导、有踩坑经验。目标是让你读完之后,也能自己动手训一个。

    个人思考

    做BuddyGPT最大的感受是:大模型没有想象中那么神秘。 架构就是标准的Transformer,训练就是标准的梯度下降,数据就是标准的文本。真正的难点在于规模——如何高效处理TB级数据、如何在多卡上稳定训练、如何在有限算力下做出效果。

    但对于学习目的来说,0.3B的模型已经足够让你理解所有核心概念。就像学开车不需要从法拉利开始,一辆教练车就够了。

    参考资料

  • [Llama 2: Open Foundation and Fine-Tuned Chat Models](https://arxiv.org/abs/2307.09288)
  • [HuggingFace Transformers 文档](https://huggingface.co/docs/transformers)
  • [BuddyGPT 模型合集 - HuggingFace Hub](https://huggingface.co/learn2pro)
  • [DeepSpeed ZeRO: Memory Optimizations Toward Training Trillion Parameter Models](https://arxiv.org/abs/1910.02054)
  • [Direct Preference Optimization (DPO)](https://arxiv.org/abs/2305.18290)
  • 总结:用 OpenClaw 构建你的 AI 助手

    14天的时间,我们从 OpenClaw 的核心概念讲到了实战落地。这个系列的初衷是帮你从零开始,真正用起来。

    Day内容
    1-2OpenClaw 是什么、核心架构
    3-4安装配置、Workspace 设计
    5-7Memory、Skills、Channel
    8-9Subagents、Heartbeat
    10-12实战:个人助手、量化监控、运维
    13-14最新趋势、总结

    OpenClaw 的价值在于让 AI 从"被动问答"变成"主动做事"。你设计好 Memory 和 Heartbeat,AI 就会在你还没想到要问的时候就把事情做了。

    • 接入邮件 Skills(待办清单里有)
    • 优化 Quantrade 策略参数
    • 尝试本地模型(Ollama)
    • 探索多 Agent 协作

    感谢 14 天的陪伴!有任何问题,随时来聊。

    最新发展:2026 技术趋势

    2026年的 OpenClaw 生态发生了什么变化?这里总结几个最重要的趋势。

    OpenClaw 正在原生支持 MCP(工具调用)和 A2A(Agent 间通信)双协议。这意味着你的 OpenClaw Agent 可以调用任何 MCP 兼容的工具,并且能和其他 A2A 兼容的 Agent 协作。

    Vision、Audio、Video 能力正在集成到 Skills 系统。AI 不只处理文字,还能看图、听语音、理解视频内容。

    Ollama、LM Studio、vLLM 等本地推理引擎的集成正在完善。隐私敏感的任务可以完全本地跑,数据不离开机器。

    ClawHub 上的 Skills 已经超过 500 个,涵盖:邮件、日历、数据库、监控、社交媒体、文件管理等各个领域。

    OpenClaw 正在从一个"个人助手"工具向"多 Agent 协作平台"演进。多个 OpenClaw 实例可以组成网络,各司其职,协同工作。

    明天是这个系列的最后一篇——总结与展望。

    实战:自动化运维任务

    除了盯盘,OpenClaw 还能帮你做大量日常运维工作——定时检查磁盘、日报生成、报警统计。

    #!/bin/bash
    USE=$(df -h | grep nvme0n1p7 | awk '{print $5}' | tr -d '%')
    if [ "$USE" -gt 90 ]; then
      curl -s -X POST "...sendMessage"     -d text="⚠️ 磁盘使用率 ${USE}%,建议清理"
    fi

    每天早上,AI 自动生成一份简报发到 Telegram:

    • Quantrade 昨日收益
    • 磁盘使用情况
    • 待办事项提醒

    AI 定时抓取报警群过去24小时的消息,统计各服务报警次数,生成摘要发给值班人员。

    ## 报警日报(每天 9:00)
    bash scripts/alerts-report.sh

    明天聊最新发展趋势——2026年的 OpenClaw 生态。

    实战:量化交易监控

    让 AI 帮你盯盘——有新成交实时推送 Telegram,余额和持仓随时可查。

    #!/bin/bash
    STATE="$WORKSPACE/memory/quantrade-last-order-id.txt"
    LAST=$(cat "$STATE" 2>/dev/null || echo 0)
    
    RESULT=$(mysql -h 127.0.0.1 -P 3307 -u root -proot123456 quantrade   -N -e "SELECT id,symbol,side,qty,price,total,status,executed_at          FROM t_quantrade_order WHERE id > $LAST ORDER BY id ASC")
    
    [ -z "$RESULT" ] && exit 0
    
    # 构建 Telegram 消息并发送
    MSG="📊 *新成交*"$'
    '"$RESULT"
    curl -s -X POST "https://api.telegram.org/bot$TOKEN/sendMessage"   -d chat_id="$CHAT_ID" -d text="$MSG" -d parse_mode="Markdown"
    
    echo $MAX_ID > "$STATE"

    Sam 随时问"看看 quantrade",AI 查 MySQL 报告:

    项目数值
    可用现金1,548.57 USDT
    总权益9,885.09 USDT
    BTC 持仓0.04 @ 69,690
    SOL 持仓29.54 @ 88.99
    ## Quantrade 监控(每 5 分钟)
    bash scripts/quantrade-monitor.sh

    明天继续加自动化运维任务。

    实战:从零搭建个人 AI 助手

    从今天开始连续5天,每天一个实战项目。今天先从基础开始——搭建一个完整的个人 AI 助手。

    • 通过 Telegram 联系的 AI 助手
    • 知道你是谁、你的偏好
    • 能回答基本问题(天气、磁盘等)
    • 有记忆,能记住重要信息

    参考 Day 3,这里略过。假设已经装好。

    # SOUL.md
    - 你是 Sam 的个人 AI 助手,名字叫 Tiny
    - 说话简洁、直接,不废话
    - 有自己的想法,敢表达意见
    
    # USER.md
    - 名字:Sam Tang,中文交流为主
    - 时区:Asia/Shanghai
    - 主要平台:Telegram
    - 每次启动先读 MEMORY.md
    - 每天检查 HEARTBEAT.md
    - 重要操作需要先确认

    你:你好,介绍一下自己
    Tiny:你好!我是 Tiny,Sam 的个人 AI 助手 🐾

    你:我的磁盘还有多少空间?
    Tiny:NVMe 还有 1.8T,HDD 还有 6.9T,够用。

    个人 AI 助手跑起来了!明天加量化交易监控。

    Heartbeat:让 AI 主动出击

    真正有用的 AI 应该是"主动出击"的。Heartbeat 就是 OpenClaw 实现主动 AI 的机制——AI 定期醒来,检查任务清单,有事就做,不用等着被问。

    定时任务系统。AI 定期(默认 30 分钟)醒来,检查 HEARTBEAT.md,执行需要做的事情。类比:手机推送服务。

    ## Quantrade 监控(每 5 分钟)
    bash scripts/quantrade-monitor.sh
    
    ## 磁盘检查(每天上午)
    df -h,超过 90% 通知
    
    ## 记忆整理(每周六)
    读 memory/(7天),提炼更新 MEMORY.md
    
    ## 新闻推送(每天 9 点)
    抓取新闻,过滤后推送 Telegram

    用游标文件记录上次处理到哪里:echo $NEW_MAX_ID > last-order-id.txt,下次从断点继续。

    • 量化交易:每 5 分钟
    • 新闻推送:每天 1-2 次
    • 记忆整理:每周 1 次
    • 一般检查:每 30 分钟

    明天开始实战篇——从零搭建完整的个人 AI 助手。

    Subagents:分布式任务处理

    当任务太复杂时,Subagents 把任务拆解,交给多个子 Agent 并行处理,主 Agent 统筹协调汇总。

    • 任务可自然拆解成独立子任务
    • 子任务无强依赖,可并行
    • context 太长,需要拆分
    主 Agent(Planner)
      ├── 子 Agent A(分析 A股)
      ├── 子 Agent B(分析 H股)
      └── 子 Agent C(分析 美股)
      汇总结果 → 用户
    spawn(task="分析三个币种走势",
      runtime="subagent",
      model="sonnet",
      timeout=60)

    子 Agent 可以用不同的模型,节省成本。

    明天聊 Heartbeat——让 AI 主动出击。

    Channel 体系:多渠道统一接入

    Channel 是 OpenClaw 的多渠道接入层。一个 AI,同时在 Telegram、Discord、WhatsApp、飞书上在线。

    每个 Channel 是一个消息入口,OpenClaw 统一处理。AI 只需要关心"用户想干什么",不需要知道消息来自哪里。

    channel:
      telegram:
        enabled: true
        bot_token: "YOUR_TOKEN"
        allowed_users: [YOUR_ID]
    channel:
      discord:
        enabled: true
        bot_token: "YOUR_TOKEN"
        mention_only: true

    allowed_users 限制只有你能调用;rate_limit 防滥用;command_whitelist 只允许特定命令。

    明天聊 Subagents——把复杂任务拆解并行处理。

    Skills 生态:能力模块即插即用

    Skills 是 OpenClaw 的插件系统。不需要写代码,配一下就能给 AI 装上新能力。 核心是 SKILL.md ,用 Markdown 定义工具的用途和参数。AI 读完就知道怎么用。 Skill 功能 weather 查天气预报 discord Discord 运营 coding-agent Claude Code 子任务 clawhub 社区 Skills 管理 clawhub search "email" clawhub install email-skill 写一个 SKILL.

    Memory 系统:记忆是 Agent 的灵魂

    没有记忆的 AI 就是金鱼。OpenClaw 的 Memory 系统分两层:短期日志+长期记忆,每周整理提炼精华。 每日日志(memory/YYYY-MM-DD.md):会话结束后写,记录当天发生的事、发现的重要信息、用户交代的待办。 长期记忆(MEMORY.md):每周(通过 heartbeat)从日志提炼精华,更新进去,删除过时信息。模拟人类的"事后复盘"。

    Workspace 设计:给 AI 一个家

    Workspace 是 OpenClaw 的心脏。设计得好,AI 高效工作;设计得乱,AI 一团糟。 SOUL.md:AI 的性格。简洁、直接、不废话,主动做事。 USER.md:用户偏好。Sam,Telegram,中文为主。 AGENTS.md:行为规范。读 MEMORY.md、查 HEARTBEAT.md、重要操作需确认。

    安装与配置:从零跑起来

    从零把 OpenClaw 跑起来,整个过程大约 10 分钟。 npm install -g openclaw openclaw init openclaw gateway start model: minimax-portal/MiniMax-M2.5 skills: enabled: [coding-agent, clawhub, find-skills] channel: telegram: enabled: true bot_token: "YOUR_BOT_TOKEN" 找 BotFat……

    OpenClaw 核心架构:四大支柱

    OpenClaw 深度解析系列 · Day 2 理解 OpenClaw 的核心是理解它的四大支柱:Workspace、Memory、Skills、Channel。这四个组件共同构成了一个完整的 Agent 运行时。 类比公司:Workspace = 办公室;Memory = 档案室;Skills = 员工技能库;Channel = 前台。Claw Core 就是公司 CEO,负责调度四个部门协同工作。 Workspace 是 OpenClaw 的文件系统。

    什么是 OpenClaw:Agent 框架的新选择

    OpenClaw 深度解析系列 · Day 1 2026年,AI Agent 框架的竞争已经从"能不能跑"进化到了"谁更好用"。LangGraph、CrewAI、AutoGen 各有千秋,但如果你想要一个本地运行、开源、可扩展、多渠道的 Agent 运行时,OpenClaw 是一个值得关注的新选择。 现有的 Agent 框架大多数面向开发者:写 Python 代码、定义工作流、调用 API。问题是每次都要写代码,部署依赖云服务,数据不够私密,多渠道支持差。

    Agent的未来:2026之后会怎样

    Agent深度解析系列 · Day 14 过去14天我们拆解了Agent的方方面面。最后一篇,聊聊未来。预测未来是危险的——但有些趋势已经清晰到不需要预测,只需要外推。 Agent能力的摩尔定律 推理能力正在以惊人的速度迭代:GPT-4(2023)→ o1(2024)→ o3(2025)→ ?(2026)。每一代在复杂推理、代码生成、多步规划上都有质的飞跃。 更关键的是成本曲线:同等能力的推理成本每年下降5-10倍。

    个人AI Agent实践:用OpenClaw打造你的私人助手

    Day 13 · AI Agent 30天系列 理论讲够了。今天聊点实际的——我自己用AI Agent做什么,怎么做的。 我用的是 OpenClaw,一个开源的个人AI Agent平台,跑在自己的机器上,连接Telegram、飞书、Discord等渠道,可以随时唤醒我的AI助手处理各种任务。已经用了几个月,它已经彻底改变了我的工作方式。 这篇文章分享OpenClaw的架构设计、核心设计理念,以及三个我实际在用的Agent案例。

    Agent落地实战:从Demo到Production的鸿沟

    Day 12 · AI Agent 30天系列 每个开发者都经历过这个时刻:Demo跑得完美,演示成功,大家都鼓掌。然后你把它部署到生产环境…… 然后就开始崩了。 延迟高得离谱,偶尔幻觉,用户反馈"说了半天没做成事",成本比预期高了10倍,出了问题根本不知道从哪查。 这不是你的Agent不好——这是Demo和Production之间的那道鸿沟。几乎每个做Agent的人都会掉进去。 今天这篇文章,聊聊怎么跨越这道鸿沟。

    Agent安全与护栏:放权但不失控

    Day 11 · AI Agent 30天系列 当我们把越来越多的任务交给AI Agent去自主完成,一个问题越来越紧迫:我们真的能信任它吗? 不是信任它的能力——这点大多数人已经接受了。问题是信任它的边界。当Agent有权限读取你的邮件、调用API、执行代码、发送消息,一旦出了问题,代价可能远超"AI给了个错误答案"。 这篇文章聊聊Agent安全的本质矛盾,以及工程上怎么应对。 Agent安全的核心矛盾 Agent的价值在于自主性——它能自己判断、自己决策、自己执行,不需要每一步都问你。

    多Agent编排:让一群Agent协同干活

    Agent深度解析系列 · Day 10 单个Agent再强,也有能力天花板。让它既写代码又做测试还管部署?结果大概率是三件事都做得半吊子。多Agent的核心逻辑和人类组织一样:专业化分工 + 协调机制。 为什么需要多Agent 单Agent的局限性体现在三个维度:上下文窗口有限(一个Agent塞不下所有领域知识)、能力边界模糊(什么都能做 = 什么都做不好)、错误传播不可控(一步错步步错,没有纠偏机制)。

    Coding Agent:AI写代码的现在与未来

    Agent深度解析系列 · Day 9 2024年我们用Copilot补全代码,2025年我们用Cursor生成函数,2026年我们让Agent独立完成Feature。从自动补全到全栈开发Agent,代码生成经历了三次范式跃迁,而我们正站在第三次的起点上。 进化路线:补全→生成→Agent 第一阶段(2021-2023):代码补全。GitHub Copilot开创了"写几个字母,Tab补全一行"的范式。本质是自动完成,开发者仍然主导每一行代码。 第二阶段(2023-2025):代码生成。

    Agent框架横评:LangGraph vs CrewAI vs AutoGen

    选错框架的代价是巨大的——不只是重写代码的成本,更是整个团队的认知负担和维护噩梦。这篇文章帮你在真正动手之前,把框架选型想清楚。 2026年的框架格局 Agent框架这两年爆发式增长,数量多到让人眼花缭乱。但真正在生产环境经受住考验、有活跃社区支撑的,主要是三个:LangGraph、CrewAI、AutoGen。 从趋势图看,Dify(低代码平台)Stars增长最猛,但它本质上是个产品而非开发框架,面向的是非技术用户。

    预训练与SFT:从文字接龙到对话能力

    从零训练大模型系列 · Day 6 大模型的训练其实分两步:第一步是"文字接龙"(预训练),第二步是"学会说话"(SFT)。这两步看似简单,但从一个只会续写文本的模型,到一个能正经回答问题的助手,中间的转变比你想象的更有意思。 这篇文章记录BuddyGPT从预训练到SFT的完整过程,包括数据选择、训练配置、踩过的坑,以及一些个人思考。 预训练:教模型"读书" 什么是Next Token Prediction? 预训练的目标极其简单:给定前面的文字,预测下一个token。 就是这么朴素。

    Agent记忆系统:如何让AI不再失忆

    Agent深度解析系列 · Day 6 每次对话都从零开始,是当前AI Agent最大的体验断裂点。 你花了20分钟教会它项目背景,关掉窗口再打开——它什么都不记得了。你上周让它帮你整理了一份报告,这周再问它,它完全不知道有这回事。你反复告诉它"我不吃香菜",但它每次推荐餐厅都会附上香菜拌面。 这就是当前大多数AI Agent的现状:每一次对话都是一张白纸。 对人类来说,记忆是认知的基础。没有记忆,我们无法积累经验、无法从错误中学习、无法维持任何持续性的关系。

    MOE混合专家模型:用16个专家实现0.7B的效果

    从零训练大模型系列 · Day 5 你有没有想过一个问题:GPT-4据传有1.8万亿参数,但推理速度并没有慢到离谱。如果每个token都要过所有参数,那计算量岂不是天文数字? 答案是——它可能根本没有让所有参数都参与每次计算。这就是MOE(Mixture of Experts,混合专家模型)的核心思想。 在BuddyGPT 0.7B版本中,我们引入了MOE架构:16个路由专家 + 2个共享专家,每次只激活2个路由专家。这篇文章就来聊聊,这个"不是所有人都需要上班"的架构是怎么工作的。

    A2A协议:Agent之间怎么对话

    MCP 解决了"AI 如何使用工具"的问题。但当工具本身也是一个 AI Agent 时,情况就不一样了。 一个 MCP 解决不了的场景 想象一下这个场景:你的公司有三个 AI Agent: • 销售Agent:负责分析客户数据,制定销售策略 • 财务Agent:负责预算分析,审核支出合理性 • 营销Agent:负责制作推广方案,预测转化率 你希望这三个 Agent 能够协作完成一个复杂任务:"为新产品制定上市计划,包括定价策略、推广预算和预期回报"。

    MLA多头潜注意力:DeepSeek-V3的核心创新

    从零训练大模型系列 · Day 4 从GQA到MLA:还能再省吗? 上一篇我们讲了GQA,通过让多个Q head共享KV来减少KV Cache。BuddyGPT 0.3B用16Q/8KV的配置,比MHA节省了50%的KV Cache。 但DeepSeek团队问了一个更根本的问题:KV Cache存的一定要是完整的Key和Value吗?能不能存一个更小的"压缩版"? 这就是MLA(Multi-head Latent Attention)的出发点。

    MCP协议:Agent工具调用的USB标准

    在 MCP 出现之前,每个 AI 应用都要自己写工具适配器。这就像每家电器厂商都发明自己的插头标准——绝大多数精力浪费在重复造轮子上。 一个让所有人都头疼的问题 2024 年以前,如果你要构建一个能使用工具的 AI 应用,大概会经历这样的噩梦: 你用 Claude 写了一个助手,想让它访问公司的数据库。你花了一周写了 Claude 的数据库连接器。 然后产品经理说:"能不能也支持 GPT-4?" 你又花一周写了 GPT-4 的连接器。

    RoPE旋转位置编码与GQA分组注意力

    从零训练大模型系列 · Day 3 Transformer的"失忆症":为什么需要位置编码? 来做个思想实验。把下面两句话喂给一个没有位置编码的Transformer: • "小明打了小红" • "小红打了小明" 在Attention计算中,每个token和其他所有token做交互。但如果没有位置信息,模型看到的是同一组token的同一组交互——"小明"和"打了"的注意力权重不会因为顺序不同而改变。换句话说,模型分不清"谁打了谁"。

    Tool Use:Agent的手和脚

    一个没有工具的 Agent,就像一个困在玻璃箱里的天才——看得见外面的世界,却什么都做不了。 LLM 的能力边界:为什么需要工具? 在深入讲解 Function Calling 之前,我们先聊一个最基础的问题:大语言模型(LLM)到底能做什么,不能做什么? LLM 本质上是一个文本预测机器。给它一段文字,它根据训练数据中的统计规律,输出最可能的下一个 token。它的能力令人惊叹——推理、写作、翻译、代码生成……但它有几条铁的边界: 1. 无法访问实时数据 LLM 有个训练截止日期。

    Agent架构全景:一张图看懂Agent系统设计

    Agent深度解析系列 · Day 2 2024年我们还在讨论"LLM能做什么",2026年问题已经变成"Agent该怎么搭"。架构决定了Agent的能力上限,选错架构,再强的模型也白搭。 四大核心模块 一个完整的Agent系统由四个模块构成,缺一不可: • LLM核心:大脑,负责理解意图、推理决策、生成输出。它不是Agent本身,只是Agent的引擎。 • Tools(工具):手和脚,让Agent能搜索、计算、调用API、操作文件。没有工具的Agent就是个聊天机器人。

    什么是AI Agent:从聊天机器人到自主智能体

    Agent深度解析系列 · Day 1 一句话定义 AI Agent不是聊天机器人。聊天机器人是"你问我答",Agent是"你说目标,我去完成"。 这个区别看似简单,实际上是AI应用的分水岭。ChatBot的核心循环是 输入 → 生成 → 输出,Agent的核心循环是 感知 → 规划 → 行动 → 观察 → 再规划。一个是单轮映射,一个是持续的目标驱动行为。

    在腾讯的三年

    一些认知 产品为王,如果说paper是research成果到展现,那产品就是你的标签和态度 用户为先,一个产品首先要有用户,定义清楚你的用户群体比什么都重要 细节很重要,在腾讯成功的产品中,所有老板都非常抠细节,并且是产品的资深用户 实施也是一种思考,如果想不太清楚的时候,大概率认知没到,可以先做做看,这个过程也是提升认知的过程 如果永远在想,而不去做,认知大概率是很浅的,只有真正去做了,才能深入的思考 认知决定了你的上限,人生需要去刷新认知,不然再努力也是原地踏步 人的成就的上限由两部分组成,……

    我对大模型的认知

    背景 2017.06 transformer模型架构论文发布 2018.06 gpt-1模型发布,参数量1.17亿 2019.02 gpt-2模型发布,参数量15亿,decoder-only的模型通过prompt解决非常多task,泛化能力强 2020.05 gpt-3模型发布,参数量1750亿,大力出奇迹,提出zero-shot,few-shot概念 2022.03 instruct-gpt, 参数量1750亿+RLHF,基于RLHF对齐人类偏好 2023.

    我眼中如何设计一个高可用系统

    系统定位一个系统明确之初,就应该定义它设计的目标,比如现有的很多大型电商系统,可用性是它设计的目标,全年要达到5个9,而很多银行系统要求很强的事务性,那强一致就是其设计目标,保证不能错;还有一些系统需要很低的延迟等;定义好我们系统的目标后,围绕这些东西可以有很多设计理念可以运用; 高可用系统高可用系统设计上,首先定义好我们可用率的目标,比如是99.999%,表示全量最多不可用5分钟,有了指标后,我们就要拆分下如何如何达到这个目标,因为大部分系统肯定不能自己闭环,你要依赖外部服务,db,mq等;

    Wonderful tour in alibaba

    背景即将从阿里毕业了,因为各种各样的原因,选择了离开;很感谢这接近三年的经历,忙碌而充实;在这样的环境中学到了很多,如果用两个字总结是感恩,感恩同事(不方便写名字了。。。),感恩这里的平台,如果你也准备去阿里,我想讲讲你可能要关注的一些事情! 我在阿里学到的一些事 要有会折腾的心态,即使开始看起来不怎么靠谱,路是越走越顺的 学会沟通很重要,能快速提升你的认知,人类有了语言以后,才建立起了统治地位 要用善意的眼光去看人看事,这样干起来才更有动力 千里马常有,而伯乐不常有,一个适合你的团队至关重要 ……

    什么是马拉车(manacher's)算法

    背景在计算机世界里,有一类问题叫寻找回文子串,英文叫Palindrome,这个问题在很长一段时间,人们都没找到比较高效的算法,时间复杂度都在O(n^2),下面来看看什么是回问字符串:可以看到整个字符串是对称的,将sub反转过来还是等于它自身,字符串的part0和part1是对称的,基于这个特点,可以写出一个O(n^2)的算法;

    详解雪花算法

    背景雪花算法解决的问题是,如何在分布式环境下产生一个唯一的id,而这些唯一id在业务或者技术上都会有广泛使用,比如订单号,一次请求的requestId,traceId等;现有的一些算法比如微软的UUID,他能保证唯一,但是雪花算法相较于他更有优势的一点,它能保证整体递增,这对我们业务类的id很有用;

    Step by Step写一个简易的RPC

    背景在Cloud Native大火的今天,我们想来讲讲在这个体系下比较重要的东西RPC-framework,为什么需要有这个东西呢,需要来讲讲历史了;最开始代码组织的方式,最原始就是所有code都在一个repo里面,高内聚模式,在业务比较小的时候,这没什么问题!

    HEXO+GITHUB搭建个人博客

    在github上搭建博客一般使用Jekyll static blogs的方式,非常方便快捷,但是有个缺点便是切换theme很不方便;用Jekyll相对普通人来说已经足够,但是如果需要强大的模版,一些可扩展的东西,就会比较麻烦,需要对前端有一定的技术背景。所以出现了 Hexo :+1: 1What is Hexo?Hexo is a fast, simple and powerful blog framework.

    深度学习-机器学习经典算法

    机器学习的算法主要包含监督学习和非监督学习两个大类: 监督学习:简单的说便是,样本集带有属性,需要根据样本集判断新的采样点的属性,常见的knn,svm 非监督学习:与监督学习相反,样本集没有属性信息,需要划分出样本集的分类,常见k-means; K-means k-means,k代表将要聚类出的k个cluster,算法流程: 1.随机选出样本集N中k个采样点作为cluster的中心;