目标:能独立完成 pegainfer 项目的 issue,最终胜任 AI Infra 岗位。
| 领域 |
状态 |
备注 |
| Ascend C kernel 编程 |
🟡 写过粗糙低级的 |
但没做过训练/推理 pipeline,只是写 kernel 本身 |
| 训练 vs 推理 |
🟡 知道概念 |
知道两者对算力、精度的要求不同 |
| 910B 架构 |
🟡 轻度理解 |
|
| CUDA |
🔴 零基础 |
Ascend C 概念可部分迁移 |
| Python |
🔴 基础很差 |
|
| Rust |
🔴 零基础 |
需要学 |
| Transformer 原理 |
🔴 零基础 |
|
| LLM 推理流程 |
🔴 零基础 |
核心差距 |
| 系统学习经验 |
🔴 无 |
全是碎片经验 |
| 日期 |
学了什么 |
理解程度 |
| 2026-06-05 |
纠正:没做过训练/推理,只写过 Ascend C kernel。知道训练推理精度需求不同。 |
- |
| 2026-06-05 |
学了:模型 = 一堆矩阵(约 8 GB for 4B),KV cache = 每个 token 的 K+V 缓存(KB/对,累积几 GB) |
基本理解 |
| 2026-06-05 |
⚠️ 教训:提问时不要说"K 和 V 是几 GB 的矩阵"——这是错的,会误导。先说对的,再说代价。 |
- |
| 2026-06-05 |
⚠️ 教训:看到 cudarc 依赖就默认"要 GPU 验证"是错的。编译/运行是两件事。纯 Rust 文件(如 kernel_plan.rs)只需 rustc 独立编译 + cargo fmt,不用租卡。 |
- |
| 2026-06-05 |
⚠️ 教训:看到 cudarc 依赖就默认"要 GPU 验证"是错的。编译/运行是两件事。纯 Rust 文件(如 kernel_plan.rs)只需 rustc 独立编译 + cargo fmt,不用租卡。 |
- |
| 2026-06-05 |
⚠️ 教训:看到 cudarc 依赖就默认"要 GPU 验证"是错的。编译/运行是两件事。纯 Rust 文件(如 kernel_plan.rs)只需 rustc 独立编译 + cargo fmt,不用租卡。 |
- |
| 2026-06-05 |
⚠️ 教训:看到 cudarc 依赖就默认"要 GPU 验证"是错的。编译/运行是两件事。纯 Rust 文件(如 kernel_plan.rs)只需 rustc 独立编译 + cargo fmt,不用租卡。 |
- |
| 2026-06-05 |
⚠️ 教训:看到 cudarc 依赖就默认"要 GPU 验证"是错的。编译/运行是两件事。纯 Rust 文件(如 kernel_plan.rs)只需 rustc 独立编译 + cargo fmt,不用租卡。 |
- |
| 2026-06-05 |
完成 issue #256 完整分析。Issue 是给 Qwen3.5 写 kernel 清单(纯 struct + 字符串),25+ 个 kernel 分布在 3 个 phase。需要先懂 prefill/decode/linear/full 概念。 |
- |
| 2026-06-05 |
自己总结出推理流程:切 token → 读进整个 → 过矩阵预测 → 概率最大 → 拼装 → 再算下一个 → 终止符。"本质是概率预测" |
✅ 核心抓住 |
- pegainfer:纯 Rust + CUDA 的 LLM 推理引擎
- 第一个 issue:#256 — 给 Qwen3.5 模型加 kernel_plan(纯文档重构,不涉及 GPU)