跳到主要内容

从零到一:图工程师的七天成长路径

搭配实战

本路径与子站课表对齐:7 天学会 Graph Engineering。文档负责深度讲解,子站负责课表、沙盒与打卡节奏。

写给零基础的你

你不需要先成为图论学者或深度学习专家。你只需要每天完成可见产出物。七天后,你应拥有:一张业务图、一组黄金查询、一次算法解读、一版微型 GraphRAG、一份学习笔记库。

总览

Day主题产出物
1建模范式Schema 草图 + ADR 半页
2查询语言5 条 Cypher + PROFILE 截图
3图算法PageRank/社区 Top 解读
4图库与规模度分布报告 + 超级节点策略
5知识图谱带置信度的三元组集
6GNN 与 GraphRAG评测表 + 证据包示例
7综合项目脚手架仓库 v0.1

Day 1:从图思维落地

上午:读 入门介绍 公理与分层;手绘你熟悉的领域(课程依赖 / 团队协作 / 阅读书目)的 10 个节点。

下午:区分属性图与 RDF 的适用性;写半页 ADR:为何用图、主查询形状、非目标。

晚间:用 NetworkX 或 Neo4j 建出该图;对比一条 SQL JOIN 与 Cypher。

验收:能向同事讲清「边为什么是一等公民」。

Day 2:模式匹配的手感

上午:MATCH/WHERE/RETURN;变长路径;MERGE 语义。

下午:为名字/id 建索引;PROFILE 正反对比。

晚间:挑战——把同一查询用 Gremlin 思路描述(即使不跑)。

验收:5 条黄金查询入库,附预期结果。

Day 3:算法眼镜

上午:度、PageRank、Betweenness 直觉。

下午:Louvain/连通分量;在小图上可视化。

晚间:链接预测基线(共同邻居)与 AUC 粗评。

验收:Top10 节点的业务解释(不是只贴分数)。

Day 4:规模与架构直觉

上午:原生图 vs 非原生;分区与超级节点概念。

下午:批量导入与逐条插入的差异(可读文档+小实验)。

晚间:写出你的图的度分布与治理策略草案。

验收:明确「哪一类查询禁止上线」。

Day 5:知识图谱流水线

上午:TBox/ABox;实体链接消歧例子。

下午:从文本抽 20 条三元组,人工打置信度。

晚间:冲突与过期策略;导出 Turtle 或 Cypher。

验收:每条边有来源字段。

Day 6:GraphRAG 与 GNN 入门

上午:消息传递与 Cora 上 MLP vs GCN 的文献/教程复现(可用小资源)。

下午:手写 GraphRAG 证据包 JSON;对 10 个问题做有无证据回答。

晚间:记录失败案例(链接错、扩展空、幻觉)。

验收:一张评测表(忠实度/引用/延迟主观分)。

Day 7:作品集与前沿雷达

上午:读生产议题清单(观测、备份、安全)。

下午:组装脚手架目录:schemas/etl/queries/rag/eval/adr。

晚间:大作业缩小版——选定「人物—组织—文档」或自选主题,串起导入→查询→问答;写 1 页回顾:最大认知转变、下一月计划。

验收:仓库可被他人按 README 跑通最小 Demo。

七天后如何继续(30 天)

  1. 每周一个垂直切片上真实数据(脱敏)。
  2. GitHub 项目 按周清单吃透 2 个仓库。
  3. 坚持黄金查询 CI。
  4. 参加或自办「图诊所」。
  5. 选一条前沿深入:动态图 / 异构 GNN / 企业 GraphRAG 成本优化。

能力雷达(自评 1–5)

维度Day0Day7Day30 目标
建模
查询
算法
治理
GraphRAG
GNN
安全与观测

常见放弃点与对策

放弃点对策
纠结选型先单机属性图跑通问题
沉迷可视化先黄金查询正确
直接上大模型抽取先小规模人工金标准
论文深坑以任务为界,时间盒阅读
没有数据用公开数据集或自造小图

导师提问清单(每天结束前回答)

  1. 今天的主查询形状是什么?
  2. 我新增了哪种边/约束?
  3. 什么可能在 100× 数据时坏掉?
  4. 我如何证明结果正确?
  5. 明天最小下一步是什么?

作品集叙事模板

我解决了【业务问题】。图中【N】类节点【M】类边。核心查询是【形状】,P95【】。质量上我保证【约束/溯源】。AI 方面我用【GraphRAG/GNN/无】,评测【指标】。超级节点策略是【】。决策见 ADR【链接】。

用这段话参加面试或内部分享,比罗列名词更有力。

与文档地图的闭环

  • 概念 → intro
  • 动手 → getting-started
  • 深化 → development
  • 生态 → github-projects
  • 准则 → best-practices
  • 疑难 → faq
  • 路径 → 本文

结束语

从零到一不是「装上某图数据库」,而是获得看见关系、约束关系、查询关系、解释关系的能力。七天只是点火;真正的图工程师在之后每一次 MERGE、每一次 PROFILE、每一次拒答无证据问题中成长。现在就打开 Day 1 的纸笔,画出你的第一张十点图。

Day 1 详细课表(示例时间盒)

时段分钟行动
09:0040读 intro 公理与历史,笔记 10 条
09:4050画业务草图,标注查询形状
10:3030休息与复盘
11:0060ADR 半页 + 非目标列表
14:0090环境安装与建图
15:3060SQL vs Cypher 对照
19:0060输出 Day1 笔记发到日记/仓库

其他天数可按同样粒度拆分;关键是时间盒,避免在选型上耗尽意志力。

Day 2 详细练习题

  1. 点查:按唯一 id 找人。
  2. 一跳:他的同事。
  3. 两跳:同事的同事(排除自己)。
  4. 路径:到某公司的最短雇佣路径。
  5. 聚合:每家公司人数 Top5。

每题保存:查询文本、结果行数、PROFILE 摘要、是否走索引。

Day 3 算法实验记录模板

数据集:
算法:
参数:
Top10:
业务解释:
可疑点:
可视化截图路径:
下一步验证:

Day 4 容量草稿纸

当前节点:
当前边:
度 P50/P95/P99:
Top1 节点与度数:
若 10×:预计磁盘/内存:
禁止的查询:
限流策略:

Day 5 三元组表格

subjectpredicateobjectsourceconfidencenotes

至少填满 20 行,其中至少 3 行低置信,演示「不入库正式层」。

Day 6 评测表

qidquestionhas_evidencefaithfulcitedcomment
1Y/N0/10/1

Day 7 Demo 脚本(README 级别)

# 1. 导入样例
# 2. 跑黄金查询
# 3. 跑一个问答示例(可先手工证据包)
# 4. 打开可视化或打印路径

陌生人 15 分钟内跑通,才算 v0.1。

同伴学习协议

两人一组:一人当「业务方」只提问题,一人当「图工程师」建模;第二天互换。结束后互评词表清晰度与查询可解释性。

能量管理

图学习容易在「工具安装」与「论文焦虑」上耗尽。规定:每天深度工作不超过 4 小时块;安装问题 >40 分钟则换 NetworkX 路线;论文阅读必须绑定当日任务。

证书与自我认证

你可以给自己发「Graph Engineering 七天结业」——条件是七件产出物齐全且可公开(脱敏)。把链接写进简历「项目」栏,比参加含金量不明的线上证书更实在。

进阶分支(七天后选择一条)

  1. 平台方向:图数据库内核、分区、SRE。
  2. 语义方向:本体、推理、数据质量。
  3. 智能方向:GraphRAG、Agent 记忆、GNN。
  4. 领域方向:风控、推荐、生物、运维拓扑。

选分支后,重读 development 与 best-practices 的对应章节,做 30 天专题。

给老师/团队负责人的用法

把本文当作训练营大纲:每天站会只问「产出物链接」;用 FAQ 决策树做答疑;用最佳实践检查单做结营评审。子站用于同步进度可视化。

最后一公里检查

  • intro 读完并有笔记
  • getting-started 练习完成
  • 黄金查询 ≥5
  • 度分布看过
  • 至少 20 条带出处三元组
  • GraphRAG 评测表 ≥10 题
  • 脚手架 README 可复现
  • 写完作品集叙事段

全部勾选,即完成从零到一。真正的「一到一百」,是你下一次在生产故障里冷静打开 PROFILE 的时候。

附录:七天情绪曲线(正常现象)

Day1 兴奋 → Day2 语法挫败 → Day3 算法「原来如此」→ Day4 被规模吓到 → Day5 厌恶脏数据 → Day6 担心落后于 LLM 浪潮 → Day7 整合后的平静自信。

若 Day2 卡住:只练三条查询。若 Day5 厌恶抽取:先用结构化 CSV 生成三元组。若 Day6 恐慌:记住 GNN 可选,图查询本身已能创造价值。

图工程是长跑。七天点火,余生护火:每次把关系讲清楚,都是在践行第一性原理。

致谢式自勉

你将一次次被问:「这和知识图谱有何不同?」「为什么不用纯向量?」请把答案建在查询形状、评测数字与失败案例上。诚实地展示边界,比夸张承诺更像工程师。

出门考试只有一道题:给定一团乱关系,你能否建成可查询、可治理、可解释的图——并知道何时停手不用图。