关于

我是数据背景转到 AI 产品的。

我是施祖粤(Zoey),广州理工学院数据科学与大数据技术专业 2026 届毕业生, 求职方向是 AI 产品。在鸣鸣很忙做产品实习的那三个月, 我参与搭建了一个真正上线的 HR Q&A 智能体—— 从需求分层调研、知识库结构设计,到逐条核查模型的幻觉回答。

那段实习教会我的事

HR 每天要回答大量重复问题:入职材料怎么交、调岗流程走哪几步、离职手续差什么。 这些问题有标准答案,但散在制度文档、飞书 wiki 和各种历史通知里, 员工找不到就只能问人,HR 又只能一遍遍重复。

我做的第一件事不是想功能,而是把问题本身排序: 分层调研员工和 HR 的疑问,按「高频刚需 > 流程复杂 > 补充疑问」排优先级, 最后输出一份覆盖入转调离四大模块的《需求清单》。 这份清单决定了智能体的范围——哪些先做、哪些不做。

接着是知识库。智能体答得对不对,八成取决于喂给它的内容对不对, 所以我参与设计了飞书 wiki 的标签体系、把它适配成 Dify 能导入的结构, 并且定了一套内容同步机制——否则制度一更新,智能体就开始胡说。 这部分我同时输出了高保真原型和 PRD。

核查幻觉是一件很枯燥但必须做的事

我对智能体做单轮和多轮对话测试,然后逐条对照知识库去查: 这个回答是有依据的,还是它自己编的。做过这件事之后我才明白, AI 产品的验收标准和普通产品完全不是一回事—— 普通产品看功能有没有实现,AI 产品得看它在没有标准答案的地方错得有多离谱。

迭代阶段我提出并落地了两个小改动:「猜你想问」建议问题模块, 以及高频问题点击直达。这两个改动表面上是体验优化, 实际上减少了很多无效的 LLM 调用——省 token、响应更快, 也少打扰 HR。这是我第一次意识到,AI 产品的体验和成本经常是同一个问题。

智能体小规模试点上线后,我们收集了 200 多条用户反馈来驱动后续迭代。

我的数据底子有什么用

我的专业是数据科学与大数据技术,主修 Python 程序设计、数据结构与算法、 爬虫理论与实践、数据库原理、数据可视化技术、数据分析与建模。 另外我做过一个基于 Spark 的 IT 岗位薪资分析预测系统, 处理了 2 万多条招聘数据,覆盖 6 个维度的可视化。

对做 AI 产品来说,这套背景带来的好处很具体: 我能直接读懂模型的输出和评测结果,不用等别人翻译; 和算法、数据同学沟通时能说到点上;做数据看板和埋点方案时也不用完全依赖他人。

实习之后,我自己又做了一遍

公司项目的细节我不能对外讲,也不是我一个人做出来的。 所以实习结束后,我用公开的劳动法文本,把同一套方法独立跑了一遍: 6 类 55 条知识库、42 条评测集,代码开在 GitHub 上,可以直接点开看。

更重要的是,我把实习复盘出的三条改进做了进去—— 结构化切分控上下文、高频问题做确定性出口, 以及我一直想补的那块:回归评测集

还缺什么

实习里我做的评测更像是逐条人工比对:单轮和多轮测试,逐个对照知识库核查幻觉。 它有效,但它没有基线——每次改动都要重跑一遍, 而人记不住之前哪些 case 本来是好的。这个缺陷我在自己的项目里补上了。

但还有没做到的部分:失败模式归类、自动化判分、上线门禁, 我目前只有朴素版本,还没有在真实团队里完整跑过一遍。 这是我下一阶段最想补的能力,原因也很直白—— 在 AI 产品这个方向上,能定义「什么叫做对了」的人比会用工具的人稀缺得多。

技能

AI 产品

需求调研与分层 · PRD / 需求文档 · 高保真原型 · Dify 智能体搭建 · 知识库(RAG)· Prompt 编写与 AI 测试

数据与工具

SQL · Power BI · Tableau · Excel 函数与数据透视表 · Python 数据处理

证书与其他

英语四级 · 计算机二级 · WPS 二级 · C1 驾照