AI 产品经理学习笔记 —— 我的知识整理与思考
写在前面
AI 领域太新、变化太快,每天都有新模型、新产品冒出来,一不留神就跟不上了。为了逼自己系统性学习,我把这段时间积累的资料和思考整理成了这份笔记。
下面进入正题。
一、AI 产品生态地图
国际主流 AI 产品
| 厂商 | 产品 | 备注 |
|---|---|---|
| OpenAI | ChatGPT / GPT-5 | 目前全球用户量最大的 AI 对话产品。多端覆盖、多模态输入、能跑代码、Canvas 可以协作编辑,企业版也有私有部署方案。我个人日常用得最多的就是它 |
| Anthropic | Claude (Opus 5 / Sonnet 5) | 主打安全对齐,上下文窗口能做到 200K tokens。Claude Code 在开发者圈子里增长很快,Artifacts 能直接生成可交互 UI。Opus 5 适合需要深度推理的场景,Sonnet 5 则更快一些 |
| Google DeepMind | Gemini 3 | Google 的旗舰多模态模型,深度绑定 Google 生态(搜索、Workspace、Android)。上下文窗口到了百万 token 级别,这点挺让我惊讶的 |
| Meta | Llama 4 | 目前最强的开源模型系列,各种尺寸都有。因为开源,催生了一大堆微调模型——如果公司要自部署,这基本上是首选基座了 |
| Microsoft | Copilot (M365 / GitHub) | 把 AI 塞进了 Office 全家桶和 VS Code,直接触达数亿存量用户。GitHub Copilot 在代码生成这块真的很强,Workspace 模式能跨文件重构 |
| Apple | Apple Intelligence | 端侧 AI 的代表方案,配合 Private Cloud Compute 做隐私保护。Siri 全面升级后能跨 App 操作,我觉得 OS 级 AI 的产品思路值得关注 |
| xAI | Grok 4 | Elon Musk 家的模型,最大卖点是能实时拿到 X(Twitter)的数据,定位偏社交媒体和新闻场景 |
| Perplexity | Perplexity AI | AI 搜索的标杆,把 RAG 和实时搜索结合得很好,每条回答都带精确引用。我个人做调研的时候越来越依赖它而不是传统搜索了 |
| Notion / Cursor | AI-Native 应用 | Notion AI 在文档知识库场景做了深度集成。Cursor 是我最近在学的,它用 Composer 和 Agent 模式重新设计了写代码的流程——这种”AI 主动干活、人来审核”的产品形态给了我很多启发 |
国内主流 AI 产品
| 厂商 | 产品 | 备注 |
|---|---|---|
| 字节跳动 | 豆包 / 扣子 (Coze) | 豆包在国内用户量很大,覆盖对话、写作、图像、音乐等。扣子是字节的 Bot 开发平台,可视化搭 Agent 的体验挺顺手的——我最近在上面捣鼓了不少 demo |
| 百度 | 文心一言 / 文心大模型 | 文心 4.5 在中文本土化上下了功夫,背靠百度搜索生态,千帆平台面向企业提供服务 |
| 阿里巴巴 | 通义千问 (Qwen) / 通义万相 | Qwen 开源版在国际榜单上表现不错,我自己试过跑本地版。通义万相做图生视频,和阿里云、钉钉的深度集成是天然优势 |
| 腾讯 | 混元大模型 / 元宝 | 混元支撑了微信、QQ、腾讯会议的 AI 功能。元宝 App 面向 C 端,背靠公众号和视频号的内容生态 |
| 月之暗面 | Kimi | 200 万字上下文确实很强,读长文档、分析论文的场景做得特别好。产品体验很简洁,是我目前使用频率很高的国内产品 |
| 智谱 AI | ChatGLM / 智谱清言 | 清华系,GLM 系列在中文任务上口碑不错。AutoGLM 在探索手机 Agent 方向,这个思路挺有意思的 |
| 深度求索 | DeepSeek | 坦白说 DeepSeek 给我冲击很大——用远低于同行的成本训练出了 V3/R1,数学推理和代码能力都很强,而且是开源的。某种程度上改变了大家对”大模型必须烧钱”的认知 |
| 科大讯飞 | 讯飞星火 | 讯飞在语音这块积累很深,星火在语音交互、教育、医疗等场景有差异化的落地,偏 B 端多一些 |
二、AI 模型全景
搞清楚有哪些类型的模型、各自能干什么、大概的成本是什么样的
模型分类总览
| 模型类别 | 代表模型 | 核心能力 | 典型产品场景 | 备注 |
|---|---|---|---|---|
| 大语言模型 (LLM) | GPT-5, Claude Opus 5, Gemini 3, DeepSeek-V3, Qwen3 | 文本理解、生成、推理、代码、翻译 | 对话助手、文档写作、代码辅助、客服 | 上下文窗口大小、推理速度、API 定价、幻觉率 |
| 推理模型 (Reasoning) | Claude Opus 5 (Extended Thinking), DeepSeek-R1, o4-mini | 深度推理、数学证明、复杂逻辑链 | 数学解题、法律分析、科学研究、战略决策 | 推理耗时 vs 准确率的权衡、thinking budget 怎么设定 |
| 多模态模型 | GPT-5 (视觉), Gemini 3, 通义万相 | 图像/视频/音频理解与生成 | 图片分析、视频总结、语音助手、设计生成 | 支持哪些模态、分辨率够不够、生成质量如何 |
| 图像生成模型 | DALL-E 4, Midjourney V7, Stable Diffusion 3, Flux | 文生图、图生图、风格迁移 | 创意设计、广告素材、游戏美术、电商图 | 可控性、风格一致性、版权合规问题、推理成本 |
| 视频生成模型 | Sora, Runway Gen-4, 可灵 (Kling), 即梦 | 文生视频、图生视频、视频编辑 | 短视频创作、影视预演、广告制作 | 时长限制、物理一致性、运动质量、价格 |
| 语音模型 | GPT-5 Voice, ElevenLabs, 讯飞语音 | TTS、ASR、语音克隆、实时对话 | 语音助手、有声读物、实时翻译、客服 | 延迟能不能做到 500ms 内、情感表达自然度、多语言支持 |
| 音乐/音频模型 | Suno V5, Udio | 文生音乐、风格模仿、编曲 | 背景音乐生成、广告配乐、个人创作 | 版权归属(这个争议很大)、风格覆盖、时长控制 |
| 嵌入模型 (Embedding) | text-embedding-3, BGE-M3, Jina Embeddings | 文本向量化、语义相似度 | 语义搜索、RAG、聚类分析、推荐系统 | 向量维度、多语言支持好不好、检索精度 |
选型思路
做产品方案的时候,选模型大致可以从两个角度出发:
按场景选
- 需要强推理/逻辑 → Claude Opus 5 / DeepSeek-R1
- 需要多模态理解 → Gemini 3 / GPT-5
- 需要低成本/高并发 → GPT-5 Mini / DeepSeek-V3 / Llama 4
- 需要中文优化 → Qwen3 / 文心 / DeepSeek
- 需要私有化部署 → Llama 4 / Qwen3(开源方案)
按预算选
- 预算充裕、追求质量 → GPT-5 / Claude Opus 5
- 中等预算、追求平衡 → Claude Sonnet 5 / Gemini 3
- 预算有限、需要规模化 → GPT-5 Mini / DeepSeek-V3
- 零预算、自部署 → Llama 4 / Qwen3(开源)
注:实际选型还要看具体的场景需求、延迟要求、合规约束等等。
三、AI 核心技术模式
3.1 RAG(检索增强生成)
我的理解: 简单说就是让 LLM “开卷考试”而不是”闭卷瞎猜”。用户问问题 → 先去知识库里搜相关文档 → 把搜到的内容作为参考材料塞给 LLM → LLM 基于这些材料生成回答。
为什么需要它? LLM 的知识有截止日期,也不知道你们公司内部的资料,还容易胡说八道。RAG 就是解决这三个问题的。
值得关注:
- 分块策略(chunk size)——文档切多大块?切太大检索不精准,切太小又丢上下文。我目前的理解是 FAQ 类用小 chunk(256 左右),长文档类用大一点的(512-1024),还要加 overlap 防止关键信息被切断
- 检索精度 vs 召回率——前者是”搜出来的多少是对的”,后者是”该搜出来的搜到了多少”。不同产品场景偏重不一样,需要跟工程师商量定目标
- 混合检索(BM25 + 向量)——关键词匹配和语义匹配可以互补,纯向量检索对精确字符串(比如产品编号)效果不好
- 重排序(Rerank)——第一次检索用轻量模型图快,然后拿候选人用强模型重新排一遍
这块我还在深入学,后面可能会单独写一篇 RAG 的详细笔记。
3.2 Agent(智能体)
我的理解: 如果说 Chatbot 是”你问一句我答一句”,Agent 就是”你告诉我想要什么结果,我自己想办法做”。Agent = LLM(大脑)+ 规划 + 工具调用 + 记忆 + 反思。
值得关注:
- 任务完成率——Agent 能成功搞定多少任务?简单任务应该 > 95%,复杂任务七成以上就很不错了
- 工具链设计——Agent 能调用哪些工具,工具描述写得好不好,直接决定了它能做什么
- 成本控制——Agent 会在多步调用中消耗大量 token,一不小心就跑飞了。需要设步数上限、token budget
- 安全边界——涉及写操作(删数据、发邮件)的场景,Agent 做之前最好让用户确认一下
我自己在Dify上搭了几个 Agent demo 之后,对”循环调用”和”错误恢复”的体会深了很多——Agent 真的很容易陷入死循环,需要在设计时就考虑好退出机制。
3.3 Function Calling / Tool Use
我的理解: 模型不直接输出文字,而是输出一个结构化的 JSON 表示”我要调这个函数,参数是这些”。这是 Agent 能够操作外部世界的底层能力。
值得关注: 工具描述的设计(这其实是 PM 能直接影响模型行为的地方)、模型选工具的准确率、参数提取得对不对、能不能并行调用多个工具。
3.4 Prompt Engineering
我的理解: 这是 PM 的”新编程语言”——通过设计提示词来控制模型输出,不用写代码就能调优产品行为。成本最低、迭代最快。
值得关注:
- System Prompt 设计——给模型定人设、定规则、定输出格式。这其实就是一个 AI 产品的”规格说明书”
- Few-shot——给几个例子让模型照葫芦画瓢,效果往往比长篇规则描述更好
- Chain-of-Thought——加一句”让我们一步一步思考”,复杂推理的准确率能明显提升
3.5 Fine-tuning(微调)
我的理解: 用自己准备的数据在基座模型上再训练一下,让它在特定任务上更稳。成本比 Prompt Engineering 高不少,但效果更可控。
经验: 先 Prompt 后微调,不要一上来就微调——因为 Prompt 改起来几分钟,微调可能要几周。什么时候该微调?Prompt 已经优化到天花板了、有足够多的高质量标注数据了、需要一个很稳定的风格输出的时候。
3.6 多 Agent 协作
我的理解: 让多个专业 Agent 组队干活。常见的有监督者模式(一个老大分活给小兵)、流水线模式(A 干完给 B)、辩论模式(大家互相挑刺最后达成一致)。
看法: 多 Agent 看起来很酷,但很容易过度设计。大多数场景一个 Agent + 多个工具就够了,多加一个 Agent 就多一个出错的可能。
3.7 MCP (Model Context Protocol)
我的理解: Anthropic 提出的一套标准化协议,让 AI 和外部工具/数据源之间能”即插即用”。可以类比成 AI 世界的 USB-C 接口。
看法: 如果 MCP 真的成为行业标准,”能接多少数据源”就不再是各家 AI 产品的竞争壁垒了(因为大家都能接),竞争会回到模型能力和产品体验本身。这个可能会改变整个生态格局。
3.8 Caching / 流式 / 异步
我的理解: 这几个是工程层面的优化杠杆,它们直接影响成本和体验。
- Prompt Caching:System Prompt 等不变的部分可以缓存,能节省 50-90% 输入成本
- 流式输出:一个字一个字往外蹦,比等全部生成完了再显示,用户感知速度快很多
- 异步批处理:不需要实时返回的任务(如批量分析报告),可以走 batch API,成本直接砍半
四、主流框架与基础设施
| 类别 | 工具/框架 | 用途 | 生态地位 |
|---|---|---|---|
| LLM 应用框架 | LangChain | 最成熟的 LLM 开发框架,什么都能干——Chains、Agents、RAG 都有封装。不过据说封装层多,debug 比较痛苦 | ⭐⭐⭐⭐⭐ |
| LLM 应用框架 | LlamaIndex | 专精数据索引和 RAG,做知识库问答类产品据说比 LangChain 更专业 | ⭐⭐⭐⭐ |
| LLM 应用框架 | Semantic Kernel | 微软出的,和 .NET/Azure 深度绑定,微软系企业的首选 | ⭐⭐⭐ |
| Agent 框架 | AutoGPT / CrewAI | 多 Agent 协作框架,定义角色和任务流程 | ⭐⭐⭐⭐ |
| Agent 平台 | 扣子 (Coze) / Dify | 可视化搭建 Agent,拖拽式编排。我自己在扣子上试了不少 demo,很适合快速验证想法 | ⭐⭐⭐⭐⭐ |
| RAG 框架 | RAGFlow / MaxKB | 国产开源 RAG 平台,中文文档解析有优势 | ⭐⭐⭐⭐ |
| 向量数据库 | Pinecone / Milvus / Weaviate / Chroma / Qdrant | RAG 的底层存储设施,不同方案在性能、成本、运维难度上差别挺大。我自己做 demo 用 Chroma(免费够用),生产环境据说 Milvus 最强但要会运维 | ⭐⭐⭐⭐⭐ |
| 模型服务 | vLLM / Ollama / Replicate | 模型部署和推理。Ollama 可以在我自己电脑上跑 Llama/Qwen,很方便 | ⭐⭐⭐⭐ |
| 观察与评估 | LangSmith / LangFuse / MLflow | LLM 应用的监控、调试、评估平台。产品上线后怎么知道质量有没有下降?就靠这些 | ⭐⭐⭐⭐⭐ |
| Prompt 管理 | PromptLayer / Agenta | Prompt 的版本管理和协作编辑,适合团队化迭代 | ⭐⭐⭐ |
五、产品原型设计工具
这部分跟我现在的工作经验有重叠,但 AI 时代多了几个新工具,我也是最近才开始密集使用的。
我目前在用的工具
| 工具 | 我怎么用 | 推荐程度 |
|---|---|---|
| Figma 🎨 | UI 设计和交互原型,这个应该不用多介绍了,基本上是行业标配 | ⭐⭐⭐⭐⭐ |
| Axure RP 📐 | B 端复杂交互的高保真原型,学习曲线有点陡,但能做条件逻辑 | ⭐⭐⭐ |
| 墨刀 (MockingBot) 🖼️ | 国产在线原型工具,移动端快速出图很方便 | ⭐⭐⭐⭐ |
| MasterGo ⚡ | 国产 Figma 替代,国内大厂用得越来越多 | ⭐⭐⭐⭐ |
| V0 / Bolt / Lovable 🤖 | 用自然语言描述然后直接生成可交互页面——这个真的让我很兴奋,做 demo 验证想法快到离谱 | ⭐⭐⭐⭐⭐ |
推荐工具搭配
日常三件套:
- Figma —— 常规 UI 和交互设计
- V0 / Bolt —— 快速生成可交互的页面原型(AI PM 的神器)
- 扣子 / Dify —— 搭建 AI 产品的逻辑原型,验证 Agent 流程
辅助工具:
- Whimsical / Miro —— 画流程图、思维导图、用户旅程图
- Notion —— 写 PRD 和项目追踪
- 飞书多维表格 —— 做数据收集和轻量数据库
- Jupyter Notebook —— 做数据分析和 Prompt 实验(这个我还在学)
六、AI PM 核心能力
这部分是结合我自己的学习和跟一些前辈交流后整理的,可能不够全面,但应该覆盖了比较核心的几块。
| # | 能力维度 | 我的理解 |
|---|---|---|
| 01 | 🎯 AI 产品嗅觉 | 能不能判断一个场景到底适不适合用 AI?用哪种 AI 模式最合适?区分 AI-Native 和 AI-Wrapper 的差别 |
| 02 | 📊 数据思维与评估 | AI 产品不是功能上线就完事了,要有评估体系。准确率、召回率、幻觉率、token 消耗这些指标,PM 自己心里得有数 |
| 03 | 💬 Prompt Engineering | PM 的”新编程语言”。不需要会写 Python,但得会写 Prompt 来控制产品行为。 |
| 04 | 🔄 迭代实验思维 | AI 产品不确定性高,需要有快速实验和迭代的习惯。A/B 测试 prompt、对比不同模型效果、灰度发布、快速回滚——这些思维方式很重要 |
| 05 | ⚖️ AI 安全与合规 | 幻觉问题、偏见问题、隐私问题、内容安全问题——都是 AI 产品特有的,国内还有算法备案等要求,需要关注 |
| 06 | 💰 商业模式设计 | AI 的成本结构跟传统软件不一样:每次调用都在烧 token。产品定价的时候得把这点算清楚,不然规模越大亏得越多 |
| 07 | 🔌 技术理解力 | 不要求写代码,但得能看懂 API 文档,能跟工程师讨论技术方案。至少要知道”这个方案成本太高””那个 Reranker 延迟受不了” |
| 08 | 🎨 交互设计新范式 | 对话式 UI、自然语言输入、渐进式生成、人机协作编辑——这些都不是传统 GUI 的玩法,需要在产品设计上探索新的交互模式 |
七、我的学习路线
这是我给自己的学习计划,目前还在第二阶段。时间节点比较理想化,实际执行中经常会因为工作和其他事情延期,但有个大致的方向总比没有强。
第一阶段(1-2 周)—— 建立认知地图
目标: 能大致说出当前 AI 行业有哪些主要玩家、各家在做什么、技术版图长什么样。
我在做的事:
- 每天刷几个主流 AI 产品(ChatGPT, Claude, Kimi, 豆包, Perplexity, Cursor),不是随便玩而是带着问题去用
- 翻各家模型公司的官方博客和技术报告
- 订阅了一些 AI 资讯源:The Batch (Andrew Ng)、新智元、量子位、机器之心
- 在Dify上搭了第一个 AI Bot(虽然做得很糙,但跑通了流程)
第二阶段(2-4 周)—— 动手实践
目标: 能自己搭出 AI 产品原型,对 RAG、Agent、Prompt 有实感而非停留在概念上。
我计划做的:
- 用 V0 和 Bolt 生成了几个可交互的页面 Demo,用来验证一些产品想法
- 在Dify上搭了 3 个不同场景的 Agent:一个客服 Bot、一个内容摘要 Bot、一个简单的数据分析 Bot
- 注册了几个模型的 API,试了试同一个需求在不同模型上的 Prompt 效果差异(差别真的很大)
- 用 Figma 设计了一个 AI 产品的核心交互流程
- 到处搜集知名 AI 产品的 PRD 和设计文档来学习
第三阶段(4-8 周)—— 深度专题研究
目标: 能深度讨论和设计 AI 产品方案。
我计划做的事:
- 选 1-2 个垂直方向做竞品分析(我比较感兴趣的是 AI+教育和 AI+SaaS 方向)
- 正经写一份 AI 产品的完整 PRD,包括评估指标、Prompt 设计、成本估算
- 啃一啃 LangChain 和 LlamaIndex 的官方文档,理解架构思想
- 准备几个能拿得出手的 AI 产品案例分析
- 能回答清楚”为什么这个场景需要 AI”这种本质问题
持续学习
- 每周试一个新产品(不管火不火,先自己用了再说)
- 关注大厂的发布会和模型更新
- 混几个 AI PM 的社群,看看别人在聊什么、遇到什么问题
- 每个月做一次复盘:这个月 AI 行业最重要的变化是什么?
写在后面
这份笔记我会持续更新——写出来的目的,一方面是为了让自己学得更扎实,另一方面也是希望能和有同样方向的小伙伴交流。
如果你也感兴趣,或者已经是这个领域的前辈,欢迎留言交流。我还有很多不懂的地方,比如怎么做 AI 产品的用户研究、怎么设计 eval set 更科学、Agent 产品的定价策略到底怎么定……如果有经验的朋友愿意分享就太好了。
参考资源
- OpenAI 官方博客:https://openai.com/blog
- Anthropic 官方文档:https://docs.anthropic.com
- Google AI 博客:https://ai.googleblog.com
- LangChain 文档:https://python.langchain.com
- LlamaIndex 文档:https://docs.llamaindex.ai
- Dify 平台:https://dify.ai
- 扣子平台:https://www.coze.cn
声明:本文是我个人的学习笔记,内容基于 2026 年 8 月的情况。AI 这个领域变化极快,请以最新的官方信息为准。如果有写错的地方,欢迎指出来,我会及时修正。