AI 产品经理学习笔记 —— 我的知识整理与思考

写在前面

AI 领域太新、变化太快,每天都有新模型、新产品冒出来,一不留神就跟不上了。为了逼自己系统性学习,我把这段时间积累的资料和思考整理成了这份笔记。
下面进入正题。


一、AI 产品生态地图

国际主流 AI 产品

厂商 产品 备注
OpenAI ChatGPT / GPT-5 目前全球用户量最大的 AI 对话产品。多端覆盖、多模态输入、能跑代码、Canvas 可以协作编辑,企业版也有私有部署方案。我个人日常用得最多的就是它
Anthropic Claude (Opus 5 / Sonnet 5) 主打安全对齐,上下文窗口能做到 200K tokens。Claude Code 在开发者圈子里增长很快,Artifacts 能直接生成可交互 UI。Opus 5 适合需要深度推理的场景,Sonnet 5 则更快一些
Google DeepMind Gemini 3 Google 的旗舰多模态模型,深度绑定 Google 生态(搜索、Workspace、Android)。上下文窗口到了百万 token 级别,这点挺让我惊讶的
Meta Llama 4 目前最强的开源模型系列,各种尺寸都有。因为开源,催生了一大堆微调模型——如果公司要自部署,这基本上是首选基座了
Microsoft Copilot (M365 / GitHub) 把 AI 塞进了 Office 全家桶和 VS Code,直接触达数亿存量用户。GitHub Copilot 在代码生成这块真的很强,Workspace 模式能跨文件重构
Apple Apple Intelligence 端侧 AI 的代表方案,配合 Private Cloud Compute 做隐私保护。Siri 全面升级后能跨 App 操作,我觉得 OS 级 AI 的产品思路值得关注
xAI Grok 4 Elon Musk 家的模型,最大卖点是能实时拿到 X(Twitter)的数据,定位偏社交媒体和新闻场景
Perplexity Perplexity AI AI 搜索的标杆,把 RAG 和实时搜索结合得很好,每条回答都带精确引用。我个人做调研的时候越来越依赖它而不是传统搜索了
Notion / Cursor AI-Native 应用 Notion AI 在文档知识库场景做了深度集成。Cursor 是我最近在学的,它用 Composer 和 Agent 模式重新设计了写代码的流程——这种”AI 主动干活、人来审核”的产品形态给了我很多启发

国内主流 AI 产品

厂商 产品 备注
字节跳动 豆包 / 扣子 (Coze) 豆包在国内用户量很大,覆盖对话、写作、图像、音乐等。扣子是字节的 Bot 开发平台,可视化搭 Agent 的体验挺顺手的——我最近在上面捣鼓了不少 demo
百度 文心一言 / 文心大模型 文心 4.5 在中文本土化上下了功夫,背靠百度搜索生态,千帆平台面向企业提供服务
阿里巴巴 通义千问 (Qwen) / 通义万相 Qwen 开源版在国际榜单上表现不错,我自己试过跑本地版。通义万相做图生视频,和阿里云、钉钉的深度集成是天然优势
腾讯 混元大模型 / 元宝 混元支撑了微信、QQ、腾讯会议的 AI 功能。元宝 App 面向 C 端,背靠公众号和视频号的内容生态
月之暗面 Kimi 200 万字上下文确实很强,读长文档、分析论文的场景做得特别好。产品体验很简洁,是我目前使用频率很高的国内产品
智谱 AI ChatGLM / 智谱清言 清华系,GLM 系列在中文任务上口碑不错。AutoGLM 在探索手机 Agent 方向,这个思路挺有意思的
深度求索 DeepSeek 坦白说 DeepSeek 给我冲击很大——用远低于同行的成本训练出了 V3/R1,数学推理和代码能力都很强,而且是开源的。某种程度上改变了大家对”大模型必须烧钱”的认知
科大讯飞 讯飞星火 讯飞在语音这块积累很深,星火在语音交互、教育、医疗等场景有差异化的落地,偏 B 端多一些

二、AI 模型全景

搞清楚有哪些类型的模型、各自能干什么、大概的成本是什么样的

模型分类总览

模型类别 代表模型 核心能力 典型产品场景 备注
大语言模型 (LLM) GPT-5, Claude Opus 5, Gemini 3, DeepSeek-V3, Qwen3 文本理解、生成、推理、代码、翻译 对话助手、文档写作、代码辅助、客服 上下文窗口大小、推理速度、API 定价、幻觉率
推理模型 (Reasoning) Claude Opus 5 (Extended Thinking), DeepSeek-R1, o4-mini 深度推理、数学证明、复杂逻辑链 数学解题、法律分析、科学研究、战略决策 推理耗时 vs 准确率的权衡、thinking budget 怎么设定
多模态模型 GPT-5 (视觉), Gemini 3, 通义万相 图像/视频/音频理解与生成 图片分析、视频总结、语音助手、设计生成 支持哪些模态、分辨率够不够、生成质量如何
图像生成模型 DALL-E 4, Midjourney V7, Stable Diffusion 3, Flux 文生图、图生图、风格迁移 创意设计、广告素材、游戏美术、电商图 可控性、风格一致性、版权合规问题、推理成本
视频生成模型 Sora, Runway Gen-4, 可灵 (Kling), 即梦 文生视频、图生视频、视频编辑 短视频创作、影视预演、广告制作 时长限制、物理一致性、运动质量、价格
语音模型 GPT-5 Voice, ElevenLabs, 讯飞语音 TTS、ASR、语音克隆、实时对话 语音助手、有声读物、实时翻译、客服 延迟能不能做到 500ms 内、情感表达自然度、多语言支持
音乐/音频模型 Suno V5, Udio 文生音乐、风格模仿、编曲 背景音乐生成、广告配乐、个人创作 版权归属(这个争议很大)、风格覆盖、时长控制
嵌入模型 (Embedding) text-embedding-3, BGE-M3, Jina Embeddings 文本向量化、语义相似度 语义搜索、RAG、聚类分析、推荐系统 向量维度、多语言支持好不好、检索精度

选型思路

做产品方案的时候,选模型大致可以从两个角度出发:

按场景选

  • 需要强推理/逻辑 → Claude Opus 5 / DeepSeek-R1
  • 需要多模态理解 → Gemini 3 / GPT-5
  • 需要低成本/高并发 → GPT-5 Mini / DeepSeek-V3 / Llama 4
  • 需要中文优化 → Qwen3 / 文心 / DeepSeek
  • 需要私有化部署 → Llama 4 / Qwen3(开源方案)

按预算选

  • 预算充裕、追求质量 → GPT-5 / Claude Opus 5
  • 中等预算、追求平衡 → Claude Sonnet 5 / Gemini 3
  • 预算有限、需要规模化 → GPT-5 Mini / DeepSeek-V3
  • 零预算、自部署 → Llama 4 / Qwen3(开源)

注:实际选型还要看具体的场景需求、延迟要求、合规约束等等。


三、AI 核心技术模式

3.1 RAG(检索增强生成)

我的理解: 简单说就是让 LLM “开卷考试”而不是”闭卷瞎猜”。用户问问题 → 先去知识库里搜相关文档 → 把搜到的内容作为参考材料塞给 LLM → LLM 基于这些材料生成回答。

为什么需要它? LLM 的知识有截止日期,也不知道你们公司内部的资料,还容易胡说八道。RAG 就是解决这三个问题的。

值得关注:

  • 分块策略(chunk size)——文档切多大块?切太大检索不精准,切太小又丢上下文。我目前的理解是 FAQ 类用小 chunk(256 左右),长文档类用大一点的(512-1024),还要加 overlap 防止关键信息被切断
  • 检索精度 vs 召回率——前者是”搜出来的多少是对的”,后者是”该搜出来的搜到了多少”。不同产品场景偏重不一样,需要跟工程师商量定目标
  • 混合检索(BM25 + 向量)——关键词匹配和语义匹配可以互补,纯向量检索对精确字符串(比如产品编号)效果不好
  • 重排序(Rerank)——第一次检索用轻量模型图快,然后拿候选人用强模型重新排一遍

这块我还在深入学,后面可能会单独写一篇 RAG 的详细笔记。

3.2 Agent(智能体)

我的理解: 如果说 Chatbot 是”你问一句我答一句”,Agent 就是”你告诉我想要什么结果,我自己想办法做”。Agent = LLM(大脑)+ 规划 + 工具调用 + 记忆 + 反思。

值得关注:

  • 任务完成率——Agent 能成功搞定多少任务?简单任务应该 > 95%,复杂任务七成以上就很不错了
  • 工具链设计——Agent 能调用哪些工具,工具描述写得好不好,直接决定了它能做什么
  • 成本控制——Agent 会在多步调用中消耗大量 token,一不小心就跑飞了。需要设步数上限、token budget
  • 安全边界——涉及写操作(删数据、发邮件)的场景,Agent 做之前最好让用户确认一下

我自己在Dify上搭了几个 Agent demo 之后,对”循环调用”和”错误恢复”的体会深了很多——Agent 真的很容易陷入死循环,需要在设计时就考虑好退出机制。

3.3 Function Calling / Tool Use

我的理解: 模型不直接输出文字,而是输出一个结构化的 JSON 表示”我要调这个函数,参数是这些”。这是 Agent 能够操作外部世界的底层能力。

值得关注: 工具描述的设计(这其实是 PM 能直接影响模型行为的地方)、模型选工具的准确率、参数提取得对不对、能不能并行调用多个工具。

3.4 Prompt Engineering

我的理解: 这是 PM 的”新编程语言”——通过设计提示词来控制模型输出,不用写代码就能调优产品行为。成本最低、迭代最快。

值得关注:

  • System Prompt 设计——给模型定人设、定规则、定输出格式。这其实就是一个 AI 产品的”规格说明书”
  • Few-shot——给几个例子让模型照葫芦画瓢,效果往往比长篇规则描述更好
  • Chain-of-Thought——加一句”让我们一步一步思考”,复杂推理的准确率能明显提升

3.5 Fine-tuning(微调)

我的理解: 用自己准备的数据在基座模型上再训练一下,让它在特定任务上更稳。成本比 Prompt Engineering 高不少,但效果更可控。

经验: 先 Prompt 后微调,不要一上来就微调——因为 Prompt 改起来几分钟,微调可能要几周。什么时候该微调?Prompt 已经优化到天花板了、有足够多的高质量标注数据了、需要一个很稳定的风格输出的时候。

3.6 多 Agent 协作

我的理解: 让多个专业 Agent 组队干活。常见的有监督者模式(一个老大分活给小兵)、流水线模式(A 干完给 B)、辩论模式(大家互相挑刺最后达成一致)。

看法: 多 Agent 看起来很酷,但很容易过度设计。大多数场景一个 Agent + 多个工具就够了,多加一个 Agent 就多一个出错的可能。

3.7 MCP (Model Context Protocol)

我的理解: Anthropic 提出的一套标准化协议,让 AI 和外部工具/数据源之间能”即插即用”。可以类比成 AI 世界的 USB-C 接口。

看法: 如果 MCP 真的成为行业标准,”能接多少数据源”就不再是各家 AI 产品的竞争壁垒了(因为大家都能接),竞争会回到模型能力和产品体验本身。这个可能会改变整个生态格局。

3.8 Caching / 流式 / 异步

我的理解: 这几个是工程层面的优化杠杆,它们直接影响成本和体验。

  • Prompt Caching:System Prompt 等不变的部分可以缓存,能节省 50-90% 输入成本
  • 流式输出:一个字一个字往外蹦,比等全部生成完了再显示,用户感知速度快很多
  • 异步批处理:不需要实时返回的任务(如批量分析报告),可以走 batch API,成本直接砍半

四、主流框架与基础设施

类别 工具/框架 用途 生态地位
LLM 应用框架 LangChain 最成熟的 LLM 开发框架,什么都能干——Chains、Agents、RAG 都有封装。不过据说封装层多,debug 比较痛苦 ⭐⭐⭐⭐⭐
LLM 应用框架 LlamaIndex 专精数据索引和 RAG,做知识库问答类产品据说比 LangChain 更专业 ⭐⭐⭐⭐
LLM 应用框架 Semantic Kernel 微软出的,和 .NET/Azure 深度绑定,微软系企业的首选 ⭐⭐⭐
Agent 框架 AutoGPT / CrewAI 多 Agent 协作框架,定义角色和任务流程 ⭐⭐⭐⭐
Agent 平台 扣子 (Coze) / Dify 可视化搭建 Agent,拖拽式编排。我自己在扣子上试了不少 demo,很适合快速验证想法 ⭐⭐⭐⭐⭐
RAG 框架 RAGFlow / MaxKB 国产开源 RAG 平台,中文文档解析有优势 ⭐⭐⭐⭐
向量数据库 Pinecone / Milvus / Weaviate / Chroma / Qdrant RAG 的底层存储设施,不同方案在性能、成本、运维难度上差别挺大。我自己做 demo 用 Chroma(免费够用),生产环境据说 Milvus 最强但要会运维 ⭐⭐⭐⭐⭐
模型服务 vLLM / Ollama / Replicate 模型部署和推理。Ollama 可以在我自己电脑上跑 Llama/Qwen,很方便 ⭐⭐⭐⭐
观察与评估 LangSmith / LangFuse / MLflow LLM 应用的监控、调试、评估平台。产品上线后怎么知道质量有没有下降?就靠这些 ⭐⭐⭐⭐⭐
Prompt 管理 PromptLayer / Agenta Prompt 的版本管理和协作编辑,适合团队化迭代 ⭐⭐⭐

五、产品原型设计工具

这部分跟我现在的工作经验有重叠,但 AI 时代多了几个新工具,我也是最近才开始密集使用的。

我目前在用的工具

工具 我怎么用 推荐程度
Figma 🎨 UI 设计和交互原型,这个应该不用多介绍了,基本上是行业标配 ⭐⭐⭐⭐⭐
Axure RP 📐 B 端复杂交互的高保真原型,学习曲线有点陡,但能做条件逻辑 ⭐⭐⭐
墨刀 (MockingBot) 🖼️ 国产在线原型工具,移动端快速出图很方便 ⭐⭐⭐⭐
MasterGo ⚡ 国产 Figma 替代,国内大厂用得越来越多 ⭐⭐⭐⭐
V0 / Bolt / Lovable 🤖 用自然语言描述然后直接生成可交互页面——这个真的让我很兴奋,做 demo 验证想法快到离谱 ⭐⭐⭐⭐⭐

推荐工具搭配

日常三件套:

  • Figma —— 常规 UI 和交互设计
  • V0 / Bolt —— 快速生成可交互的页面原型(AI PM 的神器)
  • 扣子 / Dify —— 搭建 AI 产品的逻辑原型,验证 Agent 流程

辅助工具:

  • Whimsical / Miro —— 画流程图、思维导图、用户旅程图
  • Notion —— 写 PRD 和项目追踪
  • 飞书多维表格 —— 做数据收集和轻量数据库
  • Jupyter Notebook —— 做数据分析和 Prompt 实验(这个我还在学)

六、AI PM 核心能力

这部分是结合我自己的学习和跟一些前辈交流后整理的,可能不够全面,但应该覆盖了比较核心的几块。

# 能力维度 我的理解
01 🎯 AI 产品嗅觉 能不能判断一个场景到底适不适合用 AI?用哪种 AI 模式最合适?区分 AI-Native 和 AI-Wrapper 的差别
02 📊 数据思维与评估 AI 产品不是功能上线就完事了,要有评估体系。准确率、召回率、幻觉率、token 消耗这些指标,PM 自己心里得有数
03 💬 Prompt Engineering PM 的”新编程语言”。不需要会写 Python,但得会写 Prompt 来控制产品行为。
04 🔄 迭代实验思维 AI 产品不确定性高,需要有快速实验和迭代的习惯。A/B 测试 prompt、对比不同模型效果、灰度发布、快速回滚——这些思维方式很重要
05 ⚖️ AI 安全与合规 幻觉问题、偏见问题、隐私问题、内容安全问题——都是 AI 产品特有的,国内还有算法备案等要求,需要关注
06 💰 商业模式设计 AI 的成本结构跟传统软件不一样:每次调用都在烧 token。产品定价的时候得把这点算清楚,不然规模越大亏得越多
07 🔌 技术理解力 不要求写代码,但得能看懂 API 文档,能跟工程师讨论技术方案。至少要知道”这个方案成本太高””那个 Reranker 延迟受不了”
08 🎨 交互设计新范式 对话式 UI、自然语言输入、渐进式生成、人机协作编辑——这些都不是传统 GUI 的玩法,需要在产品设计上探索新的交互模式

七、我的学习路线

这是我给自己的学习计划,目前还在第二阶段。时间节点比较理想化,实际执行中经常会因为工作和其他事情延期,但有个大致的方向总比没有强。

第一阶段(1-2 周)—— 建立认知地图

目标: 能大致说出当前 AI 行业有哪些主要玩家、各家在做什么、技术版图长什么样。

我在做的事:

  • 每天刷几个主流 AI 产品(ChatGPT, Claude, Kimi, 豆包, Perplexity, Cursor),不是随便玩而是带着问题去用
  • 翻各家模型公司的官方博客和技术报告
  • 订阅了一些 AI 资讯源:The Batch (Andrew Ng)、新智元、量子位、机器之心
  • 在Dify上搭了第一个 AI Bot(虽然做得很糙,但跑通了流程)

第二阶段(2-4 周)—— 动手实践

目标: 能自己搭出 AI 产品原型,对 RAG、Agent、Prompt 有实感而非停留在概念上。

我计划做的:

  • 用 V0 和 Bolt 生成了几个可交互的页面 Demo,用来验证一些产品想法
  • 在Dify上搭了 3 个不同场景的 Agent:一个客服 Bot、一个内容摘要 Bot、一个简单的数据分析 Bot
  • 注册了几个模型的 API,试了试同一个需求在不同模型上的 Prompt 效果差异(差别真的很大)
  • 用 Figma 设计了一个 AI 产品的核心交互流程
  • 到处搜集知名 AI 产品的 PRD 和设计文档来学习

第三阶段(4-8 周)—— 深度专题研究

目标: 能深度讨论和设计 AI 产品方案。

我计划做的事:

  • 选 1-2 个垂直方向做竞品分析(我比较感兴趣的是 AI+教育和 AI+SaaS 方向)
  • 正经写一份 AI 产品的完整 PRD,包括评估指标、Prompt 设计、成本估算
  • 啃一啃 LangChain 和 LlamaIndex 的官方文档,理解架构思想
  • 准备几个能拿得出手的 AI 产品案例分析
  • 能回答清楚”为什么这个场景需要 AI”这种本质问题

持续学习

  • 每周试一个新产品(不管火不火,先自己用了再说)
  • 关注大厂的发布会和模型更新
  • 混几个 AI PM 的社群,看看别人在聊什么、遇到什么问题
  • 每个月做一次复盘:这个月 AI 行业最重要的变化是什么?

写在后面

这份笔记我会持续更新——写出来的目的,一方面是为了让自己学得更扎实,另一方面也是希望能和有同样方向的小伙伴交流。

如果你也感兴趣,或者已经是这个领域的前辈,欢迎留言交流。我还有很多不懂的地方,比如怎么做 AI 产品的用户研究、怎么设计 eval set 更科学、Agent 产品的定价策略到底怎么定……如果有经验的朋友愿意分享就太好了。


参考资源

声明:本文是我个人的学习笔记,内容基于 2026 年 8 月的情况。AI 这个领域变化极快,请以最新的官方信息为准。如果有写错的地方,欢迎指出来,我会及时修正。