<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>深度调研 on 卓琪的开发笔记</title>
    <link>https://zhuoqidev.com/categories/%E6%B7%B1%E5%BA%A6%E8%B0%83%E7%A0%94/</link>
    <description>Recent content in 深度调研 on 卓琪的开发笔记</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>zh-CN</language>
    <copyright>© 2026 Liu ZhuoQi</copyright>
    <lastBuildDate>Sun, 19 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://zhuoqidev.com/categories/%E6%B7%B1%E5%BA%A6%E8%B0%83%E7%A0%94/index.xml" rel="self" type="application/rss+xml" />
    
    <item>
      <title>LLM 推理引擎怎么选——2026 年从本地单机到 PD 分离的全景选型地图</title>
      <link>https://zhuoqidev.com/posts/llm-inference-engine-selection/</link>
      <pubDate>Sun, 19 Jul 2026 00:00:00 +0000</pubDate>
      
      <guid>https://zhuoqidev.com/posts/llm-inference-engine-selection/</guid>
      <description>&lt;p&gt;阿里云 CAP 有一篇讲推理引擎选型的文章，把候选收敛到四个：&lt;strong&gt;Ollama、vLLM、SGLang、Hugging Face Pipeline&lt;/strong&gt;。这个划分在 2024 年是够用的。&lt;/p&gt;&#xA;&lt;p&gt;但到 2026 年，它至少漏掉了半张地图——NVIDIA 的 TensorRT-LLM 完成了「PyTorch 化」转身、SGLang 因为首个开源复现 DeepSeek 大规模部署而封神、Hugging Face 自己给 TGI 挂上了「维护模式」横幅并劝你改用 vLLM，而整个 2025 年推理引擎领域真正的主线，其实是一个字：&lt;strong&gt;拆&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这篇文章把这张地图更新到 2026 年年中。它不替你拍板选哪个产品——&lt;strong&gt;它给你一套分层框架、一张决策矩阵和一棵决策树，让你自己把候选收敛到 1–2 个。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&#xA;&lt;h2 class=&#34;relative group&#34;&gt;为什么 2026 年「选推理引擎」才是个真问题&#xA;    &lt;div id=&#34;为什么-2026-年选推理引擎才是个真问题&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;&#xA;    &#xA;    &lt;span&#xA;        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 -start-6 not-prose group-hover:opacity-100 select-none&#34;&gt;&#xA;        &lt;a class=&#34;text-primary-300 dark:text-neutral-700 !no-underline&#34; href=&#34;#%e4%b8%ba%e4%bb%80%e4%b9%88-2026-%e5%b9%b4%e9%80%89%e6%8e%a8%e7%90%86%e5%bc%95%e6%93%8e%e6%89%8d%e6%98%af%e4%b8%aa%e7%9c%9f%e9%97%ae%e9%a2%98&#34; aria-label=&#34;锚点&#34;&gt;#&lt;/a&gt;&#xA;    &lt;/span&gt;&#xA;    &#xA;&lt;/h2&gt;&#xA;&lt;p&gt;三年前不需要纠结这个。那时候能把一个 7B 模型在 GPU 上跑起来、返回还算流畅的 token 流，就已经过关。&lt;/p&gt;&#xA;&lt;p&gt;现在情况变了，原因有三个：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;&lt;strong&gt;模型能力在趋同，部署形态在分化。&lt;/strong&gt; 开源侧从 Llama、Qwen 到 DeepSeek-V3/R1、Kimi K2，能力差距在缩小；真正拉开差距的，变成了「你能不能把它高效、低成本、稳定地跑起来」。同一个 DeepSeek-R1，有人一张 4090 勉强跑起来做原型，有人用 96 张 H100 做到接近官方吞吐、成本压到官方 API 的五分之一——差的就是推理引擎和部署架构。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;大规模 MoE 把推理从「单卡工程」推成了「分布式系统工程」。&lt;/strong&gt; DeepSeek-V3 是 671B 总参 / 37B 激活，Kimi K2 更是 1T 总参。这类模型单机放不下，必须跨节点做专家并行（EP），推理引擎的选择直接决定了你要不要碰 all-to-all 通信、专家负载均衡这些硬骨头。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;同一个模型，引擎之间的吞吐/成本差异可以到数倍。&lt;/strong&gt; 这不是「快一点点」的差别，是「同样的卡，能不能多服务几倍用户」的差别，直接写进云账单。&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;所以选型不再是「随便挑一个能跑的」，而是&lt;strong&gt;先想清楚你在地图的哪一层&lt;/strong&gt;。&lt;/p&gt;</description>
      
    </item>
    
    <item>
      <title>大模型为什么记不住你——Cursor / Claude Code / Codex 记忆机制全拆解</title>
      <link>https://zhuoqidev.com/posts/llm-memory-research/</link>
      <pubDate>Mon, 04 May 2026 00:00:00 +0000</pubDate>
      
      <guid>https://zhuoqidev.com/posts/llm-memory-research/</guid>
      <description>&lt;p&gt;Cursor 有 Rules + Memories，Claude Code 有 CLAUDE.md + MEMORY.md，Codex 有 AGENTS.md + Memories——这些 Agent 工具都有各自的&amp;quot;记忆&amp;quot;系统。但&lt;strong&gt;没有一个真的修改了模型权重&lt;/strong&gt;——所有&amp;quot;记忆&amp;quot;本质都是把结构化文本塞回 system prompt。这篇调研用 &lt;strong&gt;67+ 条一手资料&lt;/strong&gt;交叉验证了这个结论，从架构约束到产品实现，彻底拆解 Agent 记忆系统的真相。&lt;/p&gt;&#xA;&#xA;&lt;h2 class=&#34;relative group&#34;&gt;为什么这个问题值得花 67 条资料去研究&#xA;    &lt;div id=&#34;为什么这个问题值得花-67-条资料去研究&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;&#xA;    &#xA;    &lt;span&#xA;        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 -start-6 not-prose group-hover:opacity-100 select-none&#34;&gt;&#xA;        &lt;a class=&#34;text-primary-300 dark:text-neutral-700 !no-underline&#34; href=&#34;#%e4%b8%ba%e4%bb%80%e4%b9%88%e8%bf%99%e4%b8%aa%e9%97%ae%e9%a2%98%e5%80%bc%e5%be%97%e8%8a%b1-67-%e6%9d%a1%e8%b5%84%e6%96%99%e5%8e%bb%e7%a0%94%e7%a9%b6&#34; aria-label=&#34;锚点&#34;&gt;#&lt;/a&gt;&#xA;    &lt;/span&gt;&#xA;    &#xA;&lt;/h2&gt;&#xA;&lt;p&gt;因为每个做 Agent 的人都会撞到这堵墙：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;Cursor、Claude Code、Codex 都有&amp;quot;记忆&amp;quot;功能，但它们到底是怎么实现的？&lt;/li&gt;&#xA;&lt;li&gt;为什么我让 AI 记住用户偏好，它过 10 轮就忘了？&lt;/li&gt;&#xA;&lt;li&gt;为什么 Prompt Caching 不能替代 Memory？&lt;/li&gt;&#xA;&lt;li&gt;Mem0、Zep、Letta、LangGraph Store——到底选哪个？&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;答案在 Anthropic / OpenAI / Google 的官方文档、Karpathy 的公开访谈、以及 arXiv 论文里——但分散在 67 个不同的地方。这篇调研把它们串起来了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&#xA;&lt;h2 class=&#34;relative group&#34;&gt;一句话结论&#xA;    &lt;div id=&#34;一句话结论&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;&#xA;    &#xA;    &lt;span&#xA;        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 -start-6 not-prose group-hover:opacity-100 select-none&#34;&gt;&#xA;        &lt;a class=&#34;text-primary-300 dark:text-neutral-700 !no-underline&#34; href=&#34;#%e4%b8%80%e5%8f%a5%e8%af%9d%e7%bb%93%e8%ae%ba&#34; aria-label=&#34;锚点&#34;&gt;#&lt;/a&gt;&#xA;    &lt;/span&gt;&#xA;    &#xA;&lt;/h2&gt;&#xA;&lt;p&gt;所谓「大模型没有记忆」不是疏忽，而是 &lt;strong&gt;Transformer O(n²) 注意力 + KV cache 显存 + 权重纠缠（灾难性遗忘）+ GDPR 合规&lt;/strong&gt; 四重约束的均衡解。Cursor / Claude Code / Codex 等 Agent 工具的 &amp;ldquo;Memory&amp;rdquo; 本质都是&lt;strong&gt;把结构化文本塞回 system prompt&lt;/strong&gt;，模型权重永远不动。Prompt Caching 只是性能优化，不是记忆。未来 1–3 年的主流是 &lt;strong&gt;「无状态 LLM 内核 + 有状态 Agent 记忆层」&lt;/strong&gt; 混合架构。&lt;/p&gt;</description>
      
    </item>
    
  </channel>
</rss>
