Tag: LLM
All the articles with the tag "LLM".
-
Kimi K2.7 Code 进 GitHub Copilot:基准、舆论之后,国产模型第一次拿下"渠道"
GitHub Copilot 2026-07-01 把 Kimi K2.7 Code 放进模型选择器:第一个 open-weight、也是第一个中国模型。数据经 HF/HN API 与官方定价页亲手核验,拆"开源权重 + Azure 托管 + 企业默认关闭"三层信任结构与两条出海路线。
-
GLM 5.2 在安全基准超 Claude:中国大模型的「场景特化超越」是不是新拐点
Updated:智谱 GLM 5.2 在 Semgrep IDOR 漏洞检测基准 F1 拿 39%,超过 Claude Code 全部 Opus 版本,单个漏洞发现成本约 1/6;但综合榜仍差约 2 分。Kimi、Qwen 同期复现同样格局。本文拆"场景特化超越"是不是 2026 中国模型的新拐点。
-
AI 模型对比 2026 年中续篇:blog166 发布 52 天后,我 5 月的判断错了几条
blog166 发出 52 天后逐条自校验:5 条判断里 2 条反悔(Sonnet/Opus 建议过时、开源差距低估)、1 条待验证(Anthropic 定价)、2 条成立。附我博客 6 个月模型路由的真实观察和下次校验节点。
-
ZCode 登 HN 头版:国产开发者工具第一次被硅谷工程师认真评估
智谱 GLM-5.2 官方 harness "ZCode" 登 Hacker News 头版(最早 155/192,现在 264/236)。这不是"又一个 AI IDE",而是国产开发者工具首次进入硅谷主流工程师视野。本文拆事件时间线、ZCode 到底是什么形态(不是 CLI 是桌面 app)、HN 里 3 类真实反对声,以及自己接 GLM Coding API 的 30 行 TS 示例。
-
Claude Fable 5 上手两天:API 集成方真正要改的 5 件事
Anthropic 6/9 发布的 Fable 5 把命名从 Opus/Sonnet/Haiku 换成 Fable/Mythos,但真正让所有 Claude API 集成方都得动代码的不是名字——是新增的 stop_reason refusal、强制 adaptive thinking、和"必须配 fallback 模型"这套机制。我在 Claude Code 上跑了两天后,把集成方该改的细节拆给你看。
-
Prompt、Context、Harness、Agentic:LLM 应用四层嵌套结构,搞清自己卡在哪一层
Prompt 工程师、Context 工程师、Harness 工程、Agentic 工程师——这四个词不是互相竞争的角色,是层层嵌套的关注点:从一句提示词到整套自主系统。理清四层关系,知道自己每次卡住到底在优化哪一层。
-
AI 大模型对比 2026 年中版:blog080 写完两个多月,模型层换了一轮
blog080 写于 2026 年 3 月初。两个多月过去,GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro 全部发布,开源旗舰 GLM-5.1/Qwen 3 Coder 缩到闭源 5-15 分。这是 5 月升级版:变了什么、3 月选型怎么换。
-
AI Agent 持久记忆架构对比:file-based vs 向量检索,blog-preflight Subagent 实测
把同一个 Subagent 同时接 Claude Code 自带 file-based memory 和 mem0 向量检索,对比 token 消耗、召回质量、跨会话学习效果。给出"什么数据规模用哪种"的具体阈值,并讨论 procedural memory 这个最弱但最有潜力的方向。