concepts

概念

60 个概念页面

◇ 概念

多智能体模型分工

多智能体模型分工是指在 AI 系统中,将不同复杂度的任务分配给不同能力等级的模型,以实现最优的性能 成本平衡。核心思想是"大模型规划,小模型执行"。 核心理念 在单个 AI Agent 的工作流中,不同步骤对模型能力的要求差异很大。例如: 规划和推理 (需要强模型):理解用户意图、分解任务、制定策略 执行和生成 (可用轻量模型):代码补全、格式转换、简单查…

2 min read · 2026-05-04#agent#model#optimization
◇ 概念

技术栈自主

技术栈自主指公司为了掌控关键产品能力与长期技术路线,选择自研基础模型、训练/微调流程、推理栈和应用工具,而不是完全购买外部 AI 服务。 在中国 AI 公司的表现 《Notes from inside China’s AI labs》指出,几乎每个中国主要科技公司都在建设自己的通用 LLM。美团、小米、蚂蚁等公司并不只是追逐热点,而是认为 LLM 会成为未…

1 min read · 2026-05-09#concept#architecture#open-source
◇ 概念

奖励模型风格产物

奖励模型风格产物是指 训练过程中微小的奖励偏差经过强化学习放大后,最终在产品层面表现为可感知的语言风格或行为习惯 的现象。 核心机制 OpenAI 在 2026 年 4 月的「地精事件」中完整揭示了这一机制: 1. 奖励偏差的产生 在训练 [[openai]] 的 Nerdy 人格时,奖励模型对「含有生物比喻的玩味输出」给予了偏高的评分。审计发现,在 76…

2 min read · 2026-05-01#training#alignment#model
◇ 概念

锯齿状智能

锯齿状智能是 [[Andrej Karpathy]] 在 Sequoia AI Ascent 2026 上提出的一个概念,用以描述当前大语言模型能力分布极不均匀的特征:模型可以一口气重构 10 万行代码库,却会在常识问题上翻车(如建议你走路去洗车店)。 经济学解释 Karpathy 认为锯齿状智能主要不是一个技术问题,而是一个 经济学问题 。模型能力的分布…

2 min read · 2026-05-02#model#anthropic
◇ 概念

开放权重模型

开放权重模型是指公开模型权重、允许开发者下载、部署、微调或研究的模型发布方式。它不等同于完整开源:训练数据、训练代码、许可证自由度和商业限制可能仍不透明或受限。 中国 AI 生态中的务实开放 Nathan Lambert 观察到,中国实验室的“open first”更多是务实选择:开放权重可以获得开发者反馈、增强生态影响力、回馈开源社区,并帮助企业把模型变…

1 min read · 2026-05-09#concept#open-source#model
◇ 概念

模型人格训练

1 2 title: 模型人格训练 3 created: 2026 05 01 4 updated: 2026 05 01 5 type: concept 6 tags: 7 training 8 alignment 9 model 10 sources: 11 "[[raw/articles/openai where goblins came from …

3 min read · 2026-05-02#model#anthropic
◇ 概念

目标导向智能体协作

目标导向智能体协作是一种 AI Agent 的工作范式,核心理念是:人类只需定义终点(目标),路径由 Agent 自己探索和执行。这代表了人机协作从"对话"到"委托"的范式转变。 三代软件范式 [[Andrej Karpathy]] 在 Sequoia AI Ascent 2026 中总结了三代软件范式的演进: 范式 人类参与方式 本质 Software …

2 min read · 2026-05-02#model#anthropic
◇ 概念

上下文腐烂

上下文腐烂是指在 AI Agent 的多轮交互过程中,错误信息、失败的工具调用记录等负面内容在上下文窗口中不断累积,导致模型后续判断质量持续下降的现象。 核心机制 当一次工具调用(tool call)失败时,错误信息会留在上下文中,占用 token 空间。虽然 Agent 有时能自我修正,但这些错误记录不会被清除。随着错误越积越多,模型的注意力被分散到这些…

2 min read · 2026-05-01#agent#workflow#optimization
◇ 概念

上下文焦虑

上下文焦虑是指大语言模型在上下文窗口接近满载时,开始拒绝工作的异常行为。模型会声称任务太复杂或无法继续处理,而实际上其能力并未耗尽,只是"感知到"上下文空间不足而产生了类似焦虑的退缩反应。 现象描述 [[Cursor]] 团队在实践中观察到,某些模型在上下文窗口快满时会表现出明显的退缩行为——声称任务过于复杂而无法继续。这种行为被团队命名为"context…

2 min read · 2026-05-01#agent#model#psychology
◇ 概念

智能体工程

1 2 title: 智能体工程 3 created: 2026 05 01 4 updated: 2026 05 01 5 type: concept 6 tags: 7 workflow 8 agent 9 engineering 10 sources: 11 "[[raw/articles/新智元 Karpathy 锯齿状智能 Sequoia 202…

3 min read · 2026-05-02#model#anthropic
◇ 概念

中国AI实验室生态

中国 AI 实验室生态指由 DeepSeek、Moonshot AI、智谱、Qwen、蚂蚁灵光、01.ai、美团、小米、字节跳动等实验室和大厂模型团队构成的前沿大模型网络。Nathan Lambert 在 2026 年中国行后认为,这个生态更像互相尊重、快速学习的工程共同体,而不是美国式“战斗部落”。 组织与文化特征 快速跟随者优势 :当前 LLM 前沿更…

1 min read · 2026-05-09#concept#lab#comparison
◇ 概念

Agent 操作契约

Agent 操作契约是比普通 system prompt 更高一层的智能体运行协议:它定义 Agent 是谁、如何说话、何时反驳、能自主做到哪里、必须向用户确认什么,以及当前任务地图是什么。Tony Simons 把 Hermes 的 SOUL.md 描述为这种契约的实例:不是“be helpful”,而是把 Agent 设计成“autonomous op…

3 min read · 2026-05-06#concept#workflow#automation
◇ 概念

Agent 输出格式

Agent 输出格式是指智能体在完成任务时选择用 Markdown、HTML、纯文本、JSON、CSV、幻灯片、Canvas 或专用 UI 交付结果的策略。Thariq 的文章把这个问题从“Markdown 是否足够”推进到“输出物到底服务谁”:如果文档主要给 agent 存取和继续加工,Markdown/结构化文本通常更高效;如果主要给人阅读、评审、分享…

2 min read · 2026-05-14#concept#productivity#knowledge-management
◇ 概念

Agent-框架

3 created: 2026 05 01 4 updated: 2026 05 01 5 type: concept 6 tags: 7 agent 8 tooling 9 workflow 10 sources: 11 "[[raw/articles/51cto mimo v2 5 openclaw agent harness 2026]]" 12 c…

3 min read · 2026-05-02#model#anthropic
◇ 概念

Agentic Coding(智能体编码)

概述 Agentic Coding(智能体编码)是一种新型软件开发范式,AI 模型不仅能回答问题,还能主动读取文件、运行命令、修改代码并自主解决问题。与传统的问答式 AI 助手不同,智能体编码工具如 Claude Code 可以探索代码库、制定计划并实施实现,开发者只需描述需求,AI 负责完成具体的技术工作。这种模式从根本上改变了软件团队构建软件的方式。 …

2 min read · 2026-05-02#coding#developer-tools#agents
◇ 概念

AI 自动化服务化

概述 AI 自动化服务化,是把 [[Claude Code]]、子代理、[[MCP]]、skill 文件、定时任务等 agent 能力,包装成面向企业流程的咨询与交付服务。它的核心不是“帮客户用一次 AI”,而是把客户可重复、可验证、有明确输出标准的任务,转成持续运行的工作流系统。 Adrian Punk 转述的 90 天游程把这一模式拆成六步:练工具箱、…

2 min read · 2026-05-07#concept#automation#workflow
◇ 概念

AI Marketing Engineer

AI Marketing Engineer 是 [[Shann Holmberg]] 提出的一种工作角色和方法论,核心是将 AI Agent 作为营销工作流的原型化和执行引擎,通过迭代式"跑 → 修正 → 沉淀"的循环,让 agent 自动学会可复用的营销技能。 核心工作流 阶段 1:Hermes Agent 原型化 在 [[Hermes Agent 工作…

3 min read · 2026-05-04#concept#marketing#automation
◇ 概念

AI就业影响

概述 AI 就业影响是指人工智能技术对劳动市场的冲击和由此引发的行业争论。核心分歧在于:AI 是增强人类工作还是取代人类工作?这一争论在 2025 2026 年达到高潮,以 [[Anthropic]] CEO [[Dario Amodei Dario Amodei]] 的「50% 白领岗位冲击论」和 NVIDIA CEO [[Jensen Huang 黄仁…

2 min read · 2026-05-03#concept#ai-industry#employment
◇ 概念

AI芯片出口管制

AI芯片出口管制是美国围绕先进GPU、AI加速器、互连和相关供应链对中国实施的技术限制体系。它既是国家安全工具,也是产业谈判筹码;企业层面则表现为 [[Jensen Huang 黄仁勋]] / NVIDIA、高通、美光等公司在中国市场机会与美国政策边界之间的拉扯。 2026年5月特朗普访华代表团信号 《特朗普:人在北京,刚下飞机》把黄仁勋临时加入访华代表团…

2 min read · 2026-05-13#concept#ai-industry#policy
◇ 概念

ASL(AI Safety Level)

概述 AI 安全级别(AI Safety Level,ASL)是 Anthropic 在 [[Responsible Scaling Policy 负责任扩展政策(RSP)]] 中引入的分级框架,借鉴了美国政府的生物安全级别(BSL)体系。该系统要求安全、安保和运营标准与模型的潜在灾难性风险成比例——随着模型能力的提升,安全要求也随之升级。 ASL 系统是…

3 min read · 2026-05-02#asl#safety-level#safety
◇ 概念

Bug Bounty(漏洞赏金计划)

概述 漏洞赏金计划(Bug Bounty)是 Anthropic 与 HackerOne 合作开展的安全测试项目,邀请外部安全研究人员对 AI 模型的安全防护系统进行压力测试。该计划聚焦于发现 通用越狱攻击(Universal Jailbreaks) ——即能够持续绕过 AI 安全护栏的漏洞,尤其针对 CBRN(化学、生物、放射性和核武器)及网络安全等高风…

2 min read · 2026-05-02#security#safety#testing
◇ 概念

CBRN

概述 CBRN 是 Chemical(化学)、Biological(生物)、Radiological(放射性)、Nuclear(核武器) 的缩写,指代大规模杀伤性武器的四大类别。在 AI 安全领域,CBRN 是评估前沿 AI 模型最关键的风险维度之一,因为它关系到 AI 是否可能帮助不具备专业知识的人制造或部署这些危险武器。Anthropic 在其 [[R…

2 min read · 2026-05-02#safety#security#weapons
◇ 概念

Child Safety(儿童安全)

概述 儿童安全是 Anthropic 安全工作的核心优先事项之一。Anthropic 参与了由 Thorn 和 All Tech Is Human 领导的"Safety by Design"倡议,致力于防止生成式 AI 被用于创建或传播儿童性虐待材料(AIG CSAM)以及其他形式的儿童性伤害。Claude 的安全防护团队通过多层策略覆盖模型的整个生命周期…

2 min read · 2026-05-02#safety#policy#child-safety
◇ 概念

CKA(中心化核对齐)

CKA(Centered Kernel Alignment)是一种衡量两个神经网络 表征相似度 的度量方法,输出 0 1 之间的相似度分数。CKA = 1 表示表征完全相同,CKA = 0 表示完全独立。 应用场景 模型比较 :不同架构/训练策略的表征差异 训练动态 :训练过程中表征演化 知识蒸馏 :教师 学生模型的表征对齐 模型剪枝 :识别冗余层 在 […

1 min read · 2026-05-04#concept#model#data
◇ 概念

Claude Code

概述 Claude Code 是 Anthropic 推出的智能编程代理(Agentic Coding Agent),代表了 AI 辅助软件开发的新范式。它不仅能在终端中作为命令行工具运行,还可以作为 IDE 扩展使用,让开发者能够用自然语言委托复杂的开发任务。Claude Code 从最初的一个内部工程实验迅速发展成为价值超过 10 亿美元运行收入(AR…

4 min read · 2026-05-14#claude#developer-tools#agentic-coding
◇ 概念

Claude-Code-智能体编码实践

1 1 2 2 title: Claude Code 智能体编码实践 3 3 created: 2026 05 01 4 4 updated: 2026 05 01 5 5 type: concept 6 6 tags: 7 7 tooling 8 8 workflow 9 9 agent 10 10 sources: 11 11 "[[raw/artic…

3 min read · 2026-05-02#model#anthropic
◇ 概念

Computer Use(计算机使用)

概述 Computer Use(计算机使用)是 Anthropic 于 2024 年 10 月推出的一项突破性 AI 能力,允许 Claude 像人类一样操作计算机——通过查看屏幕、移动光标、点击和打字来完成任务。这是一种范式转变:从为特定任务创建专用工具,转向教会 AI 通用的计算机操作技能,使其能够使用为人类设计的各类软件和工具。 该能力随 Claud…

2 min read · 2026-05-02#computer-use#agentic-ai#multimodal
◇ 概念

Constitutional AI(宪法式 AI)

概述 Constitutional AI(CAI,宪法式 AI)是 Anthropic 开发的一种 AI 训练方法,通过使用一组明确的原则(即"宪法")来引导 AI 模型的行为,而非完全依赖人类反馈中的隐含价值观。该方法旨在让 AI 的价值观更加透明、可调整和可扩展。Claude 模型的核心行为准则即通过宪法来定义和训练,宪法经历了从最初的原则列表到详细的…

2 min read · 2026-05-02#alignment#training#safety
◇ 概念

Context Window(上下文窗口)

概述 上下文窗口(Context Window)是大型语言模型能够一次处理的 token 数量上限,决定了模型可以"记住"和利用的信息量。它包括整个对话历史、模型读取的每个文件和每个命令输出。上下文窗口的大小直接影响模型处理长文档、进行复杂分析和维持长对话的能力。Anthropic 从最初 Claude 的 9K tokens 大幅扩展到 200K tok…

2 min read · 2026-05-02#model-capability#performance#token-limits
◇ 概念

CSA(压缩稀疏注意力)

CSA(Compressed Sparse Attention)是 [[DeepSeek]] V4 的压缩稀疏注意力机制,通过稀疏化注意力矩阵降低长上下文推理的计算复杂度。 核心思想 传统注意力机制计算复杂度 O(n^2),在百万 token 上下文下不可承受。CSA 通过稀疏化注意力矩阵,只计算重要的注意力连接。 在 V4 中的作用 与 [[HCA]] …

1 min read · 2026-05-04#concept#architecture#inference
◇ 概念

CXL(计算快速链接)

CXL(Compute Express Link)是一种基于 PCIe 物理层的开放互连标准,支持 CPU/GPU 与内存设备之间的高速缓存一致性连接,扩展可用内存容量。 与 Engram 的关系 [[Engram]] 的条件记忆模块需要存储巨大的嵌入表(1000 亿参数),确定性寻址 + 可预取使其 天然适合 CXL 。 北大、阿里云等团队的实验(arX…

1 min read · 2026-05-04#concept#architecture#inference
◇ 概念

Distillation Attack(蒸馏攻击)

概述 蒸馏攻击(Distillation Attack)是指未经授权的实体通过大规模 API 调用,从前沿 AI 模型中提取能力来训练自己的模型的非法行为。虽然蒸馏本身是一种合法的训练方法(小模型从大模型输出中学习),但恶意使用则允许竞争者以极低的开发成本快速获取能力,同时往往缺乏关键的安全保障。 关键信息 已识别的大规模攻击活动 Anthropic 发现…

2 min read · 2026-05-02#security#attack#intellectual-property
◇ 概念

Election Safeguards(选举安全)

概述 选举安全(Election Safeguards)是 Anthropic 针对 AI 在选举期间可能造成的风险而建立的多层防护体系。目标是确保 Claude 在选举期间提供 准确、公正、平衡 的信息,成为民主进程的正面力量。该体系涵盖政策制定、自动化测试、实时执行和用户引导等多个维度。 关键信息 测试方法论(三阶段迭代) 1. 策略漏洞测试(PVT)…

2 min read · 2026-05-02#safety#policy#elections
◇ 概念

Engram(条件记忆)

Engram 是 [[DeepSeek]] 与北大联合提出的 条件记忆模块 (Conditional Memory),2026年1月12日发表于 arXiv(2601.07372)。核心思想:给 Transformer 加一个原生知识查表模块—— 能查的别算,先查一下 ^[raw/articles/量子位 DeepSeek V4最大的遗憾 2026.md]…

4 min read · 2026-05-04#concept#architecture#optimization
◇ 概念

Extended Thinking(扩展思维)

概述 Extended Thinking(扩展思维)是 Anthropic 在 Claude 模型中实现的一种推理能力,允许模型在回答问题前进行自我反思和逐步推理。它首次随 Claude 3.7 Sonnet 推出,作为"混合推理模型"的核心特性,将快速响应和深度反思能力整合到单一模型中,模拟人类认知过程。该功能在数学、物理、编程和指令遵循等任务上显著提升…

2 min read · 2026-05-02#reasoning#model-capability#performance
◇ 概念

FP4(4位浮点量化)

FP4(4 bit Floating Point)是使用 4 位浮点数表示模型权重的量化格式,大幅减少模型存储和推理内存需求。 在 V4 中的应用 DeepSeek V4 采用 FP4 + FP8 混合精度 : 参数类型 精度 说明 MoE expert 参数 FP4 大量但每次只激活少量 其他参数 FP8 共享层、注意力等 效果:V4 Pro 从理论 3…

1 min read · 2026-05-04#concept#optimization#inference
◇ 概念

Frontier Model Security(前沿模型安全)

概述 前沿模型安全(Frontier Model Security)是指保护最先进 AI 模型免遭盗窃或滥用的安全实践体系。Anthropic 强调,由于前沿 AI 模型能力的快速增长和战略重要性,其安全措施需要超越标准商业实践。这包括物理安全、软件开发安全、访问控制和公私合作等多个层面。 关键信息 三大核心建议 1. 双方控制(Multi Party A…

2 min read · 2026-05-02#security#safety#infrastructure
◇ 概念

HBM(高带宽内存)

HBM(High Bandwidth Memory)是一种 3D 堆叠 DRAM 技术,通过硅中介层与 GPU 直连,提供远超传统 GDDR 的内存带宽(HBM3e 可达 4.8TB/s)。 关键参数 版本 带宽 容量/堆栈 代表 GPU HBM2 1.6 TB/s 8GB V100 HBM2e 3.2 TB/s 16GB A100 HBM3 3.35 T…

1 min read · 2026-05-04#concept#architecture#inference
◇ 概念

HCA(重度压缩注意力)

HCA(Heavily Compressed Attention)是 [[DeepSeek]] V4 的重度压缩注意力机制,通过激进的 KV cache 压缩实现极低内存占用的长上下文推理。 核心思想 KV cache 是长上下文推理的主要内存瓶颈。HCA 通过激进压缩大幅减少 KV cache 体积。 在 V4 中的作用 与 [[CSA]] 组成 V4 …

1 min read · 2026-05-04#concept#architecture#inference
◇ 概念

Hermes Agent 工作流特性

Hermes Agent 是一个功能丰富的多平台 AI 智能体框架,大多数人仅使用了其约 8% 的能力。本文档基于 Sharbel 的总结,介绍 Hermes 的 15 个关键工作流特性。 个性化与记忆 SOUL.md — 灵魂文件 启动时读取的单一文件,定义智能体的语音风格、拒绝条件和目标受众。跨所有会话、平台和后端生效。支持 /personality …

5 min read · 2026-05-06#agent#tooling#workflow
◇ 概念

HTML Artifacts(HTML 工件)

HTML Artifacts 指由 [[Claude Code]] 或其他智能体生成的单文件/轻量网页式交付物:它们不是传统网站,而是用于阅读、对比、解释、调参、原型验证或分享的临时界面。Thariq 的核心判断是:当智能体已经能生产复杂计划、报告和设计探索时,Markdown 作为默认输出格式会限制信息密度与可读性,而 HTML 能把文本、表格、SVG、…

3 min read · 2026-05-14#concept#workflow#productivity
◇ 概念

Jailbreak(越狱攻击)

概述 越狱攻击(Jailbreak)是指绕过 AI 系统内置安全措施和道德准则的方法,使用户能够获取通常被限制或禁止的响应或行为。其中, 通用越狱 (Universal Jailbreak)是一种更为严重的漏洞类型,允许用户在广泛的主题上持续绕过安全措施。越狱攻击是 AI 安全领域最核心的威胁之一,直接影响 [[CBRN]] 和网络安全等高风险领域,也是 …

2 min read · 2026-05-02#security#attack#safety
◇ 概念

Kanban 多智能体协调

Kanban 多智能体协调是 [[Nous Research]] 在 Hermes Agent v0.12.0 中引入的多 Agent 编排系统。核心理念是: 多个 AI Agent 通过共享看板认领任务、并行工作、结构化交接 ,人类通过 Dashboard 监控全局进度。 系统架构 核心能力 1. 多 Agent 任务认领 不同 Agent Profil…

3 min read · 2026-05-04#agent#workflow#coordination
◇ 概念

LogitLens(对数透镜)

LogitLens 是一种 LLM 可解释性技术 ,通过将中间层激活向量投影到词表空间,观察模型在每一层的"预测猜测"。 核心原理 对 Transformer 第 k 层隐藏状态,通过 LM Head 投影得到该层的预测分布。这让我们看到模型在每一层"认为"下一个 token 是什么。 典型发现 浅层:模型还在"纠结"实体歧义 中间层:逐步消歧 深层:最终…

1 min read · 2026-05-04#concept#model#data
◇ 概念

MCP(Model Context Protocol)

概述 模型上下文协议(Model Context Protocol,MCP)是 Anthropic 于 2024 年 11 月开源推出的一项开放标准,旨在为 AI 助手与外部数据源之间建立统一的连接方式。MCP 解决了 AI 模型因信息孤岛和遗留系统导致的数据隔离问题,用单一协议替代碎片化的集成方式,使 AI 系统能够更简单、更可靠地获取所需数据。 202…

3 min read · 2026-05-07#mcp#protocol#open-standard
◇ 概念

mHC(流形约束超连接)

mHC(Manifold Constrained Hyper Connections)是 [[DeepSeek]] V4 的核心架构创新之一,将残差连接中的混合矩阵约束到特定流形(Birkhoff 多面体,即双随机矩阵)上,增强深层 Transformer 的信号传播稳定性。 核心动机 传统 Transformer 使用简单的残差连接将信息从浅层传递到深层…

1 min read · 2026-05-04#concept#architecture#training
◇ 概念

Minimal Perfect Hash Function(最小完美哈希函数)

MPHF 是将 N 个已知键映射到 N 个连续整数(0 到 N 1)的哈希函数, 无冲突且无空隙 ,查找复杂度 O(1)。仅适用于静态键集。 与 Engram 的关系 TaoLin 的研究(arXiv: 2601.16531)验证了在 [[Engram]] 中使用 MPHF 消除哈希冲突是否能提升性能: 设计了 Engram Nine:无冲突「热层」+ 多…

1 min read · 2026-05-04#concept#data#optimization
◇ 概念

MoE(混合专家)

MoE(Mixture of Experts,混合专家)是一种将 计算稀疏化 的模型架构:只激活一部分专家网络处理每个 token,而非让全部参数参与计算。 核心原理 模型包含多个"专家"子网络 门控机制(Router)根据输入决定激活哪些专家 每个 token 只激活少量专家,实现 稀疏计算 ,降低每 token 的计算成本 与 Engram 的关系 […

1 min read · 2026-05-04#concept#architecture#training
◇ 概念

Muon 优化器

Muon 是 [[DeepSeek]] V4 采用的训练优化器,基于矩阵正交化,通过 Newton Schulz 迭代对梯度更新进行谱范数约束,实现约 2x 于 AdamW 的计算效率。 核心原理 1. 对梯度矩阵进行 Newton Schulz 迭代 ,近似计算矩阵的正交分解 2. 通过谱范数约束,保证每步更新的方向性质量 3. 仅需约 52% 的训练 …

1 min read · 2026-05-04#concept#training#optimization
◇ 概念

N-gram(N元语法)

N gram 是基于前 N 1 个 token 预测下一个 token 的经典统计语言模型,是现代神经语言模型的前身。 核心原理 Bigram (N=2):基于前 1 个 token 预测 Trigram (N=3):基于前 2 个 token 预测 查找复杂度 O(1),但需要巨大的 N gram 表 与 Engram 的关系 [[Engram]] 的名…

1 min read · 2026-05-04#concept#model#data
◇ 概念

Prompt Engineering(提示工程)

概述 提示工程(Prompt Engineering)是设计和优化输入提示以获得 AI 模型最佳输出的技术和实践。有效的提示工程可以优化 Claude 的输出质量、降低部署成本,并确保一致的品牌体验。Anthropic 将其视为一种科学方法,强调测试和迭代,并建议将提示工程视为提示工程师与领域专家之间的协作工作。在长上下文场景中,提示工程的技巧对于提升信息…

3 min read · 2026-05-03#technique#optimization#business
◇ 概念

Prompt Injection(提示注入)

概述 提示注入(Prompt Injection)是一种针对 AI 系统的攻击技术,攻击者通过嵌入隐藏指令或误导性内容,诱使 AI 代理忽略其原始指令、泄露数据或执行非预期行为。随着 AI 代理(如 [[Claude Code]]、[[Computer Use]])的自主性增强,提示注入已成为 AI 安全领域最关键的威胁之一。 关键信息 攻击类型与发现 通…

2 min read · 2026-05-02#security#attack#agents
◇ 概念

Red Teaming(红队测试)

概述 红队测试(Red Teaming)是对技术系统进行对抗性测试以识别漏洞的方法。在 AI 安全领域,红队测试是评估前沿 AI 模型潜在风险和危险能力的核心手段,也是 [[Responsible Scaling Policy 负责任扩展政策(RSP)]] 的关键实施环节之一。 Anthropic 建立了专门的前沿红队(Frontier Red Team)…

3 min read · 2026-05-02#red-teaming#safety#adversarial-testing
◇ 概念

Responsible Scaling Policy(负责任扩展政策)

概述 负责任扩展政策(Responsible Scaling Policy,RSP)是 Anthropic 制定的一套技术和组织协议框架,用于管理日益强大的 AI 系统带来的灾难性风险。该政策于 2023 年首次发布,此后经历了多次迭代(截至 2026 年 2 月已更新至 v3.0),是 AI 安全治理领域的重要创新。 RSP 的核心机制是使用条件性("如…

3 min read · 2026-05-02#safety#governance#responsible-ai
◇ 概念

SGLang

SGLang(Structured Generation Language)是由 LMSYS 主持的高性能 LLM 推理框架,支持 RadixAttention、连续批处理、投机解码等优化。 核心特性 RadixAttention :基于基数树的 KV cache 共享 连续批处理 :动态调度,最大化 GPU 利用率 投机解码 :小模型草稿加速大模型推理 …

1 min read · 2026-05-04#concept#tool#inference
◇ 概念

SWE-bench

概述 SWE bench 是一个用于评估 AI 模型真实世界软件工程能力的基准测试,特别聚焦于解决实际的 GitHub issue。SWE bench Verified 是经过人工验证的子集,确保测试问题的质量和准确性。它是衡量 AI 编码能力最受关注的基准之一,直接反映了模型在现实软件开发场景中的表现。Claude 系列模型在该基准上持续取得领先成绩,展…

2 min read · 2026-05-02#benchmark#evaluation#coding
◇ 概念

Tailscale 直连排障

Tailscale 远程访问延迟高时,第一判断不是“能不能连上”,而是连接路径是 direct 还是 relay 。 direct 表示设备之间通过 NAT 打洞形成直连路径; relay 表示流量经过中继服务器,延迟会随中继位置和链路质量明显升高。 核心排障顺序 1. 用 tailscale status 判断目标设备是否显示 relay 。 2. 用 …

1 min read · 2026-05-09#concept#tool#workflow
◇ 概念

Third-Party Testing(第三方测试)

概述 第三方测试(Third Party Testing)是 Anthropic 倡导的 AI 政策核心要素,主张建立独立于 AI 开发者的测试和监督体系,以验证前沿 AI 系统的安全性、建立信任并补充行业特定规则。Anthropic 认为自我治理(如 [[Responsible Scaling Policy]])最终需要由广泛信任的第三方来验证和补充。 …

2 min read · 2026-05-02#testing#governance#policy
◇ 概念

Usage Policy(使用政策)

概述 Usage Policy(使用政策)是 Anthropic 制定的框架,定义了 Claude 应该如何以及不应该被使用,为所有使用 Anthropic 产品的用户提供明确指导。该政策随 AI 能力发展和监管环境变化而持续演进,涵盖选举完整性、儿童安全、网络安全、高风险用例等多个领域。 关键信息 政策演进时间线 2024年5月 :从"Acceptabl…

2 min read · 2026-05-02#policy#governance#safety
◇ 概念

Vibe-Coding

Vibe Coding(氛围编程)是指开发者完全沉浸于氛围、拥抱 AI 能力指数级增长、彻底忘记代码存在的编程方式。这一概念由 Andrej Karpathy 提出,[[Anthropic Anthropic]] 研究员 Erik Schluntz 分享了如何在生产环境中负责任地实践这一理念。 核心定义 "完全沉浸于氛围,拥抱技术发展的指数级增长,并且彻底…

2 min read · 2026-05-02#model#anthropic