最新文章
在 AWS EC2 上开一台 Ubuntu,剩下的交给 Claude Code:SSH 配置、安装 sing-box、挑 Reality 伪装域名、开 BBR、写 Clash Verge 配置、配 fail2ban、再加一个 Hysteria2 节点。本文是视频的图文版,按步骤给出每一步对 Agent 说的话、它实际做了什么,以及途中踩到的两个坑:新版 Ubuntu 上 fail2ban 抓不到 SSH 失败日志、AWS 安全组没放行 UDP。
Opus 5.5 在自主长任务、主动汇报和前置思考上带来了显著变化。本文整理自 Anthropic 官方指南,系统拆解如何在 Claude 应用与 Claude Code 中写好提示词、把控数小时级别的长链路任务、高效验收结果、应对安全防护拦截以及开启 Fast 极速模式,文末附带完整的行动检查清单与原文链接。
“某模型全球第一”的说法越来越常见,但换一个排行榜,名次常常完全不同。这篇文章梳理了 Benchmark 失真的三个常见原因——测试集污染、benchmaxxing、厂商选择性公布成绩,以及 Arena 类平台、综合指数各自的局限,最后给出一份普通人也能直接用的判断清单。
视频是怎么变成 AI 能处理的 Token 的?这篇文章核实了 DeepSeek、Claude、OpenAI、Gemini 对视频输入的真实支持情况——目前只有 Google 把直接输入视频做成了公开 API 能力,2026 年 9 月还上线了能主动导航视频、最高省下 88% Token 的新模式,其余三家不同程度上仍在靠人工抽帧当图片处理。
一张图片是怎么变成 AI 能处理的 Token 的?这篇文章核实了 DeepSeek、Claude、OpenAI(GPT-5.6)、Gemini 各自的图片 Token 化公式——算法路线完全不同,但落到实际 Token 开销上,四家其实都在同一个量级。
AI Engineering 不只是实现产品,更意味着主动塑造构建过程:推动开发循环、做出产品决策、沟通与领导,并以高主动性端到端承担责任。
从第一性原理讲清 LLM 技术栈里都被叫做「缓存」的四层机制:KV 缓存、前缀缓存、Prompt 缓存和语义缓存。它们各自存什么、如何取舍、相互作用时会发生什么,以及最影响缓存复用的五个常见问题。
本文介绍 DeepSeek Harness 的核心理念与功能,并从零完成安装配置,实践 Coding、Web Search、Vision 以及第三方模型接入。
系统梳理 2026 年 AI 模型发布中常见的测试平台与 Benchmark:LMArena、Artificial Analysis、LiveBench、SWE-bench、GPQA、HLE、AIME、MMLU、MMMU 等各自测什么、分数怎么读、又不能说明什么。
从 IPv6 反向 DNS 出发,拆解 ip6.arpa 的 nibble 命名方式、前缀与命名空间的对应关系、DNS 委派机制,以及为什么它不适合当普通网站域名。