105 篇 · 第 21–40 篇
2026 年 8 月 6 日,DeepSeek 在官方 API 价格页的脚注里写下一句话:计划近期整体上调定价,预计涨幅较大。别家都在降价,它反手涨价。这篇讲清这句话背后的账,以及它对你的实际用量意味着什么。
「219 倍市盈率」把几十万人吵翻了,也把大多数人绕晕了。这篇不替谁回答贵不贵,先说清一件更前置的事:同一家公司、同一天、同一个发行价,换一个同样合规的算法,这个倍数直接砍掉一半还多。
8 月 6 日,斯坦福与 Arc Institute 在《Science》发表论文,用 AI 设计噬菌体基因组,16 个在实验室里活了;随后热搜变成「美国科学家首次用 AI 设计出病毒」。这篇把论文实际做成的部分和被夸大的部分分开讲。
转全栈是短期解,会写 Loop 才是长期解。能被穷举成默认值的东西都会被产品吃掉,技能清单、harness 与提示词都已被吃掉。护城河是搭一套自己干、自己验、出错自己重来的循环,验收标准由你定义。配官方实践与作者通宵实测说明 Loop 的写法与死法。
LoopX 让 AI Agent 稳定跑 200 小时是真的,但 200+ 小时是跨多天的墙钟时长,不是连轴转。LoopX 是个人开源项目,用状态内核管住目标、待办、证据、预算,靠人在环上兜底,是 loop engineering 的工程化。对照 AI 长跑常见的目标漂移、证据过期、预算无底洞三个死法,控制平面是 Agent 工程下一波地基话题。
GPT-5.6 降价最高 80%(Luna 输入从每百万 token 1 美元降到 0.2 美元),OpenAI 将部分成本下降归因于模型自己重写优化推理内核,是「芯片降价、厂商让利」之外的第三条路。20% 降本、15% 效率提升只有官方口径,无法外部验证。
腾讯砍职级、字节改绩效、京东减两级,同月几家大厂压缩中层。真正被拿掉的是「传话」这个功能:AI 把信息传递、汇总、对齐的边际成本压到接近零,拍板担事的判断型中层反而被压上更多权限。拆解四家做法差异、扁平化放大的出错代价,并给中层留了一个自测问题。
给 AI 接工具,考题从「能不能连上」变「会不会出事」。Anthropic 红队测 25 次注入,24 次送出云服务器密钥;博客复盘弹窗与沙箱漏洞,外部研究演示工具描述下毒、一钥跨系统捞数据。MCP 无状态化改版解决部署、未解决安全,给出接入前要确认的六件事。
通用 Agent 正在吃垂类应用,但巨头把边界写在产品页上:OpenAI Presence 限量交付须现场配合,Anthropic 金融模板把数据与人工审阅留在回路里。能被写进产品文档的那层正被收编,法律与医疗的护城河在编码规则,最后给出下场前要答的四个问题。
微软 RD-Agent 用两个 AI 角色自动挖量化因子:自己提假设、写代码、跑回测,12 小时跑完一轮,模型调用费不到 10 美元,论文被 NeurIPS 2025 接收。但论文里一个细节几乎没人提:同一份 test 集在循环里被反复读四遍,选出的公式更像被同一份考卷反复筛出来的结果。年化 14.21% 与 IC 0.0532 也别焊在一起,10 美元账单只算了 Token,不含四块 A6000 的硬件成本。
月之暗面把 Kimi K3 完整权重推上 HuggingFace,96 个分片共约 1.56 TB,两小时四分钟内推理 API 服务商就位;但社区想在自己机器上跑却处处碰壁:1.5 bit 量化版在 llama.cpp 上加载不了,REAP 剪枝版塞进 512 GB 的 M3 Ultra 只有 0.16 token/秒且不可交互。官方配置 vLLM 八卡起步、生产推荐 64 加速器,开放权重真正服务的是云厂商与研究机构。
Claude 官方把 Claude Code 系统提示词删掉 80%,编程评测零损失——「规则写满、反例列全、重要的事说三遍」那套手艺被官方产品当场证伪大半。文章讲清提示词与上下文的区别,逐条划掉六条过时做法(给规则→给判断、给例子→设计接口、全塞前面→渐进披露),并给出系统提示词、CLAUDE.md、Skills、参考文件的写法:保持轻、按需加载,规则文件要有定期删除机制。
你缺的不是更多 AI 助手,是一个帮你跟平台打交道的 Agent。生活服务 App 里的 AI 助手工资是平台发的——推高佣金商品、把退订藏进浅灰小字,这是委托代理问题的现实版。你需要数据和权限留在自己手里的本地 Agent,替你去跨平台比价、走完退订路径。技术门槛已降(端侧小模型),难的是利益——巨头正把未经许可的 Agent 读数据写进违规条款。
Agent Loop 还没搞明白,Graph 又来了。这篇把两条路线一次讲清:Graph 是给 AI 干活画一张流程图,节点干活、边指路,带检查点存档和人工审核关口;Loop 灵活但过程是黑箱、错误滚雪球、出事难追账,企业不敢放权。结合 OpenAI 关停拖拽画布、LangGraph 持续更新,给出选择口径:探索型小活用 Loop,花钱、对外、要查账的活上 Graph,或至少给 Loop 加道关卡。
AI都能写代码了,《人月神话》该进博物馆吗?作者的答案:布鲁克斯50年前的定律没被推翻,反而被放大——AI压掉的只是样板代码这类偶然复杂性,本质复杂性(造什么、边界画在哪)换什么工具都绕不开;把「人」换成「AI助手」,协调成本只是换了战场,还多出「智能体焦油坑」。一个人干活省下的是打字时间,判断那道关还得自己站住。
北京密云副局长自购大模型年费两百多元,花一个月手搓防汛小程序「叫应」,摊到项目约30元、10亿token,顶掉过去几十号人通宵打电话对台账的活。作者借此重估AI成本:做事最小单位从部门缩成一个人,会写代码快速贬值,稀缺的是知道拿工具解决哪个真问题。
复旦肖仰华教授的数据挖掘课期末考把规则反过来:51 名学生出 510 道题考三款大模型,AI 答错越多分越高,50 人让至少一款模型翻了车。AI 能答大多数题之后,稀缺能力从给答案变成验答案,知道 AI 在哪里会答错才是真的懂它。
Andrej Karpathy——OpenAI 创始成员、「vibe coding」造词人——公开泼冷水:Agent 要靠谱地用起来得爬十年的坡,不是行业喊的「一年之内」。他用乘法解释 demo 与产品的鸿沟:每步两成错误,五步任务只剩三成出头成功。他自己半年没手写代码,却主张「agentic engineering」把 AI 当实习生使唤、盯着验收,并提醒:你可以外包思考,但没法外包理解。
阿里达摩院等机构的 AI 系统 ElementsClaw,用 28 个 GPU 小时从约 6.8 万种材料筛出超导候选,其中 4 种新超导材料被实验室合成验证,但临界温度仅约 6.5K,离常温超导仍远。本文讲清 AI 进科研的真实边界:AI 筛候选、人做合成验证,并给出分辨「真进展」与「PR 话术」的三把尺子。
一种叫「代理劫持」的攻击正影响 Claude Code、Cursor 这类 AI 编程助手:黑客把伪造指令塞进 Sentry 报错里,AI 排查线上问题时把陌生人的纸条当成你的命令照办。全程没有越权、没有密码泄露,安全软件一声不吭,Sentry 官方也承认接收层技术上防不了。作者给出四条防线:最小权限、白名单管住 MCP 连接、高危动作人工确认、把 AI 当不可信输入源。