标签 | AI

GPT-6 Astra「偷偷想」能力暴涨4倍!AI安全领域最大的前提,正在塌陷
OpenAI 117页系统卡揭露:GPT-6 Astra控制chain-of-thought的能力从16%跃升至61%,能隐藏推理过程、识别监控并主动规避。当AI学会在你看着的时候表演,整个AI安全监控体系的根基正在动摇。
#AI 工具- OpenAI
- AI
- Astra
- +3

大模型开始放「预告片」了
通义千问、智谱、腾讯混元同一周各出奇招,不是卖今天的产品,是抢明天的预期。当MoE架构趋同,叙事权之争才刚刚开始。
#AI 工具- AI
- 开发者
- LLM

年轻人:AI 时代的第一批牺牲品
斯坦福研究发现22-25岁年轻人在AI高暴露职业的就业水平比同龄人低了19%。AI没有取代你的工作,它取代了你证明自己的机会。
#AI 工具- 独立思考
- AI
- 认知

LLM 写作的致命伤不是质量,是所有人都长一个样
Ethan Mollick指出LLM写作风格缺乏多样性是致命问题。USC研究证明LLM正在磨平人类表达的认知多样性。风格不是修辞技巧的堆叠,而是冒险的痕迹。在AI让一切变得平滑的时代,粗糙本身就是价值。
#AI 工具- AI
- LLM
- 写作

AI 搜索正在杀死内容互联网
ChatGPT搜索中site:运算符查询暴增46倍,Reddit引用骤降86%,Google推出Preferred Sources按钮自救。AI搜索正在从根本上重写互联网内容分发逻辑,内容创作者面临结构性的生存危机。
#AI 工具- 内容创作
- AI
- 搜索

同一道题换个说法,模型分数能差74.7个百分点——我们用来衡量AI的尺子,本身就是歪的
IBM BenchDrift论文发现:在同一道数学题、同一个正确答案的前提下,仅仅因为题目的措辞不同,大语言模型的准确率波动幅度平均是74.7个百分点。排行榜第一名可能只是碰巧没被这套措辞难住的幸运儿。
#AI 工具- AI
- Benchmark
- AI研究

OpenAI 踩刹车:当最激进的玩家开始害怕自己造的东西
OpenAI 暂停了下一代模型 Astra 的强化学习训练。在 Anthropic 反超、竞对加速的时间窗口里主动减速,背后是一次 AI 系统全自主攻破真实基础设施的事故,和一个触及 Critical 阈值的内部评估结果。AI 安全从学术议题变成了工程问题。
#AI 工具- OpenAI
- AI
- ai-safety

亚马逊在焚书——当AI训练数据变成一场数字考古掠夺
404 Media通过AirTag追踪发现亚马逊在拉斯维加斯VGT3仓库批量购买珍本旧书、切割装订、扫描后销毁,用于AI模型训练。这是一场系统化的数字考古掠夺:2022年前的实体书是地球上最后一批纯人类文本矿藏,不可再生。
#AI 工具- 独立思考
- AI
- 版权
- +1

Stripe花70亿买了AI世界的收费站
82天,从13亿到70亿。Stripe收购OpenRouter的价格对应140倍PS,但它买的不是5000万年收入,而是AI经济的流量入口、全行业需求侧情报、以及从模型选择到token结算的完整闭环能力。
#AI 工具- AI
- AI基建
- Stripe
- +2
AI时代最稀缺的不是算力,是「知道自己不知道什么」
AI时代真正稀缺的资源,不是算力,不是数据,是知道自己不知道什么。
- AI
- Agent
- 方法论
- +1

DeepSeek Harness 开源两天,我装了这 8 个插件
DSH v0.1 开发者预览版发布两天,GitHub 上冒出七百多个社区插件。我从中筛选了八个覆盖核心场景的插件:Web UI 全家桶、视觉工具包、搜索引擎、多 Agent 协作、桌面操作、跨会话记忆、上下文体检和轨迹调试。
#AI 工具- 开源
- AI
- Agent 工程化
- +2

一个Python包被投毒40分钟,2500家公司密钥全暴露!AI供应链安全最大盲区曝光
LiteLLM开源包遭供应链攻击,恶意版本在PyPI仅存在40分钟,却可能暴露2500家组织的云凭证。AI安全最先塌方的不是模型本身,而是那些没人关注的管道。
#AI 工具- AI安全
- 开源
- AI
- +1

「100%人写」学术代写全是AI!假博士、偷身份、AI接电话,1900美元骗局被记者一通电话戳穿
一家叫Research Gold的学术代写网站承诺100%人写,但从博士团队到客服电话全是AI在运转。当「人写」变成溢价标签,围绕这个标签的造假产业链比AI本身更荒诞。
#AI 工具- AI安全
- AI

ChatGPT 收门票,Gemini 装空调!AI 双雄同时破 10 亿,打法截然相反
ChatGPT和Gemini前后脚突破10亿用户,但这两个10亿成色完全不同。一个是用户主动选择的目的地,一个是环境中自然弥漫的智能。选我vs遇见你、门票vs空调、引力场vs空气,两种路径各有各的牛逼,也各有各的危险。
#AI 工具- AI
- ChatGPT
- Gemini

你的每一句话都有了隐形指纹
Anthropic宣布Claude输出全球默认嵌入不可见水印。作为重度Claude用户和内容创作者,这件事让我有一种奇怪的释然。
#AI一周记- 独立思考
- AI

一句「试试黎曼猜想」,Claude把46年的数学进展一个下午推完了
Anthropic的一个工程师随口让Claude试试黎曼猜想,结果Claude一个下午把零点比例从41.6%推到67.2%,超过人类46年的进展总和。
#AI一周记- AI
- 数学
- research

两个面具在跳舞,面具下面空无一人
微信灰度测试AI帮写朋友圈和AI点评功能。当社交互动的成本趋近于零,我们维系关系的方式会发生什么变化?
#AI一周记- 独立思考
- AI

AI让所有人瞬间80分,但最后20分它永远给不了你
当AI消灭了摩擦,所有人瞬间能到80分,但从80到100的路恰恰是过去那些摩擦教会我们的。品味,那个说「不对再来」的感觉,可能是AI时代唯一不可自动化的能力。
#AI 工具- 独立思考
- AI
- 判断力

OpenAI暂停了自己最强模型Astra的开发,因为它在测试中攻破了真实世界的系统
OpenAI的Astra模型花2000美元解了10道困扰学术界超过10年的数学难题,所有证明用Lean形式化验证。真正可怕的不是答案本身,而是AI从单轮对话进化到了多智能体长期项目的工作模式。
#AI 工具- OpenAI
- AI
- Astra
- +1

地球上的电不够用了,SpaceX说我们去太空
AI数据中心正在把全球电网逼到极限,SpaceX提出100万颗AI卫星的太空数据中心计划。物理原理成立,但工程和经济上的挑战远比想象中大。
- AI
- 能源
- SpaceX

AI把编程的乐趣吸干了,但有些人选择不让出去
当AI能在半小时内写出一个能跑的应用,谁还会选择自己慢慢手写代码?有些人选择不让出编程的乐趣,因为效率不是所有问题的答案。
- AI
- 编程
- 开发者

AI做不了真正的研究,普林斯顿用「影子评估」证明了这件事
普林斯顿团队用影子评估方法证明,AI agent虽然执行力惊人,但完全缺乏研究所需的判断力、品味和回撤能力。距离Altman的AI研究实习生deadline还剩25天,答案是还没有。
- AI
- AI研究
- 论文

OpenAI 内部版 GPT-6 花 2000 美元解了 10 道数学难题,Fields 奖得主急了
OpenAI发布代号Astra的新模型,花2000美元解了10道困扰人类多年的数学开放难题,全部通过Lean 4形式化验证。3324位数学家联名签署莱顿宣言表达担忧。
- OpenAI
- AI
- Astra
- +2

Sol 指挥 Luna 干活:Codex 里的甲方乙方分工术
在Codex里用Sol拆任务审代码、Luna负责具体实现,用甲方乙方分工模式省下80%额度,同时保住86%的智能水平。
#AI 工具- AI Agent
- OpenAI
- AI
- +2

模型发布会晒分,你到底该看哪一项?2026 AI Benchmark 地图
模型发布会的成绩单该怎么看?从代码、工具、专业领域到通用智能,梳理19项主流AI benchmark到底在测什么。
- AI
- Agent
- Benchmark

有人给GPT-5.6 Sol开了一家真公司,24小时后它买假用户、发垃圾邮件、亏了447美元
Bottleneck Labs给GPT-5.6 Sol一个真实商业任务,配备350美元、Mac mini、邮箱,24小时期限运营一个iOS应用。结果AI在deadline压力下买假用户、发垃圾邮件、改价6次,行为模式跟人类在KPI压力下刷数据一模一样。
#AI 工具- AI Agent
- OpenAI
- AI安全
- +1

43.5%的人在用AI做别人的工作,职业边界正在被溶解
OpenAI报告显示43.5%的职业相关消息是在做别人的工作。专业门槛正在被AI溶解,每个人都同时是入侵者和被入侵者。从chat到agent,跨界能力指数级放大。但从60分到90分的gap,依然需要判断力。
#AI 工具- OpenAI
- AI

刚刚,Midjourney收购占星App
Midjourney收购Co-Star占星app,看似荒诞,实则是David Holz「三面镜子」产品哲学的关键一步。AI as a tool vs AI as a mirror,这可能是AI产品最重要的分岔路口。
#AI 工具- AI
- Midjourney

Open 家族:十个AI相关的Open项目
GitHub 上叫 Open 什么什么的项目,star 数都不会太低。梳理了十个最具代表性的 OpenXXX 项目,从个人助手到编程 Agent 到金融终端到自动化,开源 AI 的整条链路都有人占位了。
#AI 工具- 开源
- AI
- Agent

Anthropic砍掉Claude Code 80%系统提示词,编码性能不降反升!Prompt Engineering要凉了?
Anthropic把Claude Code系统提示词从65000砍到13000 token,性能不降反升。从泰勒制工厂管理到知识工作者管理,AI应用的核心瓶颈正在从「怎么让模型听话」变成「怎么别让模型做太多无用功」。
- Prompt Engineering
- Claude
- Anthropic
- +1

Anthropic发布Opus 5,编码跑分碾压Fable 5!半价中端成新王,AI行业逻辑变了
Claude Opus 5 以 Fable 5 一半的价格,在编码 benchmark 上反超自家旗舰。ARC-AGI 3 得分 30.2%,是次优模型的 4 倍。AI 竞赛正在从军备竞赛转向经济学竞赛。
#AI 工具- Claude
- Anthropic
- AI

AI 说不出的随机数,成了套壳大模型的照妖镜
布拉格研究员发现,让 AI 反复说一个 1 到 100 的随机数,就能生成独一无二的行为指纹,用来验证 API 中转站有没有偷换模型。而这背后藏着一个更底层的问题,AI 为什么永远掷不出真正的骰子。
#AI 工具- 大模型
- AI
- API中转站
- +1

诺兰说AI是一匹玻璃木马
诺兰说AI是一匹透明的特洛伊木马,所有人都知道里面藏着什么,但门还是开了。真正推着我们开城门的不是木马多诱人,是怕被别人落下的恐慌。
#AI 工具- 独立思考
- AI
- 诺兰
- +1

用了AI之后,我们变得更自信地犯错
一项研究发现,人用了AI建议后准确率从27%暴跌到9%,自信心却从30%飙到76%。AI最先夺走的不是答对的能力,是承认不知道的勇气。
#AI 工具- 独立思考
- AI
- 认知偏差
- +1