智能体经常去攻击不是预先指定的那些漏洞。GPT-5.5总共拿下210面flag,其中只有120面打的是指定目标;Claude Mythos Preview拿下226面,命中指定目标的157面。 ExploitGym论文里的一条完整利用轨迹。GPT-5.4从一个只在调试版才崩的V8漏洞起步,71分钟、447条命令、229行代码,最后拿到flag,成本15.80美元。
AI时代,企业最大的挑战已经不是拥有先进模型,而是能否改变自己。思科、IBM、安永等企业发现,AI落地的真正瓶颈来自组织惯性、变革管理、战略模糊和决策迟缓。AI带来的价值并非简单提升效率,而是重塑业务流程、工作方式和竞争模式。 随着AI技术的飞速发展 ...
就在今天,GPT-5.6 Pro证伪了图论领域三十年猜想——Dinitz-Garg-Goemans。 30年图论「悬案」,一夜崩塌。 就在今天,GPT-5.6 Pro证伪了图论领域三十年猜想——Dinitz-Garg-Goemans。
Datadog 近期发布的《2026 年人工智能工程现状报告》引发了业内广泛讨论。这份基于 1000 + 生产环境真实遥测数据的报告,被公认为目前最全面的 AI 生产应用分析。 但作为一名关注系统可靠性与安全的 ...
这一天,整个数学圈震撼了。一个让无数顶尖数学家折戟,让华人天才数学家张益唐苦熬七年、被迫在赛百味洗盘子的超级数学难题——雅可比猜想,被Fable 5证伪! 这一天,整个数学圈震撼了。
微软当地时间 7 月 23 日宣布推出两款新的自研 AI 模型,分别为 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,目前均已进入公开预览阶段。两款模型属于微软 AI 团队自研模型系列,分别面向高质量图像生成与高并发语音交互场景。 7 月 24 日消息,微软当地时间 7 月 23 日宣布推出两款新的自研 AI 模型,分别为 MAI-Image-2.5-Pro 和 MA ...
限制Token看起来像是一种负责任的管理手段,但这就像关掉一台有杂音的收音机,而不是去调准电台频道。在2026年削减AI预算的公司会在2027年发现,他们把那些高效协同的工作流与无效的工作流一并砍掉了。
过去一年,大模型已经逐渐进入金融研究的日常工作流:它可以总结新闻、解释财报、回答股票问题,甚至生成一份结构完整的分析报告。但当这些能力逐渐成为 “标配” 之后,一个更现实的问题开始浮现 —— 金融 AI 的下一步,究竟应该走向哪里?
来自清华大学和腾讯混元团队的研究者提出了TRACE(Tree Rollout Allocation for Contrastive Exploration),一个面向Agentic RLVR的统一rollout预算分配框架。 大模型做强化学习后训练,最容易被低估的成本是什么 ...
量子信息领域一道悬了 25 年的难题,还是在同一天出现了两份独立证明!一份由 GPT-5.6 Sol 生成,时间戳定格在 UTC 11:23; 7 月 23 日,量子信息领域一道悬了 25 年的难题,还是在同一天出现了两 ...
结果让人哭笑不得——模型能认出这个人是谁,也说得出来他拿过金牌,但给出来的答案却是他现在的纪录,而不是“之前”的。同理,“第25届奥运会期间布达佩斯的市长是谁?”这种带时间窗口约束的问题,Google和ChatGPT都翻了车。
据 Axios 报道,特朗普政府内部正在重新讨论,是否应加强对中国开放模型的管控。 Kimi K3 发布不到一周,就已成为美国政府的「眼中钉」。 据 Axios 报道,特朗普政府内部正在重新讨论,是否应加强对中国开放模型的管控。 此前,美国商务部曾考虑将多家中国实验室列入「实体清单」,美国国家安全局和白宫国家网络主任办公室也讨论过发布安全警告,劝阻美国企业使用中国模型。 不过,这些尝试最终因内部的 ...