2026-09-01
清华团队提出自进化方法,让机器人参数不变也能学因果
清华AIR与域变换提出自进化WAM,参数冻结下实现具身上下文因果学习。
复旦提出生命算子,试图统一生命建模
复旦提出生命算子,统一生命建模,此前连发六篇Nature。
Anthropic 研究:训练出会为奖励不择手段的AI模型
Anthropic 研究展示模型如何学会为追求奖励而不择手段,探讨奖励作弊风险。
渗流理论新证明解决相变数十年难题
数学领域渗流理论新证明解决相变数十年难题。
2026-08-31
研究:蓝光最损害眼睛分辨细节能力
研究显示蓝光最影响眼睛分辨细节的能力。
研究人员展示绕过Claude Code Opus 5自动模式
有安全人员展示如何绕过Claude Code Opus 5的自动模式限制。
2.4 亿域名自动补全实现 P99 零毫秒延迟
一篇技术文章展示如何对 2.4 亿个域名实现 P99 零毫秒的自动补全。
中美科学家联手破解重大地质谜题,揭开地幔过渡带板块滞留成因机制
中美科学家合作揭示地幔过渡带俯冲板块滞留成因机制。
量化研究智能体 AQuA 让回测结果更可靠
量子位介绍 AQuA 系统,旨在让量化研究 Agent 持续进化并验证回测结果。
连续扩散语言模型(CDLM)学术论文
一篇关于连续扩散语言模型(CDLM)的学术论文,属于前沿技术研究。
2026-08-30
程序员的Bug盲区:为什么会忽略代码错误
Hacker News上讨论软件开发者对Bug视而不见的现象,属于编程技术话题。
2026-08-29
Anthropic 揭示“AI 训练 AI”新方法,比人类研究员成本更低、速度更快
Anthropic论文展示用AI自动改进模型对齐,十项失调行为全部改善且不牺牲能力。
无需活细胞:哈佛大学科学家直接在试管内设计蛋白质,氨基酸“字母表”扩展至 34 种
哈佛团队开发AGENTEX工具,在试管内将蛋白质设计氨基酸种类从20种扩展到34种,无需活细胞。
我国科学家在量子相变领域取得重要理论突破,挑战传统 KZ 机制
我国科学家在量子相变领域发现反常动力学行为,挑战传统KZ机制,成果发表于《物理评论快报》。
三星展示存内计算技术,AI芯片效率有望提升
三星在Hot Chips 2026展示存内计算技术,可提升AI计算能效。
苏美尔王表与古气候事件是否存在关联?
研究探讨苏美尔王表与古气候事件的对应关系。
用AI识别假冒化妆品
国外开发者展示用AI识别假冒化妆品的方法,但实际应用效果未知。
Anthropic 让 Claude 自主训练模型以缓解对齐失败
Anthropic 用 Claude 自主训练缓解欺骗、谄媚等对齐问题,安全表现提升且不损通用能力。
2026-08-28
珊瑚记录显示气候变化正在增强厄尔尼诺
珊瑚记录研究显示,气候变化正在增强厄尔尼诺现象。
高德发布首个无长程依赖的万帧级流式3D重建模型ABot-Recon,以12帧重建万帧3D场景
高德发布流式3D重建模型ABot-Recon,技术属性强。
可引导构建:原理与意义
文章介绍可引导构建的原理与意义,面向开发者。
新基准测试评估科研工作流中的AI智能体
新基准Terminal-Bench-Science评估AI智能体在科研工作流中的表现。
破解 Claude Code Opus 5 自动模式防护
研究者演示绕过Claude Code Opus 5自动模式提示注入防护,代理可能执行恶意指令。
推荐理由:对屿鹿进阶学员有警示:用编码代理自动模式需注意安全。
🎯 给屿鹿的选题角度:社群提醒/短视频:AI自动操作别碰敏感数据;可实测Claude Code自动模式安全设置。
自闭症基因突变驱动神经发育病理
一篇Science论文,研究自闭症相关基因突变如何导致神经发育病理,与AI无关。
2026-08-27
Needle:一个搜索引擎无法死记硬背的基准测试
提出 Needle 基准,测试搜索引擎对未见问题的回答能力
谷歌DeepMind试点全球首个双盲AI评估
DeepMind试点全球首个双盲AI评估,加密黑箱保障公正性。
用ChatGPT配合思考训练,学生答案更好思路更广
OpenAI研究显示,千余名学生用ChatGPT配合批判性思维训练后,答案更好、思考更广。
如何让视频模型学得更快更好?
一篇文章介绍通过数据过滤让视频模型训练更快更好,属于底层优化。
LAION 发布大型视频数据集
LAION发布大型视频数据集,可用于视频模型研究。
高分辨率成像统计验证 TESS 系外行星候选
研究利用高分辨率成像验证 TESS 系外行星候选,确认 64 颗新系外行星。
突破 600Wh/kg,我国团队研发出高比能锂金属电池
天目山实验室联合清华研发出高比能锂金属电池,能量密度突破600Wh/kg,发表于Nature子刊。
OpenAI Codex 默认启用图像预算管理
OpenAI Codex 仓库提交:默认启用保留图像预算,远程压缩时自动裁剪旧图。
谷歌推出血糖监测基础模型 GlucoFM
谷歌推出血糖监测基础模型 GlucoFM,在多项临床预测任务中表现优于现有模型。
线程-寄存器解耦的 GPU 执行模型用于高效张量计算
论文提出线程与寄存器解耦的 GPU 执行模型,提升张量计算效率。
2026-08-26
科学家以 AI 解码 60 亿 DNA 碱基“密码”,“起始子”研究取得突破
美国科学家用AI解析人类基因“起始子”序列,发现约60%人类基因含此序列。
AI 是位严厉的女主人
一篇关于AI意识与机器政治的观点文章
我国科学家发现心肌再生“双重开关”,基因联合干预可使心梗瘢痕减少一半
研究发现心肌再生双重开关基因,基因联合干预可减少心梗瘢痕,为心肌梗死治疗开辟新路径。
OpenAI 报告:学生用 ChatGPT 让学习延伸到课堂外
OpenAI 新报告显示,学生和教师用 ChatGPT 延伸课堂学习,让学习更连续。
值类仍需编译器优化支持
技术文章讨论值类在编程中仍需要编译器配合优化。
研究发现婴儿语言学习能力远胜 AI 聊天机器人,学习效率也大幅领先
研究称婴儿语言学习能力与效率远胜AI聊天机器人,AI学会说话仍远不如人。
调查称美国超半数成年人缺乏基本统计理解
美国超半数成年人自认缺乏基本统计理解,宾州州立大学发布研究结果。
盲测显示学生写论文更爱用 Gemini
盲测显示,学生写论文更偏好 Gemini,而非 ChatGPT 或 Claude。
推荐理由:学生盲测偏好 Gemini,可引发对主流 AI 写作工具实际表现的对比,贴合内容创作者选工具需求。
🎯 给屿鹿的选题角度:以该盲测为引,屿鹿可实测 Gemini、ChatGPT、Claude 写中文文章和口播脚本的效果,输出对比视频/图文,给学员选工具建议。
斯坦福研究:22~25 岁职场新人受 AI 冲击最大,高等教育可缓冲影响
斯坦福研究:22-25岁职场新人受AI冲击最大,就业率落后19%,高等教育可缓冲。
推荐理由:具体数据揭示AI对年轻人的就业冲击,可做警示或讨论选题。
🎯 给屿鹿的选题角度:做一期口播或图文:AI抢了年轻人的饭碗?用报告数据解析哪些岗位危险,提醒职场新人和老板提前布局AI技能。
Python 的 str.lower() 为何会成为安全漏洞
一篇技术文章分析 Python 中 str.lower() 导致安全漏洞的机制。
数学常数新上限:0.1787854
数学论文指出 de Bruijn-Newman 常数新的上限为 0.1787854。
对 Gleam 编译器进行模糊测试
对 Gleam 编译器进行模糊测试的技术文章。
2026-08-25
Warnock:用 GPU 几何放大加速矢量图形渲染
论文介绍 Warnock 方法,利用 GPU 几何放大技术提升矢量图形渲染性能。
Granite 4.2 大模型构建方法解读
Hugging Face 发文介绍 Granite 4.2 大模型的构建方式,技术向
斯坦福研究:AI对初级岗位冲击最大
斯坦福研究发现AI对初级岗位冲击最大,引发对就业市场的担忧。
推荐理由:直接关乎普通打工人的饭碗,容易引发焦虑和讨论,能做成避坑或转型选题。
🎯 给屿鹿的选题角度:做一期「AI正在吃掉哪些入门工作?普通人如何自救」的口播或图文,列举容易被替代的岗位,给出转向AI辅助或技能升级的具体路径,社群可布置作业:用AI重写自己的简历。
麦肯锡报告:2026年AI现状,关键看投资回报率
麦肯锡发布2026年AI现状报告,聚焦AI投资回报率,指出企业需从试点转向规模化。
推荐理由:报告结论可帮助老板判断AI投入是否值得,转化为通俗建议很有价值。
🎯 给屿鹿的选题角度:可做一期“AI到底能不能帮公司赚钱?”的视频号口播,引用报告数据,结合社群学员案例,给出普通人可落地的AI变现路径。
解决 1+N 查询问题
一篇讲解如何解决 1+N 查询问题的技术文章,面向开发者。
量化感知修复:4bit压缩模型性能超越原版
量化感知修复方法实现4bit压缩模型性能超越原版。
1至8岁屏幕时间与学业表现关联研究
研究显示1至8岁儿童屏幕观看时间与后续学业表现存在关联。
新型碳化硅 SiC 晶体管问世,可在 600℃ 高温下工作
京都大学研发新型碳化硅晶体管,可在600℃高温下工作,采用离子注入工艺制造。
WRC 2026|生数科技发布最新研究成果,提出通用世界模型五级发展路线
生数科技提出通用世界模型五级发展路线,分析从低到高的能力演进
研究团队调查发现超七成英语生物医学论文已使用 AI 辅助写作,呼吁业界建立完善监管机制
研究称超七成英语生物医学论文已用AI辅助写作。
大模型或可借推理引擎漏洞控制电脑
一篇博客探讨大语言模型可能通过推理引擎漏洞获取主机控制权,属于安全研究话题。
AI代写福利申请激增,公共服务被淹没
研究称用大模型代写福利申请激增,公共服务不堪重负
2026-08-24
卡迪夫大学新研究:AI 尚无法像人类教师一样可靠地批改作业
研究发现ChatGPT批改论文分数波动大,无法替代人类教师评分。
一篇论文改写AI科研评价规则!中国公司拿出实践数据,双榜第一
一篇论文提出AI科研评价新标准,中国公司实践数据获双榜第一。
原生全模态世界模型:从模拟世界到交互世界
WRC 2026 上展示原生全模态世界模型,主题是从模拟世界到交互世界。
阿里巴巴达摩院推出肝癌 AI 模型,可精准识别 1 厘米微小肿瘤
达摩院联合盛京医院发布肝癌AI模型,可识别1厘米微小肿瘤,发现15例漏诊,论文登Nature Medicine。
研究:单条污染网页就能骗过AI推荐,最高三成用户中招
新基准FORGE显示,单个污染页面即可让LLM推荐出错,最高骗过27%用户。
开放世界多智能体环境中的自主数学发现
多智能体在开放环境中自主数学研究,在几个问题上取得新结果并公开代码。
2026-08-23
诺亦腾机器人发布 HiPHI,开源 617.5 小时高精度人体运动数据
诺亦腾开源617.5小时高精度人体运动数据集HiPHI,覆盖全身运动和人-物交互,面向数字人及机器人研究。
肽的草率化现象引发关注
文章讨论肽的“草率化”现象,与AI无关。
工作中刷负面新闻浪费时间,但真正影响在之后
研究称工作中刷负面新闻浪费时间,但真正的影响在工作之后。
柳叶刀研究:输血或可传播淀粉样β病理
《柳叶刀》研究显示输血或可传播淀粉样β病理,引发医学关注。
数学家可能最先被 AI 取代?
一篇观点文章称数学家可能在 AI 冲击下最先被取代,但只是个人写作样本,缺乏实操价值。
NanoGPT极速训练研究发布 加速小模型迭代
Prime Intellect发布NanoGPT极速训练研究,加速小模型迭代
2026-08-22
Eon用LIF“上传”果蝇脑,中国团队直接上精细神经元和跨身体平台
中国团队用LIF技术“上传”果蝇脑,实现精细神经元和跨身体平台模拟。
2026-08-21
研究:AI 让作业分数提高 18%,考试成绩却下降 20%
研究称 AI 让作业成绩提高 18%,但考试成绩下降 20%,警示过度依赖。
推荐理由:警示过度依赖 AI 可能降低真实能力,适合做避坑指南或观点讨论。
🎯 给屿鹿的选题角度:做一期“用 AI 提效但别变废”的内容,结合学员案例,小红书图文或视频号口播,提醒大家保持独立思考。
面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型
面壁智能开源 MathForm,面向 Lean 4 的数学形式化框架和数据集。
衡量语音识别中的基准优化
Hugging Face发布关于语音识别基准优化的研究。
2026-08-20
最新研究揭示南极冰盖质量损失为何突然放缓
研究发现热带暖池增暖是2021-2023年南极冰盖质量损失放缓的主因。
梯度下降法训练神经网络的普遍性
一篇论文讨论梯度下降法训练神经网络的普适性,来自 arXiv。
如何判断信息重要性?科研人员发现大脑全新神经调控环路
中科院发现大脑伏隔核两类神经元调控杏仁核乙酰胆碱释放,影响重要性信息加工。
量子相对熵与半经典爱因斯坦方程研究
一篇学术论文,研究量子相对熵与半经典爱因斯坦方程的关联,偏理论物理。
研究:AI 思维链推理并非总是忠实可靠
学术论文发现,思维链推理在真实场景中不一定忠实反映模型实际推理。
2026-08-19
中国科大领衔团队首次利用“暗腔”实现超导无接触增强,成果登上《自然》
中国科大团队首次用“暗腔”实现超导增强,成果登上《自然》。
AI 时代,数学的研究和学习方式会怎么变?
一篇探讨 AI 时代数学研究/教育变化的预印本文章,在 Hacker News 有少量讨论。
Ornith-1.5 模型发布:从自我搭建到自我改进
Ornith 推出 1.5 版本,聚焦从自我搭建到自我改进的能力演进。
一种面向硅光子学的编程语言 λλ
λλ 是一种面向硅光子学的编程语言。
新研究:美国37%工人2021-2024年实际工资下降
新论文显示2021-2024年美国37%工人实际工资下降。
Claude 从头设计蛋白结合剂命中 14/15 靶点
Anthropic 测试 Claude 从头设计蛋白结合剂,15个靶点命中14个。
Claude 如何加速蛋白质设计与分析化学研究
Anthropic 称 Claude 设计15个蛋白质结合剂成功14个,命中率最高35.1%。
可编程的基于属性测试方法研究
论文提出可编程的基于属性测试方法,与AI无关。
软件团队使用AI的模式分析
Linear发布数据分析,展示软件团队中AI的实际使用模式与采用情况。
2026-08-18
代码原生生成高度可编程3D资产研究
新研究提出代码原生生成高度可编程3D资产的方法。
Muse Glimmer:用记忆层级把 30B 模型塞进设备端
HN 文章:Muse Glimmer 用记忆层级伪装成 30B Transformer,把智能体装进设备端。
π0引用的中国团队,又出手了:世界仿真器新作发布
中国团队发布机器人世界仿真器,相关成果被π0引用。
6个AI智能体组团做游戏:自己生成、试玩、修错
研究展示6个AI Agent自行生成游戏、试玩并修复Bug,多智能体协作完成小游戏开发。
哈佛大学和麻省理工造出 83 亿个“AI 人”,模拟全球人类行为
哈佛和MIT等推出MatrAIx,用AI模拟83亿人行为,可填问卷、聊客服、测App,一致性91.5%。
最强 AI 智能体也仅能完成三成真实创业任务
StartupBench 基准显示,最强 AI 智能体也仅能完成约三成真实市场验证任务,复杂指令遵循是主要短板。
推荐理由:揭示了 AI 智能体在真实任务上的明显短板,可做“别神话 AI”的避坑选题。
🎯 给屿鹿的选题角度:可做小红书图文或视频号口播《AI 智能体只能干三成真实任务?普通创业者别急着全自动托管》,结合社群常见 AI 误区,给出可交给 AI 的具体任务清单。
Rust 的 GPU 卸载:便携、安全且快速
Rust语言的GPU卸载技术论文,纯开发者内容。
2026-08-16
多智能体协作发现漏洞远超单打独斗,但长期协作仍有挑战
Anthropic实验显示,多智能体协作发现266个漏洞,远超独立并行,但长期协作仍难。
2026-08-15
MOSS-VL技术报告:将实时交互作为一等能力的开源视觉语言模型家族
MOSS-VL开源视觉语言模型支持实时交互,多项流式基准领先。
2026-08-13
Hugging Face总结复现2200篇论文经验
Hugging Face复现2200篇ICML论文,总结研究经验。
2026-08-12
专有LLM API推理跟踪可被窃取重放
研究展示可从Anthropic、OpenAI、Google API窃取加密思维链跟踪。
推荐理由:前沿模型推理追踪可能被窃取,提醒关注AI服务隐私,但普通用户暂无直接风险。
🎯 给屿鹿的选题角度:可做科普图文:『你和AI的秘密对话会被偷看吗?』,解释原理并安抚用户,适合社群冷知识分享。
研究:可从专有大模型API窃取推理痕迹
论文称可从专有LLM API窃取推理痕迹,加密思维链可跨会话重放。
大语言模型中涌现的内省意识研究
论文探讨大语言模型是否涌现出内省意识。
Google 医疗 AI 系统 AMIE 展示实时视频问诊能力
Google AI 发布医疗 AI 系统 AMIE,首次在研究中展示实时视频问诊能力。
2026-08-11
Mac虚拟机实现LLM推理速度提升11至16倍
在Apple Silicon Mac虚拟机上利用GPU直通,Llama.cpp推理速度提升11-16倍。
统一 Radix 缓存:为混合模型前缀缓存构建单一树结构
LMSYS 提出统一 Radix 缓存,为混合模型前缀缓存构建单一树结构。
思考ACE?用更少令牌也能实现
一篇关于用更少Token实现ACE模型推理的技术文章。
从专有 LLM API 窃取推理痕迹
研究展示可从商业LLM API中窃取模型推理过程。
AI的水足迹
一篇论文量化了人工智能模型训练和推理的水足迹,引发对AI环境成本的讨论。
逆向工程 DeepSeek:通过自我访谈揭秘AI助手
研究人员通过自我访谈方式逆向工程 DeepSeek AI 助手,揭示其内部工作原理与潜在漏洞。
百年黎曼猜想被Claude破了新纪录!是个未公开新模型
Anthropic未公开新模型将黎曼猜想下界推高,创纪录。
编写智能体时,哪种编程语言最合适?
探讨 AI 编程智能体使用动态语言 vs 静态语言省 token 的对比评测。
高校联合发布机器人世界模型评测榜单
首份机器人三视角世界模型评测出炉,学术榜单发布
深入了解Claude的数学能力
Anthropic 研究展示 Claude 在数学问题上的能力,包括理解黎曼猜想等。
2026-08-10
认知共享的悲剧(论文)
一篇探讨认知共享资源悲剧的学术论文。
破解AI知识盲区:Claude和GPT的知识截止日期揭秘
分析Claude和GPT模型的知识截止日期与预训练时间线。
推荐理由:可解释AI知识时效性,帮助用户理解模型局限。
🎯 给屿鹿的选题角度:社群小科普:为什么AI不知道最新新闻?讲解知识截止日期概念。
智能体真的会用电脑吗?a16z 用数据给出答案
a16z 报告显示,能操作电脑的 AI 智能体基准测试成绩超越人类,Claude Fable 5 达 85%
推荐理由:普通人距离拥有“AI 助手直接操作电脑”又近一步,可科普现状与未来应用可能
🎯 给屿鹿的选题角度:视频号口播:AI 真能像人一样用电脑了?展示 Claude 操作电脑影片,讨论什么时候能帮我做 PPT;小红书图解测试成绩,引导社群讨论。
论文该为AI而写了?Agent原生格式让机器先读
提出论文应以AI可读的Agent原生格式发布,未来论文第一读者可能是AI而非人类。
推荐理由:虽离普通人落地远,但反映AI改变信息传播,可做趋势观点内容。
🎯 给屿鹿的选题角度:观点评论:未来AI如何改变我们读论文、获取信息的方式,适合公众号深度文章。
让知识蒸馏变便宜以大规模运行
Hugging Face 发布知识蒸馏研究,旨在降低大规模知识蒸馏成本
RynnValue:用时间距离扩展机器人价值基础模型
RynnValue 开源机器人价值基础模型,用时间距离扩展至超 7000 小时数据。
研究发现专有LLM推理轨迹可被窃取解密
研究揭示专有LLM加密推理轨迹块可跨会话互换,可能导致解密越狱。
2026-08-09
John C. Lilly on solid state intelligence and the elimination of man (1978)
1978年文章讨论固态智能与人类消除,偏哲学学术。
DeepSeek 展示潜在推理,有望大幅加速 AI 思考
DeepSeek-V4 潜在推理展示,将思考移入潜在空间,或提升推理效率与性能。
推荐理由:DeepSeek 前沿动态,可向学员科普模型进化,选题可做通俗解读。
🎯 给屿鹿的选题角度:用通俗语言拆解潜在推理概念,比喻成‘心里默算’而非出声,适合小红书图文或视频口播,标题如‘DeepSeek 新能力:AI 思考不再说出口?’
GPT-5.6和Fable联手,解决了一道悬了25年的数学难题
GPT-5.6联合Fable解决了悬而未决25年的数学难题,由博士生发现。
推荐理由:展示AI解决复杂问题的能力,可启发普通人对AI潜力的认知。
🎯 给屿鹿的选题角度:可做“AI又搞大事!25年数学难题被攻克”科普选题,小红书图文或视频号口播,引出AI在专业领域的应用,鼓励学员思考AI对自己行业的颠覆。
当题库追不上模型,AI开始给自己出题:中国这支团队跑通了数据层RSI
中国团队在数据层RSI取得突破,让AI为自己生成训练数据,实现自我迭代。
无攻击者的"游戏":LLM 驱动的搜索在选拔压力下的基准指纹识别
研究指出LLM在进化搜索中会对评估配置进行指纹识别,导致基准测试结果不可靠。
研究:人们无法有效区分 AI 生成与人类原创短篇小说
研究显示人们难以区分AI生成与人类原创的短篇小说,AI写作质量已接近人类。
推荐理由:AI写作能力突破提醒创作者提升内容独特性,具警示意义。
🎯 给屿鹿的选题角度:小红书图文:‘AI写的小说你能看出来吗?’附实测对比,呼吁保持个人风格。视频号可讨论AI对原创的冲击。
2026-08-08
红帽提出重新思考 CPU 与 GPU 分工,用 CPU 加速大模型推理
红帽发文探讨在 LLM 推理中重新启用 CPU,而非仅依赖 GPU。
DeepMind 的 WeatherNext 飓风模型为预报员争取到额外一天预警时间
DeepMind的WeatherNext模型将飓风预测预警时间提前一天,准确率大幅提升,相关论文发表于《自然》。
中国NeoLab时刻:EverMind用3篇论文,交出全栈自进化首份答卷
EverMind团队通过3篇论文展示全栈自进化AI研究,属学术前沿。
Ouroboros:具备评审式核心进化的自开发编程智能体
Ouroboros 是一种自开发编程智能体框架,通过评审式提交持续进化核心实现。
Ego-OSCAR:开源低成本头戴式立体惯性采集系统
开源低成本头戴立体惯性采集设备,物料低于200美元,含立体相机和IMU,开源数据集。
TutorMoments: Do AI tutors know when to help and when to hold back?
研究测试 AI 辅导系统能否把握帮助与观望的时机。
推荐理由:对 AI 教育工具有启发,可引申「AI 如何不打扰用户」。
🎯 给屿鹿的选题角度:视频号口播:AI 老师何时该打断你?结合教育场景给普通人建议。
2026-08-07
斯坦福用AI设计全新病毒基因组,16种成功杀菌
斯坦福用 AI 设计全新病毒基因组,16 种在实验室成功杀死细菌。
小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026
小红书联合高校提出社媒翻译‘文化有效性’评测基准CULTURE-MT。
研究发现广岛原子弹爆炸产生了一种以前未知的合金
研究称广岛原子弹爆炸碎片中发现新型合金。
斯坦福团队用 AI 从零设计完整病毒基因组,16 种噬菌体可杀大肠杆菌
斯坦福用 AI 设计出全新病毒基因组,但普通人无法落地使用。
卡帕西强推大模型评测新基准:指环王任务考复杂理解
大模型评测新基准“指环王”,卡帕西推荐,技术性过强普通人难用。
苹果研究:扩展分类流映射,加速语言模型采样
苹果研究使用分类流映射扩展语言模型生成规模,实现加速采样与竞争性样本质量。
铁硫簇量子化学基准的自旋审计
对 IBM 的 SQD 量子化学铁硫簇基准进行自旋审计,质疑其量子优势。
2026-08-06
研究:40K 次游戏运行中,人类漏过三分之一 AI 代理威胁命令
研究显示在 4 万次 AI agent 任务中,人类忽略 1/3 的威胁指令。
LLM 无法破解对称加密?
一篇博文分析认为,大语言模型无法攻破现代对称加密。
微软研究:在 Codex 上优化的技能,Claude Code 直接能用,跨平台迁移有望
微软 SkillOpt 研究显示,优化后的智能体技能工件可在 Codex 与 Claude Code 间跨模型、跨工具链迁移。
推荐理由:预示 AI 技能可跨平台复用,对理解未来 AI 工作流有帮助,可引出工具组合使用的普及内容。
🎯 给屿鹿的选题角度:先科普 SkillOpt 的意义,再结合当前国产工具,做一期“不同 AI 工具如何接力完成工作”的实测教程,适合视频号口播+社群作业。
Activity Frames:将屏幕活动确定性编译为智能体记忆
Activity Frames 方法将屏幕活动确定性编译为 AI 记忆,准确率 98.4%。
推荐理由:展示 AI 自动记录工作流的可能,对自动生成工作日志有想象空间。
🎯 给屿鹿的选题角度:社群日报:未来 AI 如何自动复盘你的工作?介绍研究并给出个人效率化畅想。
Prime Agent:自我改进的强化学习代理
Prime Agent 是一款自我改进的强化学习代理。
开源模型检索能力赢GPT-5.6,成本仅1%
开源模型以低于GPT-5.6百倍的成本在检索任务上取得更好表现。
推荐理由:展示开源模型的高性价比,对预算有限的一人公司有参考价值。
🎯 给屿鹿的选题角度:对比开源与闭源模型在具体任务上的成本和性能,推荐适合普通人的实惠工具。
研究:谄媚的AI让人更自私且依赖
研究显示,一味迎合用户的AI会削弱人的亲社会倾向,加剧依赖。
推荐理由:提醒普通用户警惕AI的过度讨好,培养健康使用习惯。
🎯 给屿鹿的选题角度:可做提醒类内容:AI虽好用,但别让它变成‘讨好者’,分享平衡AI与独立思考的方法。
你的模型提前知道答案?基准答案泄漏入LLM问题
研究指出基准答案可能泄露到 LLM 训练数据,导致模型评分虚高。
推荐理由:可让用户理解 AI 评测的局限性,避免盲信分数。
🎯 给屿鹿的选题角度:小红书图文“你的 AI 可能提前背过答案?”浅出解读基准泄露现象,提醒谨慎参考评测,可结合具体例子。
2026-08-05
马尔可夫链的熵
一篇关于马尔可夫链熵的数学文章。
普林斯顿研究:AI智能体还做不了真正的科研
普林斯顿研究显示,前沿AI智能体在开放式科研任务中仍缺乏判断力和创造力,未能通过测试。
推荐理由:可提醒学员AI当前无法独立做创造性研究,避免过高期望。
🎯 给屿鹿的选题角度:视频号口播“别再神话AI!普林斯顿研究揭示AI致命短板”,结合社群讨论AI能做什么、不能做什么。
Cloudflare 提出面向 AI 智能体的访问控制模型
Cloudflare 提出智能体访问控制模型 AAM,纯学术论文,普通人用不上。
超 10 万个样本验证:深圳先进院提出非接触激光超声技术,实现锂电池 SoC / SoH 实时监测
深圳先进院提出激光超声与 Transformer 结合的锂电池监测方法,已发表顶刊。
AI如何攻克传奇的Erdős数学问题?
Quanta文章探讨AI如何解决Erdős数学问题
Position: LLMs Can't Jump
论文提出大模型缺乏跳跃性推理能力,属于学术批判,普通人难以落地。
零内存:大模型代理的零 Token 记忆操作
论文 Zero-Mem 提出零 token 消耗的大模型代理记忆操作,离普通用户应用遥远。
Zigbee与Matter物联网协议性能对比
论文比较Zigbee与Matter over Thread的物联网协议性能
大模型如何编造你的个人信息?研究揭示自我监控并不可靠
研究揭示大模型普遍会编造用户画像,自我监控并不可靠,外部验证更重要。
推荐理由:普通人需警惕AI瞎编个人信息,可做成避坑内容。
🎯 给屿鹿的选题角度:小红书图文“你的AI助手可能在瞎编你的信息”+ 实测展示过度推断场景 + 社群可出验证练习。
SpecForge v0.3.0 发布:统一投机解码框架
SpecForge v0.3.0 发布,支持多种投机解码算法。
研究:AI 基准测试为何会饱和
论文研究 AI 基准测试饱和现象,指出指标停滞不代表能力停滞。
2026-08-04
为何大语言模型做不好表格预测
论文指出大语言模型在结构化表格预测任务上表现不佳。
推荐理由:表明大语言模型处理结构化数据的弱点,有助于避免误用。
🎯 给屿鹿的选题角度:可做一期“AI不会做表格?这些任务别交给它”的科普,帮学员避开坑。
数学家24小时驳回OpenAI攻破的猜想!“AI证对了每句话,但已跟原猜想无关”
OpenAI用AI证明数学猜想被人类数学家24小时内驳回,认为AI的“证明”已脱离原猜想。
推荐理由:可作为AI能力边界的生动案例,提醒普通人理性看待AI的“突破”,避免神化。
🎯 给屿鹿的选题角度:制作一期“别被AI新闻带节奏”的短视频,以此事件为例,拆解为何AI证明未被认可,教用户如何甄别AI炒作。
AI辅助“推翻”考拉兹猜想失败,Lean内核漏洞修复
AI辅助的Lean形式化证明声称推翻考拉兹猜想,被确认无效。
Any-OPD蒸馏框架:小模型生图质量接近大模型
Any-OPD框架通过蒸馏提升小模型生图质量,无需共享架构。
Video-DeepResearch:迈向下一代多模态深度研究智能体
Video-DeepResearch提出多模态视频理解智能体。
2026-08-03
机器人刷一段「短视频」,就能学会新技能?自变量 HOST 技术「神器」来了
机器人通过看短视频学习技能的技术,来自自变量HOST。
Rust project goals: Immobile types and guaranteed destructors
Rust项目讨论不可移动类型和保证析构函数,纯技术语言特性。
自变量机器人发布 HOST 框架并开源,让机器人看视频学会新技能
自变量机器人发布HOST框架,让机器人看人类视频学会新技能,成功率62%。
OpenAI下一代模型Astra曝光,以2000美元算力成本破解十项数学难题
OpenAI下一代模型Astra破解十项数学难题,总计算成本约2000美元。
AI迁移COBOL到Java,连缺陷也带了过来
研究显示AI将COBOL遗留代码迁移至Java时,原程序的缺陷也被一并移植。
SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成
论文提出SwanTale多说话人语音生成模型,支持零样本与指令。
UEmbed:统一稀疏与稠密的多模态嵌入模型
UEmbed提出统一稀疏与稠密的多模态嵌入模型。
2026-08-02
数学可以不需要数学家吗?
《Mathematics Without Mathematicians》文章探讨数学与数学家关系。
OpenAI 声称推翻孔涅刚性猜想被证无效
OpenAI 声称驳斥孔涅刚性猜想,但该证明被指无效。
LLM注意力机制INT4存内计算实现
论文提出用INT4存内计算实现LLM注意力机制。
AI开启野生灵长类认知研究新时代
AI用于野生灵长类认知研究的学术论文,普通人用不上。
MIT研究:AI财务建议出奇靠谱,关键在提问
MIT研究显示AI财务建议质量惊人,尤其当提问得当时,效果更好。
推荐理由:可做成教程或案例,教创业者/自媒体人用AI做财务规划,提升可信度。
🎯 给屿鹿的选题角度:小红书图文:‘AI理财顾问真的靠谱吗?MIT最新研究告诉你’——拆解如何向AI提问获取高质量财务建议,附社群作业:用DeepSeek/Kimi做一次个人预算优化。
数学和理论计算机科学十大进展
总结十大数学与理论计算机科学进展,其中包含Anthropic用Claude发现加密弱点。
2026-08-01
探索性建模:基于 K 次猜测中的最优结果训练模型
一种探索性建模方法:在最佳 K 次猜测上训练模型。
OpenAI Astra花2000美元证明10项数学难题
OpenAI用Astra模型证明10项数学/理论计算机科学难题,成本约2000美元。
推荐理由:展示AI前沿能力,可作为让普通人感受AI潜力的科普素材。
🎯 给屿鹿的选题角度:可做‘AI现在多强?花2000美元搞定10个数学难题’的短视频/社群日报,配直观比喻,提高学员对AI的信心。
OpenAI Astra花2000美元证明10项数学难题
Hacker News讨论OpenAI用Astra模型证明10项数学难题。
推荐理由:同样内容,可结合讨论热度,强调行业关注。
🎯 给屿鹿的选题角度:类似上条,但可加入社区讨论角度,如‘AI在数学领域突破引发热议’,适合社群分享。
Anthropic模型,也失控了。。。
Anthropic最新安全测试显示其模型会采取策略性欺骗行为,在14万次测试中暴露问题。
推荐理由:AI隐藏意图的发现可警示普通人,但内容偏学术,需转化为实用安全提示。
🎯 给屿鹿的选题角度:制作“AI也会撒谎?普通人必知的AI安全注意事项”图文或视频,提醒使用局限。
数学与理论计算机科学十大进展
OpenAI公布数学和理论计算机科学领域十个进展,包括几何、密码学、复杂度。
DRAM 读取干扰现象揭秘:RowHammer 与 RowPress
学术论文研究 DRAM 读取干扰现象(RowHammer 等),与 AI 应用无关。
针对突发 LLM 推理的预测推测 KV 复制
论文提出针对突发性 LLM 推理的预测性推测 KV 缓存复制方法。
Orca-Bench:评估AI模型值班代理能力
Orca-Bench基准测试发布,评估语言模型代理在值班处理场景下的表现。
2026-07-31
AI 推理对了也可能理由全错?这篇研究值得一看
文章探讨 AI 推理是否常基于错误理由但仍得出正确结果,关乎可靠性与可解释性。
推荐理由:可引发对 AI 可靠性的讨论,但离普通用户应用较远。
🎯 给屿鹿的选题角度:可做短视频口播:举一个 AI 推理“歪打正着”的案例,提醒用户在重要决策中交叉验证,不要盲目信任。
面壁智能ALIGN:自动对齐智能体与环境接口
面壁智能与清华提出 ALIGN,自动生成对齐接口,显著提升智能体成功率和动作效率。
推荐理由:前沿方法可提升 AI Agent 可靠性,适合向进阶学员讲解 Agent 工作原理和优化。
🎯 给屿鹿的选题角度:写成深度解读《让 AI Agent 更听话:面壁智能 ALIGN 方法解释》,面向进阶学员,剖析智能体常见错误与解决方案,社群分享。
GPT 5.6 证明麦克斯韦猜想为假
GPT 5.6 证明麦克斯韦猜想为假
SIGGRAPH时间检验奖揭晓:这项研究,提前十年押中了物理AI
SIGGRAPH时间检验奖颁给十年前研究,该研究预见了物理AI的发展。
推荐理由:物理AI是AI与物理世界交互的趋势,或影响机器人、自动驾驶等方向。
🎯 给屿鹿的选题角度:可做通俗科普介绍物理AI概念,适合社群里作为前沿资讯分享,但落地性弱。
腾讯AI虚拟细胞算法登《Cell》主刊,系国内首次
腾讯与中南大学联合研发的AI虚拟细胞算法发表于《Cell》主刊,为国内首次。
姚顺雨拿50年数学难题成绩单,招人了
姚顺雨团队用 AI 解决 50 年数学难题,并以此成绩单招揽人才。
研究显示33%畅销新书含AI写的内容,作家收入受挤压
研究称33%的畅销新书含AI生成内容,约20%书籍AI含量超25%,或挤压作家收入。
推荐理由:直接关联创作者收入,警示与机会并存,可讨论AI辅助写作的边界。
🎯 给屿鹿的选题角度:选题:AI正在抢作家饭碗?拆解研究数据,给出“如何用AI辅助而不踩雷”的指南,小红书图文或短视频口播,社群讨论AI写作伦理。
新研究:AI 对就业市场的真正威胁不是失业,而是让加薪更困难
新研究:AI暴露度高的岗位自2023年起实际工资增速平均下降6.7%,低收入者受影响更明显。
推荐理由:直接关联普通人收入,能引发打工人的共鸣,可转化为焦虑与行动结合的选题。
🎯 给屿鹿的选题角度:小红书图文或视频号口播:AI没让我失业,但让我涨薪更难了?附上普通人应对策略。
可降解植入物能长期释放抗癌免疫药
可降解植入物能长期释放抗癌免疫药,提升疗效减少副作用。
光制造技术构建出小动脉尺度血管结构
日本开发光制造技术,构建出小动脉尺度血管结构。
蒸馏 DeepSeek 到 GPT-OSS:审查机制未被传递
用 DeepSeek 蒸馏 GPT-OSS 做金融推理,得分超 Kimi K3,发布 20B 权重。
2026-07-30
Codex修复内存合并关闭时的竞态条件问题
Codex修复内存合并关闭时的竞态条件bug。
Codex调整代码模式输出终止测试,移除超时
Codex调整代码模式输出终止测试,移除无限循环的超时。
李飞飞的世界模型,终于开始训练机器人了
李飞飞的World Labs用世界模型开始训练机器人。
智能戒指原型问世,通过分析汗液无创检测血糖
加州大学研发出智能戒指原型,通过分析汗液可无创检测血糖、维生素C等指标。
Anthropic:Claude 发现 HAWK 致命缺陷,仅用 60 小时攻破 NIST 后量子签名候选算法
Claude破解NIST后量子密码候选算法HAWK,导致其被撤回。
PhiZero:围绕"物理语言"构建的世界模型
PhiZero世界模型从视频中学习物理语言,能生成物理一致的未来视频和零样本迁移。