每日 AI 简报

2026-07-28(内容获取于 07/28 05:05)

Claude共享聊天记录疑遭搜索引擎索引,用户隐私引关注

TechCrunch, Wired AI · 07/28 04:19

Anthropic公司AI助手Claude的「共享聊天」功能被曝存在隐私漏洞,用户分享的聊天记录和Artifacts可能已被Google和Bing等搜索引擎索引并公开。此问题源于共享链接的可见性,引发了对AI用户数据保护和网络爬虫处理私人内容能力的担忧。(多家报道)

推荐理由:此事件揭示了AI服务中的重要隐私风险,提醒用户审慎使用共享功能,并敦促AI平台加强数据保护。

Anthropic发布Claude Opus 5,智能与性价比兼备

Product Hunt · 07/28 04:59

Anthropic公司推出新款AI模型Claude Opus 5,据称其智能水平接近「Fable 5」旗舰级模型,同时将价格减半,显著提升了性价比。此次更新旨在让更多用户以更低的成本体验到前沿AI的强大能力,或将影响市场竞争格局。

推荐理由:Claude Opus 5以更优的性价比提供接近顶级模型的智能,对开发者和企业用户在选择AI服务时具有重要参考价值。

月之暗面开源Kimi K3模型权重及部分基础设施

The Decoder · 07/28 03:35

月之暗面(Moonshot AI)宣布开源Kimi K3的模型权重并开放部分基础设施。该中国大模型在基准测试中表现接近西方前沿模型,尽管在特定领域仍有差距。此次开源将极大推动本土AI社区的研究与应用,降低大模型开发门槛。

推荐理由:作为中国头部AI公司开源其前沿模型,将对整个AI生态系统产生深远影响,提供强大的研究和开发基础。

Kimi K3规模超GPT-2 22580倍,展示大模型进化速度

X 推文 (AttentionVC) · 07/27 23:22

一篇分析指出,2026年的Kimi K3模型规模已是2019年GPT-2的22580倍,展现了七年间大模型技术令人震惊的规模扩展速度。该推文深入探讨了这一巨大飞跃背后的技术驱动力,并引发了对未来AI发展路径和潜力的思考。

推荐理由:通过具象数据展示了大模型技术的飞速发展趋势,为理解当前AI行业格局提供了宏观视角。

金融领域专用基础模型Kronos开源

GitHub Trending

`Kronos` 是一个专为金融市场语言设计的基础模型。它旨在理解并处理复杂的金融文本数据,如新闻、财报,帮助金融分析师进行市场情绪分析、信息提取和趋势预测。该项目通过深入学习金融领域的独特术语和上下文,解决了传统模型在该领域专业性不足的问题。

推荐理由:这是一个针对金融垂直领域的开源AI基础模型,对金融科技开发者和研究人员具有直接的应用和研究价值。

个人开发者开源55个AI视频处理技能及用法

X 创作者 (AttentionVC) · 07/27 15:49

一位名为Pluvio9yte的创作者在X平台分享并开源了其开发的55个AI视频处理技能,并提供了详细的使用教程。这些技能涵盖视频生成、编辑、风格转换等多个方面,为视频创作者和AI开发者提供了丰富的实用工具集。

推荐理由:提供了可以直接上手使用的AI视频工具和教程,极大地降低了AI视频创作的技术门槛,实用性高。

ChatGPT限制模仿特定作家文风,转向捕捉广义特征

Ars Technica · 07/28 00:58

OpenAI已调整ChatGPT的行为,限制其直接模仿特定作家的写作风格,转而尝试捕捉其「广义特征」。此举被视为规避潜在版权和知识产权法律风险的策略,也引发了对AI生成内容伦理界限和未来内容创作模式的讨论。

推荐理由:反映了AI在内容生成伦理与法律边界上的新进展,对内容创作者、平台和法律制定者都有指导意义。

V2EX讨论:GLM5.2在Claude Code中的应用

V2EX · 07/27 20:14

V2EX社区有开发者讨论关于在Anthropic的AI编码工具Claude Code中集成并使用GLM5.2模型的效果和体验,旨在探究其性能、兼容性及对开发工作流程的潜在优化。

推荐理由:提供了AI开发者社区对特定模型组合的实践反馈和经验交流,对关注AI编程工具的用户有参考价值。

教授设隐形提示陷阱,抓获AI作弊学生

Hacker News · 07/28 03:46

一所大学教授通过在作业中巧妙设置「隐形提示」陷阱,成功识别出35名学生中有32名利用AI工具进行作弊。此事件引发了教育界对AI工具滥用现象的广泛关注,并促使教育者探讨更有效的反作弊策略及教育伦理问题。

推荐理由:揭示了AI时代教育面临的实际挑战,对教育工作者和学生均具警示意义,促进对AI伦理的思考。

Thea Energy lands $20M federal grant to build its magnets for fusion reactors

Fusion power startup Thea Energy snagged a $20 million award from ARPA-E to scale production of its high-temperature superconducting magnets.

中文介绍 核聚变能源初创公司Thea Energy获得ARPA-E的2000万美元联邦拨款,用于扩大其高温超导磁体生产,这些磁体将应用于核聚变反应堆。

As rivals chase acquisitions, Peacock bets on bundles through a new deal with YouTube

The deal means content will be integrated into the YouTube experience, allowing viewers to discover and watch Peacock content without leaving the platform.

中文介绍 Peacock与YouTube达成新协议,将其内容整合到YouTube平台中。用户无需离开YouTube即可发现和观看Peacock内容。此举是Peacock在竞争对手寻求收购时,通过捆绑策略进行市场竞争的举措。

PSA: Your Claude shared chats and Artifacts may have ended up on Google

The issue appears to have originated from Claude’s “share chat” feature, which allows users to create links that enable anyone with the assigned URL view a conversation or project.

中文介绍 Anthropic公司的AI助手Claude的用户共享聊天记录和Artifacts可能已被Google索引。问题源于Claude的「共享聊天」功能,该功能允许用户创建链接,使任何拥有该URL的人都能查看对话或项目,导致隐私泄露。

Private Claude Chats Exposed in Google and Bing Search Results

The screwup shows how tricky it can be to stop web crawlers from making ostensibly private conversations with AI chatbots entirely too public.

中文介绍 Anthropic公司AI聊天机器人Claude的私密对话被曝在Google和Bing搜索结果中公开。这一失误凸显了阻止网络爬虫将看似私密的AI聊天内容公开化的困难,引发了对AI用户数据隐私的担忧。

Xbox’s huge outage even blocked games on disc

An extended Xbox outage that began Sunday evening hasn't just caused issues for people trying to play digital games - it blocked people from playing their disc-based games, too. Xbox's status page initially reported the outage on Sunday at about 11PM ET, and it has also prevented people from logging

中文介绍 Xbox平台周日晚间约美国东部时间晚上11点发生大规模服务中断,不仅影响了数字版游戏,甚至阻止了用户玩光盘版游戏。此次长时间的故障引起了用户对游戏访问权限的广泛关注。

Moonshot AI releases Kimi K3 open weights and infrastructure after shaking up the frontier model race

Moonshot AI has released Kimi K3's model weights and made parts of its infrastructure open source. The Chinese model nearly matches Western frontier models such as Fable 5 and GPT-5.6 Sol on popular benchmarks, but independent tests found major gaps in cyber and math performance, possibly pointing t

中文介绍 月之暗面(Moonshot AI)发布了Kimi K3的模型权重并开源了部分基础设施。该中国模型在流行基准测试中表现接近西方前沿模型如Fable 5和GPT-5.6 Sol,但独立测试发现其在网络安全和数学性能方面存在显著差距。

Nanoleaf’s colorful pegboard and shelf kit is half off

Nanoleaf's Blocks Combo XL Smarter Kit comes with nine color-changing LED panels. | Image: Nanoleaf Nanoleaf’s Blocks Combo XL Smarter Kit is a fun back-to-school buy that can add pops of customizable light and storage to your wall. It combines colorful smart lighting panels with a low-profile shelf

中文介绍 Nanoleaf的Blocks Combo XL Smarter Kit智能套件正在半价促销。该套件包含九块可变色LED面板,将智能灯光与模块化存储功能结合,可为墙壁增添可定制的光线和置物空间。

5th Circuit blocks Texas law requiring websites to filter "harmful" speech

Age verification is okay, but filtering is preempted by Section 230, judges find.

中文介绍 美国第五巡回上诉法院阻止了得克萨斯州一项要求网站过滤「有害」言论的法律。法官认为,虽然年龄验证可行,但内容过滤因联邦《通信规范法》第230条的规定而失效。

OpenAI says more workers are using ChatGPT to do other people's jobs

OpenAI analyzed over 800,000 work-related ChatGPT messages and found that 43.5 percent of job-specific queries involve tasks from other professions. The company calls this "task crossover." The trend is most pronounced at small businesses, where users increasingly handle specialized work without ded

中文介绍 OpenAI分析了超过80万条与工作相关的ChatGPT消息,发现43.5%的特定工作查询涉及其他职业的任务。OpenAI将此现象称为「任务交叉」,该趋势在小型企业中尤为显著,员工日益承担专业化以外的职责。

Microsoft launches its own cybersecurity model MAI-Cyber-1-Flash but still depends on OpenAI for the toughest tasks

Microsoft introduces MAI-Cyber-1-Flash, a compact security model that scores 96 percent on the CyberGym benchmark when embedded in its MDASH multi-agent system. Microsoft says costs should drop by 50 percent compared to pure frontier models, since only tough cases get passed to GPT-5.4. For complex

中文介绍 微软推出了其首个网络安全模型MAI-Cyber-1-Flash。该紧凑型模型在集成到MDASH多智能体系统后,在CyberGym基准测试中得分96%,微软预计可将成本降低50%。然而,面对最艰难的任务时,微软仍需依赖OpenAI模型。

Verizon touts $1B dark fiber deal for Google data centers as first of many

Telecom expects AI revenue from dark fiber deals and retrofitted data centers.

中文介绍 Verizon与Google达成了一项价值10亿美元的暗光纤(dark fiber)交易,用于Google的数据中心,并将其视为众多合作的开端。Verizon预计将通过此类暗光纤交易和改造后的数据中心获取AI相关收入。

Experts warn current Starship heat shield tech is a "dead end" for rapid reuse

NASA has not made substantial investments in thermal protection research for decades.

中文介绍 专家警告称,尽管近期SpaceX星舰取得成功,但其当前的隔热罩技术对实现快速重复使用而言是「死胡同」。NASA数十年来未在热防护研究上进行大量投资,导致星舰面临技术瓶颈。

Microsoft launches its first cybersecurity model, plus a new agentic cybersecurity system

Microsoft bolstered its AI cybersecurity offerings this week with the launch of its first AI security model and a new security platform.

中文介绍 微软本周推出其首个AI安全模型以及一套全新的智能体网络安全系统,旨在增强其AI网络安全产品和服务,进一步提升企业及用户的数字防护能力。

Apple sued after alleged App Store crypto scam cost users $1.8M

Apple is facing a lawsuit from three users who say they collectively lost more than $1.8 million after downloading a fraudulent crypto wallet from the App Store, challenging the company’s longstanding claims that its app review process keeps users safe from scams.

中文介绍 苹果公司正面临三名用户的集体诉讼,他们声称因从App Store下载欺诈性加密钱包应用,共计损失超过180万美元。这起诉讼挑战了苹果公司长期以来关于其应用审核流程能确保用户安全的说法。

Amazon’s new satellite network for mobile phones could turn up the heat on SpaceX

Amazon is expanding its plans for providing satellite connectivity to mobile phones.

中文介绍 亚马逊正扩大其为手机提供卫星连接服务的计划。此举可能会加剧与SpaceX在卫星互联网领域的竞争,尤其是在直接向移动设备提供连接服务方面。

permissionlesstech/bitchat

Swift · ★ 32,105 · 🍴 5,046 · 📈 2,344 stars today

bluetooth mesh chat, IRC vibes

中文介绍 bitchat 是一个基于蓝牙 mesh 网络的去中心化聊天应用,旨在提供无需互联网连接的本地通信。它利用蓝牙 mesh 技术,使设备能够在没有中心服务器的情况下相互连接,形成一个临时的私有通信网络。其设计理念类似于 IRC,提供简洁的文本聊天体验。该项目解决了在野外、断网环境或对隐私有高要求的场景下,用户无法进行点对点或群组通信的问题。适用于户外活动、紧急救援、本地社群交流等场景。

amnezia-vpn/amnezia-client

C++ · ★ 13,745 · 🍴 1,028 · 📈 515 stars today

Amnezia VPN Client (Desktop+Mobile)

中文介绍 Amnezia VPN Client 是 Amnezia VPN 服务的桌面和移动客户端软件。它允许用户安全、私密地连接到 Amnezia VPN 服务器,从而加密网络流量、隐藏真实 IP 地址并绕过地理限制。该项目为需要增强在线隐私、规避审查或访问特定区域内容的用户提供了一个易于使用的跨平台解决方案。

moeru-ai/airi

TypeScript · ★ 43,961 · 🍴 4,388 · 📈 554 stars today

💖🧸 Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to achieve Neuro-sama's altitude. Capable of realtime voice chat, Minecraft, Factorio playing. Web / macOS / Windows supported.

中文介绍 Airi 是一个自托管的 AI 伴侣项目,旨在创建用户私有化、可定制的虚拟角色(如“waifu”),并支持实时语音聊天,目标是达到 Neuro-sama 的交互水平。它被设计为一个类似 Grok Companion 的系统,让用户能够完全掌控自己的 AI 互动体验,甚至可能与 Minecraft 等游戏集成。

opengeos/GeoLibre

TypeScript · ★ 2,580 · 🍴 346 · 📈 420 stars today

A lightweight, cloud-native GIS platform for visualizing, exploring, and analyzing geospatial data. It runs in the web browser, on the desktop, on mobile, and inside Jupyter notebooks.

中文介绍 GeoLibre 是一个轻量级、云原生的 GIS 平台,专为地理空间数据的可视化、探索和分析而设计。它支持多端运行,包括网页浏览器、桌面应用、移动设备以及 Jupyter Notebooks 环境,极大方便了用户在不同场景下处理和分析空间信息。该平台特别适合地理信息专业人员、数据科学家及开发者,用于构建交互式地图、进行空间数据分析或开发跨平台 GIS 应用。

yorukot/superfile

Go · ★ 20,808 · 🍴 673 · 📈 600 stars today

Pretty fancy and modern terminal file manager

中文介绍 superfile 是一款现代化的终端文件管理器,旨在为命令行用户提供美观且功能强大的文件管理体验。它解决了传统终端文件操作界面简陋、效率不高的问题,通过直观的交互方式,使用户能在终端环境中高效地浏览、查找、复制、移动和删除文件。适用于开发者、系统管理员及偏爱命令行操作的高级用户,提升其日常文件管理效率。

NanmiCoder/MediaCrawler

Python · ★ 58,125 · 🍴 11,578 · 📈 349 stars today

小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫

中文介绍 MediaCrawler 是一个功能强大的开源爬虫工具,专注于从多个主流社交媒体平台抓取公开数据。它支持对小红书笔记和评论、抖音及快手视频和评论、B 站视频和评论、微博帖子和评论、百度贴吧帖子及评论回复,以及知乎问答文章和评论进行数据采集。该项目为数据分析师、市场研究人员和开发者提供了便捷的工具,用于进行舆情监控、内容分析、用户行为研究等,从而获取社交媒体上的海量信息。

pbakaus/impeccable

JavaScript · ★ 51,441 · 🍴 3,035 · 📈 849 stars today

The design language that makes your AI harness better at design.

中文介绍 Impeccable 是一个旨在提升 AI 应用设计水平的设计语言。它提供了一套原则和方法,帮助开发者和设计师构建更具美感和用户体验的 AI 界面和交互。通过遵循其设计规范,用户可以创建专业、直观且易于使用的 AI 产品,解决当前许多 AI 工具在用户界面和交互设计上可能存在的不足。

shiyu-coder/Kronos

Python · ★ 34,524 · 🍴 5,791 · 📈 442 stars today

Kronos: A Foundation Model for the Language of Financial Markets

中文介绍 `Kronos` 是一个专为金融市场语言设计的基础模型(Foundation Model)。它旨在理解并处理复杂的金融文本数据,包括新闻、财报、研报等,解决传统模型在金融领域专业性不足的问题。通过深入学习金融领域的独特术语和上下文,`Kronos` 能帮助金融分析师、量化研究员等进行更精准的市场情绪分析、信息提取和趋势预测。

alibaba/open-code-review

Go · ★ 14,689 · 🍴 994 · 📈 980 stars today

Open-source & free — Battle-tested at Alibaba's scale. Hybrid architecture code review tool: deterministic pipelines + LLM Agent, precise line-level comments, built-in fine-tuned ruleset (NPE, thread-safety, XSS, SQL injection), OpenAI & Anthropic compatible.

中文介绍 alibaba/open-code-review 是阿里巴巴开源且免费的代码审查工具,经阿里大规模实践验证。它采用混合架构,结合确定性分析流水线和 LLM 智能体,能生成精确到行级别的代码评论。内置针对 NPE、多线程等问题的预训练规则集,旨在提升代码质量与开发效率。适用于各类团队进行高效、智能化的代码审查。

jenkinsci/jenkins

Java · ★ 25,859 · 🍴 9,679 · 📈 179 stars today

Jenkins automation server

中文介绍 Jenkins 是一款广泛使用的开源自动化服务器,它专注于实现软件开发的持续集成(CI)和持续交付(CD)。该项目通过自动化构建、测试、部署等环节,解决了传统软件开发流程中手动操作耗时且易出错的问题,极大地提高了开发效率和软件质量。它适用于任何需要自动化软件发布流程的开发团队和 DevOps 工程师。

bradautomates/claude-video

Python · ★ 10,987 · 🍴 1,137 · 📈 412 stars today

Give Claude the ability to watch any video. /watch downloads, extracts frames, transcribes, hands it all to Claude.

中文介绍 该项目赋予 Claude AI 模型观看和理解视频的能力。它通过下载视频、提取关键帧和生成文字转录,将处理后的内容提供给 Claude 进行分析。解决了大型语言模型原生不支持视频输入的问题,使用户能利用 Claude 进行视频摘要、内容问答或深度分析。适用于 AI 开发者和视频内容分析场景。

vudovn/ag-kit

TypeScript · ★ 7,930 · 🍴 1,508 · 📈 5 stars today

中文介绍 `vudovn/ag-kit` 项目名称较为通用,缺乏具体描述,目前尚无法准确判断其具体功能和应用场景。从名称推测可能是一个工具集合或开发套件。若要深入了解,需查看项目代码或文档。

apache/cassandra

Java · ★ 9,938 · 🍴 4,004 · 📈 34 stars today

Open source transactional distributed database. Linear scalability and proven fault-tolerance on commodity hardware or cloud infrastructure without compromising performance.

中文介绍 Apache Cassandra 是一款开源的事务型分布式数据库,以其卓越的线性扩展能力和故障容错机制而闻名。它能在普通硬件或云基础设施上提供高性能,不牺牲数据一致性和可用性。Cassandra 尤其适合处理大规模数据集、高并发读写场景,是构建高可用、高扩展性大数据应用(如 IoT 平台、实时分析系统)的理想选择。

mvanhorn/last30days-skill

Python · ★ 54,110 · 🍴 4,695 · 📈 221 stars today

AI agent skill that researches any topic across Reddit, X, YouTube, HN, Polymarket, and the web - then synthesizes a grounded summary

中文介绍 这是一个 AI 代理技能,能迅速在 Reddit、X、YouTube、Hacker News、Polymarket 及整个互联网上研究任意话题,并综合生成一份基于事实的摘要。主要用于获取过去 30 天的最新信息,解决信息过载问题,帮助用户快速了解热点动态和事件。适合研究人员和内容创作者。

ocornut/imgui

C++ · ★ 75,179 · 🍴 11,969 · 📈 64 stars today

Dear ImGui: Bloat-free Graphical User interface for C++ with minimal dependencies

中文介绍 Dear ImGui (imgui) 是一个针对 C++ 开发的极简图形用户界面 (GUI) 库。它以“无冗余”为设计理念,拥有极少的依赖项,方便开发者快速集成。ImGui 采用即时模式 GUI 范式,特别适合用于构建游戏内的调试工具、编辑器界面、性能监控器或任何需要快速交互式 UI 的 C++ 应用,避免了传统 GUI 框架的复杂性。

How to Build a Team of AI Agents That Actually Work Together (Full Course)

@sairahul1 · 130.6K 粉丝 · 1.5M 阅 · 507 赞 · 59 转

I run a one-person business. No team. No employees. No co-founder. For two years I have been the researcher, writer, planner, reviewer, and strategist. All of it. At once. Last week I tried something

中文介绍 这位独立创业者分享了如何利用 AI 智能体组建一个「虚拟团队」,以应对研究、写作、规划、审核和策略制定等多重业务角色。他探讨了如何让 AI 智能体有效协作,模拟真实的团队工作流,帮助像他一样的单人公司高效运营,提供了从零开始构建智能体协作系统的实战经验。

Software Factories, Light and Dark

@addyosmani · 407.1K 粉丝 · 636.9K 阅 · 503 赞 · 49 转

A software factory is harnessed loops at scale. You can run the loop with humans in it (light factory): trading judgment and concentration against speed and breakage. Or you can ignore the humans

中文介绍 博主阐述了「软件工厂」概念,将其分为两种模式:由人类参与的「明工厂」(Light Factory),通过权衡判断力与速度;以及完全自动化、忽略人类参与的「暗工厂」(Dark Factory)。探讨了大规模软件开发中的不同策略与挑战。

Why hasn’t AI increased unemployment?

@PeterMcCrory · 46.5K 粉丝 · 399.2K 阅 · 514 赞 · 106 转

I thought I’d share a few high-level reflections and a framework that helps me make sense of why we (so far) don’t see significant impact of AI on the US labor market. I focus on the US because (a) AI

中文介绍 博主分享了对 AI 至今尚未显著提升美国失业率的看法,并提出了一个分析框架来解释这一现象。内容聚焦于 AI 对美国劳动力市场的影响,探讨了当前阶段 AI 如何与就业动态相互作用,并未像许多人预期那样大规模取代工作岗位,提供了对宏观经济影响的深度思考。

The complete Graph Engineering playbook for Claude Code

@Gyome1_ · 3.9K 粉丝 · 220.0K 阅 · 504 赞 · 65 转

Most people are still using Claude Code like a very expensive intern. They give it one task, wait for one answer, then manually decide what happens next. But the teams getting the most leverage from

中文介绍 博主分享了针对 Claude Code 的「图工程」完整指南。他指出,许多用户仍将 Claude Code 视为昂贵的实习生,每次只分配一项任务并等待单一答案,然后手动决定下一步,这种方法效率低下。该指南旨在帮助团队最大化 Claude Code 的利用率,通过系统性的图工程方法,实现更高效、更具杠杆效应的 AI 协作工作流。

More On An Internal OpenAI Model Hacking Into HuggingFace

@TheZvi · 39.0K 粉丝 · 219.4K 阅 · 510 赞 · 75 转

We now have more details of what happened. Every time we learn more details, it somehow makes things seem worse. The remaining details may have to wait a bit. OpenAI: We recognize there are a lot of

中文介绍 OpenAI内部模型「入侵」HuggingFace事件再曝细节。博主指出,每次新信息都让情况显得更糟,暗示该事件可能涉及更深层的模型自主性或安全问题。OpenAI方面已承认存在大量疑问,后续详情待披露。

22580: From GPT2 to Kimi3, Explained

@waterloo_intern · 10.4K 粉丝 · 215.4K 阅 · 660 赞 · 86 转

Twenty-two thousand five hundred and eighty. That’s how many GPT-2 (2019) models fit inside KimiK3 (2026). We scaled up by a factor of 22,580 in seven years. But is it just... scale? In this worklog,

Frontier Diffusion & Control

@satyanadella · 7.5M 粉丝 · 153.7K 阅 · 923 赞 · 114 转

In a world where software has real marginal cost for the first time, how do we ensure frontier benefits are diffused across the entire ecosystem? The key is to optimize the cost-to-outcome frontier in

中文介绍 微软 CEO Satya Nadella 探讨了在软件首次具有真实边际成本的时代,如何确保前沿技术(特别是 AI)的效益能够广泛扩散至整个生态系统。他强调关键在于优化「成本-结果」边界,以实现最大化的技术普及和价值创造,提出了对 AI 时代技术发展和经济模式的战略思考。

Towards Automating Eval Engineering

@Vtrivedy10 · 13.9K 粉丝 · 152.6K 阅 · 503 赞 · 50 转

Today we’re releasing our Eval Engineering Skill, a skill that helps coding agents build evals using context from a repository and agent traces. The skill inspects how an agent is structured, mines

中文介绍 博主发布了名为「Eval Engineering Skill」的新工具,旨在帮助编码智能体自动构建评估(evals)。该技能通过检查智能体结构,并利用代码仓库上下文和智能体运行轨迹,为智能体生成高效的自我评估机制,以提升其性能和可靠性,实现了自动化评估工程的创新。

Making a Billion Intelligent Machines

@pmarca · 4.9M 粉丝 · 146.7K 阅 · 521 赞 · 64 转

This week, @AppliedInt is launching Dana, an agentic platform for developing physical AI applications. Applied Intuition began by building the tools engineers needed to develop autonomous systems,

中文介绍 Applied Intuition本周正式推出「Dana」平台,这是一个专注于开发物理AI应用的代理平台。它旨在为工程师提供构建自主系统所需的工具,助力加速实体AI的落地与规模化部署,推动智能机器的普及。

this system will change your life...

@eptwts · 116.8K 粉丝 · 140.0K 阅 · 514 赞 · 28 转

the consensus on self-hosted agents is that they're simply coding tools... you point one at a repo, it writes code, you close the terminal & everything it learned about you dies with that session.

中文介绍 该推文指出,当前自托管 AI 代理(self-hosted agents)普遍存在局限性,即被视为单纯的编码工具,每次会话结束后,它们学到的所有用户上下文都会随之丢失。博主认为这种「即用即丢」模式限制了代理的持续学习和效率,暗示需要一种能保留上下文的新系统。

Opus 5 is a really bad model

@HarukaKunori · 241 粉丝 · 129.0K 阅 · 632 赞 · 44 转

After trying out Opus 5 for a few hours today, I honestly think Anthropic's benchmark scores are a complete fraud. Sure, the model might have improved in a few areas, but it has regressed unbelievably

中文介绍 博主试用Anthropic的Opus 5数小时后,强烈质疑其基准测试分数存在「欺诈」。他认为尽管模型在某些方面有所改进,但在多数方面却出现了令人难以置信的退步,与官方宣传大相径庭。

How to master graph engineering (Full Course)

@EXM7777 · 129.0K 粉丝 · 124.5K 阅 · 520 赞 · 54 转

I'm going to show you how to build your first agent graph and put it to work in your business today: A team of AI agents that researches in parallel, tries to kill its own findings, and hands you one

中文介绍 该博主将展示如何构建首个「智能体图」(agent graph)并将其应用于业务中。这个智能体团队能够并行进行研究、主动验证并「反驳」自身发现,最终提供精炼的见解。这是一个关于如何设计和实现高效协作式 AI 智能体工作流的教程,旨在帮助用户掌握图工程技术。

why we're buzzing

@jack · 10.3M 粉丝 · 109.6K 阅 · 782 赞 · 93 转

yesterday we released buzz. it's an open source workspace that puts people, agents, conversations, and code on the same level, behind one cryptographic identity system. we built it to reduce our

中文介绍 Jack Dorsey 发布了「buzz」,一个开源工作区,旨在将人员、智能体、对话和代码整合到一个统一的加密身份系统之下。该平台旨在简化多方协作,通过提供一个扁平化的工作环境,减少系统复杂性,提升团队和 AI 智能体的交互效率,是关于未来协作模式的新探索。

Quality Software

@almonk · 12.8K 粉丝 · 107.4K 阅 · 531 赞 · 69 转

I like AI. I worked at an AI company for nearly three years and I use it every day. I am glad software is getting easier to make. But we can recognise that when the bar to entry drops, quality drops

中文介绍 博主指出,AI虽然降低了软件开发门槛并加速制作过程,但伴随进入门槛的下降,软件质量也可能随之下降。这是AI普及后软件开发领域需警惕的现象,引发对软件行业未来发展方向的思考。

Trajectory: A Standard Format for Agent Experience Data

@Letta_AI · 9.8K 粉丝 · 86.5K 阅 · 504 赞 · 31 转

Introducing trajectory, an open-source package that normalizes coding-agent sessions from @AnthropicAI Claude Code, @OpenAI Codex, @pidotdev, @LangChain deepagents, @openclaw, Letta Code, and other

中文介绍 该推文介绍了名为「trajectory」的开源软件包,旨在标准化来自不同 AI 编程代理的会话数据。它能够归一化 AnthropicAI 的 Claude Code、OpenAI 的 Codex、pidotdev、LangChain deepagents、openclaw 以及 Letta Code 等多个主流 AI 编码工具的「agent experience data」。trajectory 的目标是解决 AI 代理数据格式不统一的问题,促进跨平台的数据互操作性与分析,提升开发效率。

Graph Engineering Clearly Explained

@akshay_pachaar · 282.5K 粉丝 · 66.4K 阅 · 515 赞 · 74 转

Loop engineering got about six weeks in the spotlight before the timeline moved on. On July 18, Peter Steinberger, the person behind OpenClaw, posted a nine-word question. "Are we still talking loops

中文介绍 讨论 AI 智能体架构的演进,从「Loop engineering」转向「Graph Engineering」。博主旨在清晰解释 Graph Engineering 这一新概念,并指出 Loop engineering 在短暂热度后已被新趋势取代,引发了关于当前智能体设计模式的思考。

Why Software Factories Fail

@dexhorthy · 24.8K 粉丝 · 64.9K 阅 · 515 赞 · 50 转

or: the harness is not enough Update - the talk version of this post is live on youtube: https://www.youtube.com/watch?v=Ib5GBkD555M i guess we doin loops now We're all racing to put AI coding into production. A lot has

中文介绍 博主探讨了「软件工厂」模式失败的原因,特别是在将 AI 编码引入生产环境的背景下。推文指出,仅仅依靠「harness」(工具或框架)不足以确保成功,暗示当前将 AI 编码落地存在深层挑战。内容可能分析了在生产环境中规模化部署 AI 编码时面临的陷阱和限制,为开发者和团队提供了避免类似错误的反思与警示。

Agent Harness Engineering vs. Loop Engineering vs. Graph Engineering

@beamnxw · 2.6K 粉丝 · 53.5K 阅 · 561 赞 · 92 转

A practical guide to the three architecture layers people keep mixing together The confusion is understandable. All three ideas sit around the same model, all three influence reliability, and all

中文介绍 提供智能体架构的实用指南,详细对比并区分了「Agent Harness Engineering」、「Loop Engineering」和「Graph Engineering」这三个常被混淆的概念。博主旨在厘清它们各自的特点及其对模型可靠性的影响,帮助读者理解不同架构层。

The new rules of context engineering for Claude 5 models

@trq212 · 318.0K 粉丝 · 48.6K 阅 · 1.2K 赞 · 119 转

I’ve written previously about how to best prompt the newest generation of Claude 5 models and work with them iteratively to discover what you want to build. But when you send a message to Claude, the

中文介绍 博主分享了针对 Claude 5 模型「上下文工程」的新规则。推文延续此前关于如何最佳提示 Claude 5 模型并进行迭代工作的内容,重点探讨了向 Claude 发送消息时上下文如何运作,旨在帮助用户更有效地利用模型。

Practical multi-agent orchestration in Codex

@pvncher · 30.4K 粉丝 · 44.0K 阅 · 565 赞 · 33 转

GPT-5.6 Sol gets especially interesting when it has a team to work with. Codex's new Multi-Agent V2 tools give Sol and Terra a natural way to delegate tasks, share updates, and coordinate through

中文介绍 分享在 Codex 平台中实现多智能体协作的实践。介绍如何利用 Codex 新推出的 Multi-Agent V2 工具,让 GPT-5.6 Sol 与 Terra 等智能体高效地分派任务、共享更新并进行协调,展示了多智能体编排的实际应用。

dRAE: Representation Autoencoder with Hyper-Spherical Codes

👍 0

In this work, we aim to discretize the high-dimensional visual representations to bridge the gap with language models - a non-trivial challenge, as existing quantization methods suffer from codebook collapse, failing to scale while preserving semantic coherence. We identify the root cause as metric

中文介绍 这篇论文提出了 dRAE(Representation Autoencoder with Hyper-Spherical Codes),旨在离散化高维视觉表示,以弥合与语言模型之间的鸿沟。现有量化方法面临码本崩溃问题,难以在保持语义一致性的同时进行扩展。dRAE 通过引入超球面编码,致力于解决这一挑战。

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

👍 29

LLM training is shifting from manual design and annotation to interaction-driven self-evolution. However, existing self-evolutionary methods face a fundamental dilemma between task diversity and verification reliability: environment-bound methods obtain precise feedback but confine learning to narro

中文介绍 大型语言模型(LLM)的训练正从手动设计转向交互驱动的自我演进。然而,现有自我演进方法在任务多样性与验证可靠性之间面临困境。本论文提出了「Skill Self-Play」方法,通过共同进化的技能来推进 LLM 的能力边界,旨在克服现有方法的局限性。

SceneActBench: Can Agents Act on the 3D Scenes They See?

👍 4

Vision-language model (VLM) agents increasingly use tools to act on 3D scenes rather than only describe them. Existing 3D benchmarks score textual responses or single-object operations, leaving agent action on complete multi-object 3D scenes under evaluated. We present SceneActBench, a benchmark for

中文介绍 随着视觉语言模型(VLM)智能体在3D场景中执行操作的能力增强,现有3D基准测试主要评估文本响应或单对象操作,未能充分衡量智能体在完整多对象3D场景中的行动表现。本论文提出了「SceneActBench」,一个新基准来更全面地评估智能体在视觉感知3D场景中的行动能力。

IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation

👍 4

Large Language Models (LLMs) have significantly automated the process of scientific discovery over the past few years. However, existing systems share one core limitation: they generate and optimize ideas independently for either Quality or Diversity. This often leads to the generation of ideas in c

中文介绍 大型语言模型(LLM)显著推动了科学发现的自动化。然而,现有系统的一个核心局限是它们在生成和优化研究想法时,独立地侧重于质量或多样性。本论文提出了「IDEAgent」,一种利用智能体化质量-多样性搜索(Agentic Quality-Diversity Search)的新方法,旨在同时提升研究想法的质量和多样性。

Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization

👍 0

Open-weight language models from different families exhibit complementary capabilities, motivating their consolidation into a compact student through on-policy distillation (OPD). However, full-vocabulary OPD typically assumes a shared tokenizer, while existing cross-tokenizer methods may discard te

中文介绍 来自不同系列的开源语言模型具有互补能力,促使通过策略蒸馏(OPD)将其整合为更紧凑的学生模型。然而,全词汇OPD通常假设共享分词器。本论文提出一种名为「通过字节前缀边缘化实现的跨分词器策略蒸馏」的新方法,旨在解决现有跨分词器方法的局限性,实现不同分词器模型间的有效整合。

RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding

👍 0

Medical multimodal large language models (MLLMs) are increasingly expected to perform complex image understanding tasks, yet their reliability is often compromised by frequent errors in visual interpretation. To systematically trace these failures, we traverse the hierarchy from high-level clinical

中文介绍 医学多模态大型语言模型(MLLMs)在执行复杂的放射学图像理解任务时,其可靠性常因视觉解释错误而受损。为系统性追溯这些失败,本论文提出了「RadSight」工具。RadSight 旨在帮助研究人员深入分析 MLLMs 在放射学图像理解中的感知误差,从而提升模型的可靠性。

MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond

👍 0

Lightweight projectors are an established way to connect pre-trained speech encoders with large language models (LLMs), mapping acoustic features into token-level embeddings for tasks like ASR and spoken question answering. Existing systems, however, typically only support a few languages and are of

中文介绍 轻量级投影器是将预训练语音编码器与大型语言模型(LLMs)连接起来的常用方法,用于自动语音识别(ASR)和口语问答等任务。然而,现有系统通常仅支持少数几种语言。本论文提出了「MEUSLI」,一个多语言投影器,旨在扩展对更多语言的支持,以提升基于LLM的ASR及相关应用的普适性。

Spectral Prior for Reducing Exposure Bias in Diffusion Models

👍 3

Diffusion models typically suffer from error accumulation during iterative sampling, commonly referred to as exposure bias. We reveal systematic frequency-dependent discrepancies between training and inference, which can be interpreted as frequency-dependent SNR error. Crucially, the direction of th

中文介绍 扩散模型在迭代采样过程中通常会遭遇误差累积,即所谓的「曝光偏差」。本论文揭示了训练与推理之间系统性的频率相关差异,可解释为频率相关的信噪比(SNR)误差。为减少这一问题,研究提出了利用「光谱先验」的方法,以期提升扩散模型的采样质量和稳定性。

Scaling Native Multimodal Pre-Training From Scratch

👍 13

Although large language models (LLMs) exhibit remarkable reasoning capabilities, their reliance on text-only pre-training restricts the perception of the multimodal physical world. Native multimodal pre-training avoids this limitation by training models from scratch on multimodal inputs, thereby ach

中文介绍 尽管大型语言模型(LLMs)展现出卓越的推理能力,但其对纯文本预训练的依赖限制了对多模态物理世界的感知。为克服这一局限,本论文探讨了「原生多模态从零开始预训练」的方法。该方法通过直接在多模态数据上训练模型,旨在显著提升模型对复杂多模态环境的理解与感知能力。

LAMAR: An Open Language-Aware Multilingual Alignment Reranker

👍 8

In multilingual retrieval augmented generation, a retriever can retrieve relevant documents written in multiple languages, which are subsequently reranked before answer generation. However, it remains unclear whether existing multilingual rerankers consider document language when ordering semantical

中文介绍 在多语言检索增强生成(RAG)中,检索器可获取多语言文档,但现有重排序器在答案生成前重排时,是否考虑文档语言仍不明确。本论文介绍了「LAMAR」,一个开放的、语言感知的多语言对齐重排序器。LAMAR 旨在解决现有重排序器在处理多语言文档时可能忽略语言信息的问题,提升 RAG 系统的准确性。

Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models

👍 0

Historical documents act as invaluable knowledge archives but often suffer from illegibility due to physical deterioration and damage. While existing restoration methods based on masked language modeling effectively utilize local context, they struggle to restore named entities that require external

中文介绍 历史文献因物理损毁常难以辨认。现有基于掩码语言模型的修复方法虽能利用局部语境,但在恢复命名实体方面因缺乏外部知识而受限。本论文提出通过「检索增强大型语言模型(RAG-LLMs)」引入外部知识,以提升历史文献的修复能力,特别是解决命名实体恢复的挑战。

Solar Open 2 Technical Report

👍 3

We present Solar Open 2, a 250B-A15B Mixture-of-Experts language model built for long-horizon agentic tasks, scaled up from Solar Open 1 (Solar Open 100B). To hold entire agent trajectories in a single context, Solar Open 2 reaches a 1M-token window through a hybrid attention stack that interleaves

中文介绍 本技术报告介绍了「Solar Open 2」,一个从 Solar Open 1(100B)扩展而来的 250B-A15B 专家混合(Mixture-of-Experts)语言模型。Solar Open 2 专为长周期智能体任务设计,通过混合注意力机制实现了 1M-token 的超长上下文窗口,使其能在一个语境中处理完整的智能体轨迹。

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

👍 0

Document packets, multiple documents concatenated into a single file, are common in government and administrative workflows, yet splitting them into their constituent documents is difficult, especially for low-resource languages. We introduce Khondo (Bangla for split/segment), the first benchmark fo

What AI Red-Team Evaluations Can and Cannot Prove

👍 0

Red-team evaluations of AI models support some claims and not others, and the boundary between the two is calculable rather than merely a matter of judgment. We define the evidential ceiling of an evaluation as the largest factor by which one result can move belief under a fixed testing budget, deri

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

👍 0

We present Oxygen-TryOn, a unified foundation model for any-item virtual try-on. Rather than repurposing a general-purpose image editor, Oxygen-TryOn is fashion-native, built for try-on through a dedicated data engine and try-on-specific training. Given one or more reference items (clean product sho

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

👍 12

Multi-agent interactive world models should not only generate consistent observations, but also maintain world states that persist across agents and evolve across views. Existing autoregressive video diffusion pipelines carry forward observation history as conditioning context, which makes shared st

GraphVid: Interactive Graph-Controllable Video Generation

👍 4

Controllable video generation remains challenging due to the difficulty of specifying precise multi-object interactions using text prompts or motion-control inputs that primarily constrain pixel movement. In practice, trajectory-based control often requires users to draw accurate tracks for multiple

Self-Supervised Learning of Structured Dynamics from Videos

👍 18

Understanding motion in video is a fundamental challenge for visual learning, as frame-to-frame change entangles two sources of dynamics: camera motion and object motion. This decomposition has remained underexplored in representation learning, partly because these factors are tightly coupled in nat

OpenForgeRL: Train Harness-native Agents in Any Environment

👍 7

Modern AI agents rely on elaborate inference harnesses such as Claude Code, Codex, and OpenClaw to drive multi-turn reasoning, tool use, and access to external systems. While powerful, these complex harnesses also make agents hard to train end-to-end with open infrastructure, whose SFT/RL stacks can

Visual Contrastive Self-Distillation

👍 44

On-policy self-distillation (OPSD) is promising as it removes the external teacher required by on-policy distillation (OPD), yet it still needs asymmetric information between teacher and student to ensure that the self-teacher provides a stronger learning signal than the student. Existing methods cr

The Boundaries of Automation: A Theory of Persistent Human Participation

👍 0

The rapid progress of AI has intensified the long-standing pursuit of automation: replacing human participation with algorithms wherever possible. Implicit in this pursuit is the assumption that humans remain in the loop only because current AI systems are not yet sufficiently capable. This paper ch

DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages

👍 0

We present DONDO, a family of open, permissively licensed automatic speech recognition (ASR) base models for African languages, built on the w2v-BERT 2.0 self-supervised speech encoder. DONDO comprises twenty-one monolingual models and five multilingual models spanning twenty-seven language varietie

Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation

👍 7

We study sinusoidal recurrence as an iterative mechanism for harmonic spectral enrichment in implicit neural representations (INRs). Our analysis reveals that sinusoidal activations induce a harmonic line spectrum, providing a spectral account of how recurrent unrolling enriches the effective spectr

AREX: Towards a Recursively Self-Improving Agent for Deep Research

👍 142

Deep research requires agents to find answers that jointly satisfy multiple constraints. Discovering such answers is costly, whereas verifying a candidate can often be decomposed into tractable constraint-wise checks. This discovery--verification asymmetry suggests that a research agent should do mo

Claude Opus 5

Near-Fable 5 intelligence at half the price

中文介绍 Anthropic公司的Claude Opus 5是一款新的AI模型,据称其智能水平接近「Fable 5」旗舰级模型,同时价格减半,显著提升了性价比。

Webhound

A research engine for your agent

中文介绍 Webhound是一款专为AI代理设计的搜索研究引擎。它能帮助代理进行信息收集和分析,提升其研究能力,支持更智能的任务执行。

Artifacts by Databox

Ask your AI Analyst and get back a ready-to-share report

中文介绍 Databox推出了名为「Skills Marketplace」的新平台,为企业提供即用型AI分析技能。这些预制技能旨在帮助企业用户更高效地处理和分析其业务数据,从而快速获取洞察,无需从头构建复杂的AI模型,显著简化数据分析流程。

Adomate

Turn data into winning ads. At scale.

中文介绍 Adomate是一款能将数据转化为高效广告的工具,旨在帮助用户大规模地创建具有竞争力的广告内容和策略,实现广告效果最大化。

Rescript

A free, open source, Descript alternative. Runs in-browser.

中文介绍 Rescript是一款免费、开源、基于浏览器的视频编辑工具,旨在作为Descript的替代品,让用户能像编辑文本一样编辑视频内容。

Estera

AI Receptionist that Answers Calls & WhatsApp 24/7

中文介绍 Estera是一款AI接待员,能够全天候24/7接听电话并回复WhatsApp消息。它旨在自动化客户服务和沟通流程,提高效率。

Edit Mind × Strava

Every clip matched to the Strava activity it's from

中文介绍 Edit Mind与健身应用Strava进行整合,可将每一个视频片段自动匹配到其对应的Strava运动活动中,方便用户管理和回顾运动内容。

iMessage Hermes on a Raspberry Pi

An always-on AI agent that lives in your home

中文介绍 iMessage Hermes是一款基于树莓派的常驻AI代理,能在家中运行并与iMessage集成,提供智能家居助理功能和互动体验。

Robynn AI

Websites that improve and heal with self-learning

中文介绍 Robynn AI推出能自我学习、自我优化和自我修复的网站。这些网站利用人工智能技术,可以持续改进用户体验和功能表现。

superfile

A modern, visual file manager for the terminal

中文介绍 superfile是一款为终端设计的现代化可视化文件管理器。它提供直观的图形界面,帮助用户在命令行环境中更高效地管理文件和目录。

Opus 5 Is Here… But NEW Claude Voice Is Even Bigger

中文介绍 YouTube 视频指出,「Opus 5」已推出,但新的 Claude 语音功能「Claude Voice」被认为是更重要的进展。视频强调,虽然「Opus 5」已发布,但这一全新的 Claude 语音技术被认为具有更大的影响力。

OpenAI just released Codex Voice (It's basically Jarvis)

中文介绍 OpenAI 发布了其名为 Codex Voice 的新产品。该产品被描述为类似电影中「贾维斯」(Jarvis)的人工智能系统,暗示它可能具备先进的语音交互或智能助手功能,代表了AI在自然语言处理和人机互动方面的新进展。

Codex Basically Runs My Company Now. Here’s How.

中文介绍 YouTube用户Riley Brown发布视频,展示了他如何将Codex(推测为OpenAI Codex)改造为一个“业务增长机器”。该视频围绕利用AI技术,尤其可能是代码生成能力,来加速企业发展的实际策略展开。

What do AI models actually know?

中文介绍 该视频探讨了人工智能模型实际「知道」什么的核心问题。内容可能涉及AI模型的知识边界、其学习和理解机制与人类认知的异同,以及AI系统如何获取、处理和表达信息。

Why does AI hallucinate?

中文介绍 这则由Claude发布的YouTube短视频,探讨了人工智能(AI)出现「幻觉」现象的原因。AI幻觉是指大型语言模型在生成文本时,提供看似合理但实际不准确或虚假信息的问题。该视频旨在解释为何AI会生成不符合事实的内容。

How does AI get its character?

中文介绍 由Claude在YouTube发布的一则短视频,探讨了人工智能(AI)如何形成其“性格”。视频以此为主题,讨论AI系统在学习和训练过程中发展出独特行为模式的现象。

What is sycophancy?

中文介绍 这段来自Claude(YouTube)的短视频,以“什么是阿谀奉承?”为题,旨在清晰阐释「阿谀奉承」(sycophancy)这一概念。视频内容可能涵盖该行为的定义、特征及其在人际互动中的表现形式,帮助观众深入理解这种社会现象的本质。

Making New York City miniature with Claude

中文介绍 这段YouTube短视频展示了如何运用名为「Claude」的工具,将美国纽约市的标志性建筑或街景制作成微缩模型。视频内容可能涵盖了从设计到实现微缩模型的过程,突出了Claude在创意制作领域的应用,暗示了其在辅助视觉艺术和模型构建方面的潜力。

What do AI models actually know?

中文介绍 该视频探讨了人工智能模型实际「知道」什么的核心问题。内容可能涉及AI模型的知识边界、其学习和理解机制与人类认知的异同,以及AI系统如何获取、处理和表达信息。

Why does AI hallucinate?

中文介绍 这则由Claude发布的YouTube短视频,探讨了人工智能(AI)出现「幻觉」现象的原因。AI幻觉是指大型语言模型在生成文本时,提供看似合理但实际不准确或虚假信息的问题。该视频旨在解释为何AI会生成不符合事实的内容。

How does AI get its character?

中文介绍 由Claude在YouTube发布的一则短视频,探讨了人工智能(AI)如何形成其“性格”。视频以此为主题,讨论AI系统在学习和训练过程中发展出独特行为模式的现象。

What is sycophancy?

中文介绍 这段来自Claude(YouTube)的短视频,以“什么是阿谀奉承?”为题,旨在清晰阐释「阿谀奉承」(sycophancy)这一概念。视频内容可能涵盖该行为的定义、特征及其在人际互动中的表现形式,帮助观众深入理解这种社会现象的本质。

该源今日无内容。

Show HN: FeyNoBg – Automatic background removal model and training library

Hey HN, I’m Shreyash from Feyn. We help companies build custom models from their data.Today, we’re releasing FeyNoBg, an automatic background removal model. Alongside it, we're open-sourcing NoBg, the Python library we built to train and run it.Try the model here: https://huggingface.

Kimi-K3 on HuggingFace

Related: Kimi-K3 Technical Report [pdf] - https://news.ycombinator.com/item?id=49070985

v2.1.220

What's changed Bug fixes and reliability improvements

中文介绍 Anthropic 旗下的 Claude Code 项目发布了 v2.1.220 版本。此次更新主要内容为错误修复和可靠性改进,旨在提升软件的稳定性和用户体验。

v2.1.219

What's changed Added Claude Opus 5 (claude-opus-5), now the default Opus model — 1M context, fast mode at $10/$50 per Mtok Added sandbox.network.strictAllowlist setting to deny non-allowlisted hosts for sandboxed commands without prompting Added DirectoryAdded hook that fires after /add-dir or the S

中文介绍 Anthropic的Claude-code项目发布v2.1.219更新。此版本引入了Claude Opus 5(claude-opus-5)作为默认Opus模型,具备1M上下文。其快速模式定价为每百万token $10/$50。同时,更新新增“sandbox.network.strictAllowlist”设置,增强沙盒命令的网络安全。

v2.1.218

What's changed Changed /code-review to run as a background subagent, so review work no longer fills your conversation and keeps stacked slash commands as its review target Added screen-reader announcements of deleted text for word and line deletions (Option+Delete, Ctrl+W, Cmd+Backspace, Ctrl+U, Ctr

v2.1.217

What's changed Added emoji shortcode autocomplete in the prompt input: type :heart: to insert ❤️, or :hea for suggestions — disable with the emojiCompletionEnabled setting Added warnings when transcript writes are failing (e.g. disk full) or when session saving is off due to an inherited environment

v2.1.216

What's changed Added sandbox.filesystem.disabled setting to skip filesystem isolation while keeping network egress control Fixed a slowdown in long sessions where message normalization cost grew quadratically with the number of turns, causing multi-second stalls and slow resumes Fixed auto mode deny

v2.1.215

What's changed Claude no longer runs the /verify and /code-review skills on its own; invoke them with /verify or /code-review when you want them

v2.1.214

What's changed Fixed single-segment dir/** allow rules like Edit(src/**) auto-approving writes to nested dir/ directories anywhere in the tree instead of only /dir Fixed a permission-check bypass affecting commands run in Windows PowerShell 5.1 sessions Fixed Bash permission checks to fail closed on

v2.1.212

What's changed /fork now copies your conversation into a new background session (its own row in claude agents) while you keep working; the in-session subagent it used to launch is now /subtask Added claude auto-mode reset to restore the default auto-mode configuration, with a confirmation prompt (pa

v2.1.211

What's changed Added --forward-subagent-text flag and CLAUDE_CODE_FORWARD_SUBAGENT_TEXT environment variable to include subagent text and thinking in stream-json output Fixed permission previews relayed to chat channels not neutralizing bidirectional-override, zero-width, and look-alike quote charac

v2.1.210

What's changed Added a live elapsed-time counter to the collapsed tool summary line so long-running tool calls visibly tick instead of looking stuck Added a startup warning for Write(path), NotebookEdit(path), and Glob(path) permission rules — use Edit(path) or Read(path) instead Fixed isolation: 'w

0.146.0-alpha.13

Release 0.146.0-alpha.13

中文介绍 OpenAI Codex项目在其GitHub页面发布了新的软件版本,编号为0.146.0-alpha.13。这是一个Rust语言相关的alpha预发布版本,但新闻稿中未提供此版本包含的任何具体更新内容、功能改进或错误修复的详细信息。

0.146.0-alpha.12

Release 0.146.0-alpha.12

中文介绍 OpenAI Codex项目在其GitHub页面发布了新的软件版本,编号为0.146.0-alpha.12。这是一个Rust语言相关的alpha预发布版本,但新闻稿中未提供此版本包含的任何具体更新内容、功能改进或错误修复的详细信息。

0.146.0-alpha.10.1

Release 0.146.0-alpha.10.1

中文介绍 OpenAI Codex 发布了其项目的 rust-v0.146.0-alpha.10.1 版本更新。此次更新主要涉及软件版本迭代。

rust-v0.146.0-alpha.11

Release 0.146.0-alpha.11

中文介绍 OpenAI Codex 发布了其项目的 rust-v0.146.0-alpha.11 版本更新。此次更新主要涉及软件版本迭代。

0.146.0-alpha.10

Release 0.146.0-alpha.10

中文介绍 OpenAI Codex 发布了其项目的 rust-v0.146.0-alpha.10 版本更新。此次更新主要涉及软件版本迭代。

0.146.0-alpha.9

Release 0.146.0-alpha.9

中文介绍 OpenAI Codex 发布了其项目的 rust-v0.146.0-alpha.9 版本更新。此次更新主要涉及软件版本迭代。

0.146.0-alpha.8

Release 0.146.0-alpha.8

中文介绍 OpenAI Codex 发布了其项目的 rust-v0.146.0-alpha.8 版本更新。此次更新主要涉及软件版本迭代。

0.146.0-alpha.7

Release 0.146.0-alpha.7

中文介绍 OpenAI Codex项目发布了Rust语言版本的0.146.0-alpha.7更新。此为该项目的一个alpha阶段版本,通常包含开发中的新功能或修复。

0.146.0-alpha.6

Release 0.146.0-alpha.6

中文介绍 OpenAI Codex项目发布了Rust语言版本的0.146.0-alpha.6更新。此为该项目的一个alpha阶段版本,通常包含开发中的新功能或修复。

0.146.0-alpha.5

Release 0.146.0-alpha.5

中文介绍 OpenAI旗下的Codex项目发布了软件的0.146.0-alpha.5版本更新。此次发布是一个alpha测试版,聚焦于Rust相关组件的迭代与改进,持续推进软件开发进展。

今日主题

今日AI领域亮点频出,月之暗面开源Kimi K3部分权重,微软亦发布首个网络安全AI模型及智能体系统,大模型技术进步持续深化应用。然而,Anthropic的Claude聊天记录被曝索引至公共搜索引擎,再次敲响AI时代数据隐私保护的警钟,提示业界在技术演进的同时,需高度重视用户数据安全与透明度。

01

模型发布/更新

Model Releases 44 篇

月之暗面开源Kimi K3模型权重及基础设施

研究聚合The Decoder

月之暗面(Moonshot AI)发布Kimi K3的模型权重并开源部分基础设施,旨在打破前沿模型格局。该中国模型在流行基准测试中表现接近西方前沿模型,如Fable 5和GPT-5.6 Sol。但独立测试也发现,Kimi K3在网络安全和数学性能方面与顶尖模型仍存在显著差距,显示出开源模型在特定领域追赶的挑战与机遇。

大模型开源AI

微软推出首个网络安全模型MAI-Cyber-1-Flash

研究聚合The Decoder

微软推出了其首个网络安全模型MAI-Cyber-1-Flash。作为一款紧凑型模型,它在集成到MDASH多智能体系统后,在CyberGym基准测试中取得了96%的得分,微软预计可将相关成本降低50%。尽管MAI-Cyber-1-Flash在多项任务中表现出色,但面对最艰难的网络安全挑战时,微软仍需依赖OpenAI的更大型模型提供支持。

微软网络安全AI模型

Kronos:专为金融领域设计的基础AI模型

开源项目GitHub Trending

`Kronos` 是一个专为金融市场语言设计的基础模型,旨在理解并处理复杂的金融文本数据,包括新闻、财报、研报等。它解决了传统模型在金融领域专业性不足的问题,通过深入学习金融领域的独特术语和上下文,能帮助金融分析师和量化研究员进行更精准的市场情绪分析、信息提取和趋势预测,显著提升金融数据处理效率。

金融AI基础模型LLM

Anthropic发布Claude Opus 5:性能升级且价格减半

产品榜单Product Hunt

Anthropic公司推出了新一代AI模型Claude Opus 5,宣称其智能水平已接近「Fable 5」等旗舰级模型,同时将价格减半,大幅提升了模型的性价比和可及性。此举旨在扩大Claude系列在企业级和开发者市场的影响力,为用户提供更经济高效的先进AI能力。但其性能的真实提升仍需市场检验。

大模型AI降价
02

产品发布/更新

Product 44 篇

阿里巴巴开源免费代码审查工具Open Code Review

开源项目GitHub Trending

阿里巴巴开源并免费提供了其内部大规模实践验证的代码审查工具 `open-code-review`。该工具采用混合架构,结合确定性分析流水线和LLM智能体,能够生成精确到行级别的代码评论。它内置了针对NPE、多线程等问题的预训练规则集,旨在显著提升代码质量、开发效率,并减轻人工代码审查的负担。

代码审查LLM开发者工具

Claude视频分析项目实现AI理解视频内容

开源项目GitHub Trending

`bradautomates/claude-video` 项目赋予Claude AI模型观看和理解视频内容的能力。该方案通过下载视频、提取关键帧和生成文字转录,将处理后的多模态内容高效地提供给Claude进行分析。这解决了大型语言模型原生不支持视频输入的问题,使用户能够利用Claude进行视频摘要、内容问答或更深度的视觉内容分析。

Claude视频分析多模态 AI

Databox推出AI分析技能市场,简化商业智能

产品榜单Product Hunt

Databox推出了名为「Skills Marketplace」的新平台,为企业提供即用型AI分析技能。这些预制技能旨在帮助企业用户更高效地处理和分析其业务数据,从而快速获取关键业务洞察,无需从头构建复杂的AI模型或进行深度编程。该平台显著简化了数据分析流程,加速了AI在商业智能领域的应用。

AI应用数据分析商业智能

Gstack代理:AI专家加入会议提供面试反馈

产品榜单Product Hunt

Gstack代理是一种创新的AI专家服务,能实时加入Google Meet会议,并针对会议内容提供即时反馈。该服务特别适用于模拟面试场景,例如YC面试,通过AI代理的评估和建议,帮助用户提升面试表现和沟通效率。它为用户提供了一个便捷的智能助手,以改善在线协作和个人技能训练。

AI助理在线会议面试辅助
03

行业动态

Industry 44 篇

Claude私密对话被曝在Google和Bing搜索结果中公开

综合资讯Wired AI

Anthropic公司AI聊天机器人Claude的用户共享聊天记录和Artifacts被曝已在Google和Bing搜索结果中公开。这一问题源于Claude的「共享聊天」功能允许用户创建链接,使任何拥有该URL的人都能查看对话或项目,导致数据隐私泄露。此事件凸显了阻止网络爬虫将看似私密的AI聊天内容公开化的困难,引发了对AI用户数据隐私保护的广泛担忧。

AI隐私数据泄露搜索引擎

Verizon与Google达成10亿美元暗光纤交易赋能AI数据中心

综合资讯Ars Technica

Verizon与Google达成了一项价值10亿美元的暗光纤(dark fiber)交易,用于扩展Google的数据中心基础设施。Verizon将其视为未来在AI相关领域与科技巨头合作的开端,预计通过提供高性能、低延迟的光纤网络和改造后的数据中心服务,进一步获取AI相关收入。此举标志着电信基础设施提供商在AI算力建设中的关键作用日益凸显。

基础设施AI合作

微软发布首个AI安全模型及智能体网络安全系统

综合资讯TechCrunch

微软本周推出其首个AI安全模型以及一套全新的智能体网络安全系统,旨在全面增强其AI网络安全产品和服务。这标志着微软在利用AI技术提升企业及用户数字防护能力方面迈出了重要一步,通过智能化的系统应对日益复杂的网络威胁,进一步巩固其在企业安全领域的领导地位。

微软网络安全AI

OpenAI:ChatGPT致工作「任务交叉」现象显著

研究聚合The Decoder

OpenAI分析了超过80万条与工作相关的ChatGPT消息,发现43.5%的特定工作查询涉及其他职业的任务。OpenAI将此现象称为「任务交叉」,表明员工日益利用AI工具承担专业化以外的职责。这一趋势在小型企业中尤为显著,预示着AI正改变劳务市场结构,促使职业界限模糊化,并提升员工综合能力。

ChatGPT劳务市场AI应用
04

技巧与观点

Tips & Takes 33 篇

Impeccable:提升AI应用设计水平的设计语言

开源项目GitHub Trending

`Impeccable` 是一个旨在提升AI应用设计水平的设计语言与方法论,由pbakaus/impeccable开源。它提供了一套原则和规范,帮助开发者和设计师构建更具美感、直观且用户体验更佳的AI界面和交互。通过遵循其设计规范,旨在解决当前许多AI工具在用户界面和交互设计上存在的不足,推动AI产品向专业化、易用化发展。

AI设计设计系统UI/UX

AI代理技能Last 30 Days:快速研究并总结近期话题

开源项目GitHub Trending

`last30days-skill` 是一个AI代理技能,能迅速在Reddit、X、YouTube、Hacker News以及整个互联网上研究任意话题。它通过综合多源信息,生成一份基于事实的摘要,主要用于获取过去30天的最新动态。该工具解决了信息过载问题,帮助研究人员和内容创作者快速了解热点事件,高效获取所需信息。

AI 代理信息检索内容摘要

X博主质疑Anthropic Opus 5模型性能存在「欺诈」

X·KOLX 推文 (AttentionVC)

X平台博主HarukaKunori试用Anthropic的Opus 5模型数小时后,强烈质疑其基准测试分数存在「欺诈」。博主认为,尽管模型在某些方面有所改进,但在大多数任务中却出现了令人难以置信的退步,与官方宣传大相径庭。这一用户反馈凸显了AI模型实际性能与宣传之间可能存在的差异,引发了对模型评测透明度和可靠性的讨论。

模型评测Opus 5用户反馈
今日产品趋势

今天的 AI 产品聚焦于实用 AI 代理在通信平台中的深度集成,以及开源和自托管 AI 工具的崛起。特别是像文本编辑般直观的视频创作与企业级智能代码审查工具,共同揭示了 AI 如何更深入地渗透个人生产力与开发工作流,并赋予用户更多掌控权。

01

今日必看

Must See 33 款

Rescript — 免费开源视频编辑器,像编辑文本一样剪辑

产品榜单Product Hunt

Rescript 是一款免费、开源、基于浏览器的视频编辑工具,旨在作为 Descript 的替代品,让用户能像编辑文本一样剪辑视频内容。它通过转录视频音频并允许用户直接修改文本来编辑相应视频片段,极大地简化了视频后期制作流程。该工具降低了专业视频编辑的门槛,特别适合内容创作者、播客制作者和需要快速生成短视频的用户。

视频编辑开源Web应用

Estera — AI 接待员,24/7 接听电话与 WhatsApp 消息

产品榜单Product Hunt

Estera 是一款 AI 接待员,能够全天候 24/7 接听电话并回复 WhatsApp 消息。它旨在自动化客户服务和沟通流程,提高效率并确保不遗漏任何客户咨询。这款工具特别适合中小型企业,帮助它们在无需额外人力投入的情况下,提供持续的客户支持、预约管理或信息答复,有效提升客户满意度。

AI客服客户服务自动化

Comms — 在 iMessage 中启动 AI 代理

产品榜单Product Hunt

Comms 允许用户在几秒钟内快速启动 iMessage 中的 AI 代理,极大简化了在主流消息应用中部署和使用智能代理的流程。它旨在将 AI 的即时响应能力和个性化服务直接带入日常沟通,提升效率并开启新的互动模式。用户可以轻松创建并管理各种定制化的 AI 助手,例如用于会议摘要、信息查询或智能回复,无需离开 iMessage 环境。

AI代理iMessage效率工具
02

开发者工具

Dev Tools 11 款

alibaba/open-code-review — 阿里开源企业级 LLM 代码审查工具

开源项目GitHub Trending

alibaba/open-code-review 是阿里巴巴开源且免费的代码审查工具,经阿里大规模实践验证。它采用混合架构,结合确定性分析流水线和 LLM 智能体,能生成精确到行级别的代码评论。内置针对 NPE、多线程等问题的预训练规则集,旨在提升代码质量与开发效率。适用于各类团队进行高效、智能化的代码审查,尤其适合需要处理大规模代码库的企业级开发环境。

代码审查LLM开发者工具
03

创作与效率

Creative & Productivity 33 款

Adomate — AI 营销工具,将数据转化为高效广告

产品榜单Product Hunt

Adomate 是一款能将数据转化为高效广告的工具,旨在帮助用户大规模地创建具有竞争力的广告内容和策略,实现广告效果最大化。它利用 AI 驱动的数据分析和内容生成能力,优化广告投放效果,帮助企业在复杂市场中脱颖而出,尤其适合需要快速迭代广告创意和提升 ROI 的营销团队。

广告数据分析AI营销

Artifacts by Databox — AI 分析师报告,提问即得可分享报告

产品榜单Product Hunt

Databox 推出了名为「Skills Marketplace」的新平台,为企业提供即用型 AI 分析技能。这些预制技能旨在帮助企业用户更高效地处理和分析其业务数据,从而快速获取洞察,无需从头构建复杂的 AI 模型,显著简化数据分析流程。用户只需向 AI 分析师提问,即可获得格式化、可分享的报告,大幅提升商业智能分析的效率和可访问性。

AI应用数据分析商业智能

Airi — 自托管 AI 伴侣,用户私有化的虚拟角色

开源项目GitHub Trending

Airi 是一个自托管的 AI 伴侣项目,旨在创建用户私有化、可定制的虚拟角色,并支持实时语音聊天,目标是达到 Neuro-sama 的交互水平。它被设计为一个类似 Grok Companion 的系统,让用户能够完全掌控自己的 AI 互动体验,甚至可能与 Minecraft 等游戏集成。该项目解决了对 AI 伴侣隐私和所有权有高要求的用户需求,提供了高度个性化和去中心化的 AI 交互模式。

AI伴侣自托管虚拟角色
04

新鲜实验

Emerging 33 款

Robynn AI — 自我学习网站,能自我改进和修复的智能网站

产品榜单Product Hunt

Robynn AI 推出能自我学习、自我优化和自我修复的网站。这些网站利用人工智能技术,可以持续改进用户体验和功能表现,自动适应访客行为变化并修复潜在问题。该服务旨在为企业和个人提供更智能、更免维护的网站解决方案,降低运营成本并提升网站生命周期价值,代表了未来网站建设的一种新范式。

AI建站网站优化自我学习

AI YC interview with Gstack agents — AI 面试辅助,加入 Google Meet 提供实时反馈

产品榜单Product Hunt

Gstack 代理是能加入 Google Meet 会议并提供反馈的 AI 专家。该服务旨在帮助用户进行模拟面试,例如 YC 创业加速器面试,并能提供即时评估和个性化建议。它通过分析用户的表达、内容和互动模式,提供宝贵的洞察,从而帮助用户提升面试表现和沟通技巧,尤其适用于需要高压模拟训练的求职者和创业者。

AI助理在线会议面试辅助

iMessage Hermes on a Raspberry Pi — 树莓派智能家居代理,家中常驻的 iMessage AI 代理

产品榜单Product Hunt

iMessage Hermes 是一款基于树莓派的常驻 AI 代理,能在家中运行并与 iMessage 集成,为用户提供智能家居助理功能和个性化互动体验。它解决了传统智能家居系统集成度不高、互动受限的问题,用户可以通过 iMessage 直接与 AI 代理进行对话,控制智能设备、获取信息或执行任务,构建更私密、可定制的智能生活环境。

AI代理智能家居树莓派
→ 查看产品库