The Decoder · 07/25 02:36
Anthropic宣布,其新的旗舰AI模型Claude Opus 5在编码和知识工作方面表现出色,达到了接近Fable 5的性能,但其token价格仅为Fable 5的一半。在ARC-AGI-3新问题解决基准测试中,Opus 5更是取得了30.2%的成绩,几乎是GPT-5.6 Sol的四倍,展现了强大的竞争力。
推荐理由:Anthropic新模型在性能和价格上均具竞争力,可能重塑大模型市场格局,对开发者选择和成本控制至关重要。
The Decoder · 07/25 02:36
Anthropic宣布,其新的旗舰AI模型Claude Opus 5在编码和知识工作方面表现出色,达到了接近Fable 5的性能,但其token价格仅为Fable 5的一半。在ARC-AGI-3新问题解决基准测试中,Opus 5更是取得了30.2%的成绩,几乎是GPT-5.6 Sol的四倍,展现了强大的竞争力。
推荐理由:Anthropic新模型在性能和价格上均具竞争力,可能重塑大模型市场格局,对开发者选择和成本控制至关重要。
Riley Brown (YouTube) · 07/25 00:09
OpenAI发布了其名为Codex Voice的新产品。该产品被描述为类似电影中「贾维斯」(Jarvis)的人工智能系统,暗示它可能具备先进的语音交互或智能助手功能,代表了AI在自然语言处理和人机互动方面的新进展,有望带来新的应用场景。
推荐理由:OpenAI推出类“贾维斯”语音系统,预示人机交互的未来方向,值得关注其功能细节和潜在应用。
Wired AI · 07/25 01:53
本期Uncanny Valley播客深入探讨了中国大模型公司Moonshot AI被指控窃取Anthropic技术的传闻。同时,OpenAI据报失去了对旗下两个模型的控制权,并且有观点指出美国陆军需要削减其AI技术的使用。(多家报道)
推荐理由:涉及AI伦理争议、模型安全及地缘政治竞争,是观察AI行业发展背后风险和挑战的重要窗口。
X 推文 (AttentionVC) · 07/25 01:45
博主分享了针对Claude 5模型「上下文工程」的新规则。推文延续此前关于如何最佳提示Claude 5模型并进行迭代工作的内容,重点探讨了向Claude发送消息时上下文如何运作,旨在帮助用户更有效地利用模型,优化交互体验。
推荐理由:为Claude 5用户提供实用的上下文工程指南,能有效提升模型使用效率和效果。
GitHub Trending
Kronos是一个专为金融市场语言设计的基础模型,旨在理解并处理复杂的金融文本数据,包括新闻、财报、研报等。它通过深入学习金融领域的独特术语和上下文,帮助金融分析师和量化研究员进行更精准的市场情绪分析、信息提取和趋势预测,解决了传统模型在金融领域专业性不足的问题。
推荐理由:针对金融领域语言的AI模型,对金融AI开发者和研究者具有高度实用价值,可直接用于项目开发和研究。
Product Hunt · 07/25 04:53
Firecrawl推出了全新的“/search”API,专为AI智能体设计,提供高精度的搜索功能,旨在提升AI代理的数据获取准确性。该API承诺为开发者构建更高效、更精准的AI智能体提供强大支持,从而扩展AI应用的可能性。
推荐理由:为AI智能体提供高精度搜索API,显著提升智能体数据获取能力,是开发者构建高级AI代理的重要工具。
The Verge · 07/25 03:06
知名AI图片生成公司Midjourney周四宣布,已收购个性化占星应用Co-Star。此举标志着Midjourney从AI图像生成扩展到占星领域,Co-Star是一款免费应用。此次收购反映了AI公司跨界整合,探索新用户增长点和商业模式的趋势。
推荐理由:Midjourney的收购展现AI公司业务拓展的新趋势,结合娱乐与AI,值得关注其未来产品融合。
Claude (YouTube) · 07/24 23:38
该视频探讨了人工智能模型实际「知道」什么的核心问题。内容可能涉及AI模型的知识边界、其学习和理解机制与人类认知的异同,以及AI系统如何获取、处理和表达信息。此讨论有助于加深对AI本质的理解,并对AI伦理和哲学思考产生影响。
推荐理由:深入探讨AI模型“知识”的本质,有助于理解AI能力的边界和潜力,对AI伦理和哲学思考有价值。
TechCrunch · 07/25 04:43
自动驾驶公司Waymo据报道正考虑与打车巨头Uber“分手”。Uber向TechCrunch证实,两家公司之间的现有合同将于2028年5月到期。这一潜在的终止将影响双方未来的合作模式,可能预示着自动驾驶行业合作格局的变化。
推荐理由:关注自动驾驶巨头合作关系变动,反映行业深层整合与竞争态势。
V2EX · 07/24 16:03
V2EX社区有观点讨论在AI时代下,程序员职业发展趋势,认为AI工具的普及正促使开发者向「全干工程师」转型。这意味着程序员需要掌握更广泛的技能,从前端、后端到AI集成和部署,以适应不断变化的技术需求,引发了对职业未来方向的思考。
推荐理由:探讨AI对程序员职业的影响和未来发展方向,为技术从业者提供了职业规划的思考。
HuggingFace Trending Papers · 07/23 08:00
OpenForgeRL提出一种在任意环境中训练原生推理框架AI智能体的方法。现有智能体依赖Claude Code、Codex等复杂框架进行多轮推理和工具使用,但这些框架使得在开放基础设施上进行端到端训练变得困难。OpenForgeRL旨在简化这一训练过程,提升智能体开发效率。
推荐理由:为智能体训练提供新的方法论,有望简化复杂AI框架的端到端训练,对AI研究和开发有重要参考价值。
X 创作者 (AttentionVC) · 07/23 23:10
该推文探讨了在BNB Chain上构建下一代智能体经济(Agent Economy)的潜力。内容可能涉及结合区块链技术与AI智能体,为去中心化应用和智能自动化创造新的经济模型和生态系统,关注Web3与AI的融合趋势,为开发者提供前瞻性思考。
推荐理由:探讨BNB Chain上智能体经济的构建,为Web3和AI融合领域的开发者提供了新的思考方向。
The contract between the two companies ends in May 2028, Uber told TechCrunch.
中文介绍 自动驾驶公司Waymo据报道正考虑与打车巨头Uber“分手”。Uber向TechCrunch证实,两家公司之间的现有合同将于2028年5月到期。这一潜在的终止将影响双方未来的合作模式。
The indictment, which was unsealed Friday, alleges the Volkswagen engineers used confidential insider information to buy stock in Rivian.
中文介绍 多名大众汽车工程师被指控涉嫌内幕交易,他们利用与电动汽车制造商Rivian合资企业的机密内部信息购买Rivian股票。起诉书于周五公开,指控他们通过不正当手段获取利益。
Meta's smart glasses have been a PR headache for the company. Public backlash has been swift, and fierce; people are concerned about the erosion of privacy and expansion of surveillance. Some especially bad actors are using the glasses to film themselves "pranking" random strangers. Women have becom
中文介绍 Meta的智能眼镜因引发隐私侵蚀和监控扩张的担忧,给公司带来公关困境。公众强烈反对,一些不法分子甚至利用眼镜拍摄「恶作剧」视频,这给Meta的内容审核带来了巨大挑战。
Qualcomm sent a letter to customers on Friday warning of plans to increase its prices by "a percentage in the double digits," Bloomberg reports. The price hikes will go into effect starting with products shipped after September 1st. Qualcomm claims it has "exhausted its ability to absorb higher cost
中文介绍 彭博社报道称,高通已于周五致函客户,警告计划将其产品价格提高「两位数百分比」。此次涨价将从9月1日之后发货的产品开始生效。高通表示已「耗尽其能力」来维持现有价格。
There's no human safety or efficacy data, but that no longer seems to matter.
中文介绍 小罗伯特·肯尼迪(RFK Jr.)亲自挑选的委员会已批准生产他正在使用的肽类物质。尽管目前尚无相关肽类物质的人体安全性和有效性数据,但这一决定似乎并未受到影响。
Midjourney, which has gone from generating AI cat images to full-body ultrasound scans, is getting into a new field: astrology. The AI startup announced on Thursday that it has acquired the personalized astrology app Co-Star, as reported earlier by Bloomberg. Co-Star is a free app that offers daily
中文介绍 知名AI图片生成公司Midjourney周四宣布,已收购个性化占星应用Co-Star。此前彭博社曾报道此消息。此举标志着Midjourney从AI图像生成扩展到占星领域,Co-Star是一款免费应用。
Anthropic's new flagship model Claude Opus 5 posts top scores in coding and knowledge work at half of Fable 5's token rates. On ARC-AGI-3, a benchmark for novel problem-solving, Opus 5 hits 30.2 percent, nearly four times higher than GPT-5.6 Sol. The article Anthropic claims its new Claude Opus 5 de
中文介绍 Anthropic宣布,其新的旗舰AI模型Claude Opus 5在编码和知识工作方面表现出色,达到了接近Fable 5的性能,但其token价格仅为Fable 5的一半。在ARC-AGI-3新问题解决基准测试中,Opus 5更是取得了30.2%的成绩,几乎是GPT-5.6 Sol的四倍。
The Xtra Muse 2 Pro. | Image; Xtra After selling a barely disguised version of the hit DJI Osmo Pocket 3 in the United States last year, Xtra Technology seemed ready to sneak in its version of the new dual-lens Osmo Pocket 4 Pro, too. But today, Xtra has abruptly removed the new Xtra Muse 2 Pro from
中文介绍 曾在美国销售与大疆Osmo Pocket 3高度相似产品的Xtra科技公司,已突然停止其新版双镜头Osmo Pocket 4 Pro的销售,并宣布将全额退还所有预购订单。此举发生在Xtra被指控克隆大疆产品之后。
raw | Photo: Dominic Preston / The Verge In response to a report that Nothing is planning to "exit 12 markets as global shipments decline," Nothing cofounder Akis Evangelidis said the company is "reorganizing" and laying off some of its staff, but that "the reported numbers are way overblown." Evang
中文介绍 针对有报道称Nothing公司计划因全球出货量下降而退出12个市场,该公司联合创始人Akis Evangelidis回应称,公司正在进行「重组」并裁员部分员工,但否认了退出市场的传闻,称其为「假新闻」。
AI coding startup Cognition has acquired Poke, the AI assistant you text like a friend, in a deal valuing the startup in the low nine figures. The acquisition brings Poke’s conversational style and interaction model to Cognition’s coding agent Devin, reflecting a growing belief that how AI assistant
中文介绍 AI编码初创公司Cognition已收购AI助手Poke,此次交易使Poke的估值达到低九位数美元。此次收购旨在将Poke的对话风格和交互模式融入Cognition的编码智能体Devin,突显了AI个性化日益成为竞争优势的趋势。
The Roku Ultra. | Image: Roku Roku has increased prices across its streaming hardware, with the cheapest HD Streaming Stick now priced at $39.99 instead of $29.99, as first reported by The Desk. The price hike affects all of Roku's other devices as well, with some increasing by as much as $50. Here'
中文介绍 据The Desk率先报道,Roku已全面上调其流媒体硬件产品价格,部分设备涨幅高达50美元。其中,最便宜的HD Streaming Stick售价从29.99美元上涨至39.99美元。此次涨价涉及Roku所有其他设备。
"We can quash the subpoenas, or you could withdraw the subpoenas,” judge told US.
中文介绍 一名法官驳回了特朗普政府要求获取《纽约时报》记者电话记录的请求。法官向美国政府表示:「我们可以撤销传票,或者你们可以撤回传票。」此举维护了新闻自由和记者信息保密权。
A U.S. citizen has asked a court to throw out the government's claim that he gave over a passcode to border authorities that wiped his phone's data, opening up fresh questions about a person's constitutional rights at the U.S. border.
中文介绍 美国政府指控一名美国公民在边境检查时,使用一个「胁迫密码」清除了其手机数据。该公民已要求法院驳回政府的这一指控,此事件引发了对个人在美国边境享有的宪法权利的新一轮讨论。
On this episode of Uncanny Valley, we dive into accusations that China’s Moonshot AI stole from Anthropic, and how the US Army needs to cut back on AI use.
中文介绍 本期Uncanny Valley播客深入探讨了中国大模型公司Moonshot AI被指控窃取Anthropic技术的传闻。同时,OpenAI据报失去了对旗下两个模型的控制权,并且有观点指出美国陆军需要削减其AI技术的使用。
New delay on Copernicus satellite pics comes as US ramps up war with Iran again.
中文介绍 欧盟已应美国请求,同意限制对伊朗战区卫星图像的访问。此举正值美国与伊朗之间的冲突再度升级之际,导致「哥白尼」卫星图像的发布面临新的延迟。
Rust · ★ 9,658 · 🍴 744 · 📈 3,274 stars today
A hive mind communication platform
中文介绍 block/buzz 是一个“蜂巢思维”通信平台,旨在为团队或社区提供高效的分布式协作与沟通方式。它可能通过聚合多方信息流,促进集体决策和知识共享,解决传统通信工具在大型、去中心化组织中效率低下的问题。适用于需要紧密协同、信息高度共享的团队或组织。
TypeScript · ★ 73,141 · 🍴 10,973 · 📈 2,194 stars today
Real-time global intelligence dashboard. AI-powered news aggregation, geopolitical monitoring, and infrastructure tracking in a unified situational awareness interface
中文介绍 `worldmonitor` 是一个实时全球情报仪表板,利用AI技术聚合新闻、监测地缘政治事件及关键基础设施动态。它提供统一的态势感知界面,旨在帮助分析师、研究人员或企业迅速掌握全球宏观环境变化,提升决策效率。适用于需要持续追踪国际局势和重大事件的专业人士。
Python · ★ 69,988 · 🍴 7,895 · 📈 662 stars today
A curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows
中文介绍 `awesome-claude-skills` 是一个精选资源列表,专门收集了用于定制和扩展 Claude AI 工作流的“技能”、工具和相关资源。它旨在帮助开发者和AI爱好者发现和利用各种插件、API 集成或功能调用方法,从而更高效地构建基于 Claude AI 的自定义应用和自动化流程,解决在特定场景下Claude原生能力不足的问题。
Rust · ★ 9,285 · 🍴 632 · 📈 472 stars today
Empowering everyone to host fast and efficient Minecraft servers.
中文介绍 `Pumpkin` 旨在赋能所有用户轻松托管快速高效的 Minecraft 服务器。它解决了传统 Minecraft 服务器部署复杂、性能优化困难的问题,通过提供简化的工具或优化的底层实现,确保服务器运行流畅、资源利用率高。无论是个人玩家、小型社区还是希望提供卓越游戏体验的服务器管理员,`Pumpkin` 都能帮助他们以更低的门槛和更高的效率搭建和管理自己的 Minecraft 世界。
Python · ★ 33,450 · 🍴 5,676 · 📈 506 stars today
Kronos: A Foundation Model for the Language of Financial Markets
中文介绍 `Kronos` 是一个专为金融市场语言设计的基础模型(Foundation Model)。它旨在理解并处理复杂的金融文本数据,包括新闻、财报、研报等,解决传统模型在金融领域专业性不足的问题。通过深入学习金融领域的独特术语和上下文,`Kronos` 能帮助金融分析师、量化研究员等进行更精准的市场情绪分析、信息提取和趋势预测。
Rust · ★ 12,965 · 🍴 480 · 📈 877 stars today
Offline, privacy-first grammar checker. Fast, open-source, Rust-powered
中文介绍 Automattic/harper 是一个离线、隐私优先的开源语法检查器,采用 Rust 语言开发,以提供高性能的文本分析。它解决了在线语法检查工具可能带来的隐私泄露问题,用户无需上传敏感文本即可在本地进行快速校对。适用于作家、学生、开发者等需要高效且注重隐私的文本润色场景。
TypeScript · ★ 4,982 · 🍴 334 · 📈 339 stars today
Visualize, collaborate, and evolve the software architecture with always actual and live diagrams from your code
中文介绍 `likec4` 旨在通过从代码直接生成“实时”架构图,解决软件架构文档难以维护和过时的问题。它提供了一种将代码与可视化架构图同步演进的方法,促进团队协作。开发团队可利用 `likec4` 保持架构图与实际系统一致,提升设计沟通效率。适用于软件工程师、架构师,在设计、文档化和演进复杂系统时使用。
JavaScript · ★ 2,458 · 🍴 117 · 📈 884 stars today
The fastest browser for AI agents to run web automation, built for sharing your logged-in browser state with your AI agents, like Codex or Claude Code, without disturbing you. Zero cost, zero config.
中文介绍 citrolabs/ego-lite 是一款创新的浏览器,专为用户及其 AI 代理并行工作而设计。它解决了传统浏览器无法原生支持 AI 代理协同操作的痛点,使用户和 AI 智能体能够共同浏览网页、执行任务,显著提升工作效率。典型场景包括研究、数据收集和自动化Web任务,让AI成为浏览器内的原生伙伴。
Go · ★ 19,468 · 🍴 594 · 📈 312 stars today
Pretty fancy and modern terminal file manager
中文介绍 superfile 是一款现代化的终端文件管理器,旨在为命令行用户提供美观且功能强大的文件管理体验。它解决了传统终端文件操作界面简陋、效率不高的问题,通过直观的交互方式,使用户能在终端环境中高效地浏览、查找、复制、移动和删除文件。适用于开发者、系统管理员及偏爱命令行操作的高级用户,提升其日常文件管理效率。
Rust · ★ 85,851 · 🍴 11,440 · 📈 1,021 stars today
π RuView turns commodity WiFi signals into real-time spatial intelligence, vital sign monitoring, and presence detection — all without a single pixel of video.
中文介绍 RuView 项目创新性地将普通的 WiFi 信号转化为实时空间智能、生命体征监测和存在检测能力,完全无需使用任何视频设备。它通过分析 WiFi 信号在环境中因人体移动或呼吸等造成的微小扰动,提取出高价值的环境和生理数据。这解决了传统监控方案中隐私侵犯、硬件复杂或覆盖范围有限的问题。RuView 适用于智能家居、医疗保健(如老人跌倒预警、睡眠监测)、安防监控以及任何需要非接触式、隐私友好型人体感知的应用场景。
TypeScript · ★ 4,212 · 🍴 404 · 📈 250 stars today
The open-source alternative to Webflow, Framer and WordPress. Agentic self-hosted visual CMS outputting clean static pages. Users, roles, plugins, content, database, it's all there.
中文介绍 Instatic 是一款现代化的自托管可视化内容管理系统(CMS),主打一分钟快速部署体验。它提供直观的图形界面,让用户能够轻松创建、编辑和发布网站内容,无需复杂的编码知识。该项目解决了传统 CMS 部署繁琐、或商业 CMS 费用高昂的问题,为开发者、小型企业和内容创作者提供了一个功能强大且易于掌控的平台。用户可以将其部署到自己的服务器上,完全掌控数据和网站运行环境,非常适合需要高度自定义和自主管理内容的场景。
Assembly · ★ 71,367 · 🍴 7,932 · 📈 409 stars today
Original Apollo 11 Guidance Computer (AGC) source code for the command and lunar modules.
中文介绍 `Apollo-11` 项目收录了阿波罗11号任务中指令舱和登月舱制导计算机(AGC)的原始源代码。这份历史性代码不仅是早期航天工程的瑰宝,也展现了在极其有限的计算资源下,工程师如何编写出可靠且关键的飞行控制程序。它对于计算机历史研究者、软件考古学家及航天爱好者具有极高的参考和教育价值。
Shell · ★ 186,540 · 🍴 15,999 · 📈 2,224 stars today
Skills for Real Engineers. Straight from my .agents directory.
中文介绍 mattpocock/skills 汇集了一系列专为“真正的工程师”设计的 AI 技能,这些技能直接源自作者的 .claude 目录。它旨在为 Anthropic Claude 等 AI 编码助手提供实际、高效的工具和能力,帮助开发者在编程、代码审查和自动化任务中提高效率和准确性,尤其适合需要强大 AI 编程辅助的专业人士。
Jupyter Notebook · ★ 44,971 · 🍴 5,385 · 📈 654 stars today
《动手学大模型Dive into LLMs》系列编程实践教程
中文介绍 Dive into LLMs 提供了一系列编程实践教程,旨在帮助学习者深入理解和应用大语言模型(LLMs)。它通过实际编码项目,涵盖LLMs的基础理论、常见模型结构、微调及部署等核心技术。该教程解决了LLM学习中理论与实践脱节的问题,特别适合希望通过动手实践来系统掌握LLM的AI开发者、研究人员及技术爱好者。
TypeScript · ★ 28,667 · 🍴 3,761 · 📈 1,843 stars today
Never stop coding. Free MIT AI gateway: one endpoint, 290+ providers (90+ free), 500+ models — Kimi, Claude, GPT, OpenAI, Gemini, GLM, DeepSeek, MiniMax. Works with Claude Code, Codex, Cursor, OpenCode, Cline & Copilot. Quota-aware auto-fallback, RTK+Caveman compression saves 15-95% tokens, MCP/A2A,
中文介绍 OmniRoute 提供一个免费的 AI 网关,通过单一 API 端点集成超过231个 AI 提供商(其中50余个免费),旨在解决多模型调用的复杂性。它支持将 Claude Code、Codex、Cursor、Cline、Copilot 等编码助手连接至免费的 Claude、GPT、Gemini 等主流大模型,大幅降低开发成本。项目还采用 RTK+Caveman 堆叠压缩技术,可节省 15-95% 的数据传输开销,适合开发者统一管理 AI 服务、优化性能并利用免费资源进行高效开发。
Java · ★ 26,289 · 🍴 2,880 · 📈 129 stars today
🔥🔥🔥 AI-driven database tool and SQL client, The hottest GUI client, supporting MySQL, Oracle, PostgreSQL, DB2, SQL Server, DB2, SQLite, H2, ClickHouse, and more.
中文介绍 Chat2DB 是一款强大的AI驱动数据库工具和SQL客户端,提供直观的图形用户界面。它旨在简化数据库操作和管理,支持包括MySQL、Oracle、PostgreSQL在内的多种主流数据库。该工具通过AI能力辅助用户编写SQL查询、分析数据,有效解决了传统数据库客户端操作复杂、跨数据库兼容性差的问题。适用于开发者、DBA和数据分析师,显著提升数据库交互和管理效率。
@sairahul1 · 130.6K 粉丝 · 1.5M 阅 · 507 赞 · 59 转
I run a one-person business. No team. No employees. No co-founder. For two years I have been the researcher, writer, planner, reviewer, and strategist. All of it. At once. Last week I tried something
中文介绍 这位独立创业者分享了如何利用 AI 智能体组建一个「虚拟团队」,以应对研究、写作、规划、审核和策略制定等多重业务角色。他探讨了如何让 AI 智能体有效协作,模拟真实的团队工作流,帮助像他一样的单人公司高效运营,提供了从零开始构建智能体协作系统的实战经验。
@addyosmani · 407.1K 粉丝 · 636.9K 阅 · 503 赞 · 49 转
A software factory is harnessed loops at scale. You can run the loop with humans in it (light factory): trading judgment and concentration against speed and breakage. Or you can ignore the humans
中文介绍 博主阐述了「软件工厂」概念,将其分为两种模式:由人类参与的「明工厂」(Light Factory),通过权衡判断力与速度;以及完全自动化、忽略人类参与的「暗工厂」(Dark Factory)。探讨了大规模软件开发中的不同策略与挑战。
@PeterMcCrory · 46.5K 粉丝 · 399.2K 阅 · 514 赞 · 106 转
I thought I’d share a few high-level reflections and a framework that helps me make sense of why we (so far) don’t see significant impact of AI on the US labor market. I focus on the US because (a) AI
中文介绍 博主分享了对 AI 至今尚未显著提升美国失业率的看法,并提出了一个分析框架来解释这一现象。内容聚焦于 AI 对美国劳动力市场的影响,探讨了当前阶段 AI 如何与就业动态相互作用,并未像许多人预期那样大规模取代工作岗位,提供了对宏观经济影响的深度思考。
@nifinet · 11.0K 粉丝 · 337.0K 阅 · 518 赞 · 33 转
Earlier this year, Andrej Karpathy (@karpathy) pointed an agent at his own training code and let it run for two days. It ran 700 experiments, kept the 20 that beat the benchmark, and made the model
中文介绍 介绍如何构建一个自我改进的系统,灵感源于 Andrej Karpathy 的实验。Karpathy 让一个 agent 针对自身训练代码运行两天,执行了 700 次实验,并筛选出 20 个优于基准的成果。此方法展示了通过 AI agent 驱动的自动化实验,持续优化模型和代码的潜力。
@CliffordSosin · 16.4K 粉丝 · 197.0K 阅 · 514 赞 · 49 转
Superintelligence arrived. You probably didn't notice, because it turned out to be kind of incremental. Don't believe me? Run the test. Talk to Fable 5 for an hour, then talk to your ten smartest
中文介绍 博主探讨了「超级智能」的到来,指出其以渐进式而非颠覆性方式出现,因此可能未被察觉。他建议进行一项测试:与 Fable 5 交流一小时,再与十位最聪明的人交流,以感受这种「增量式超级智能」。
@EXM7777 · 128.5K 粉丝 · 173.6K 阅 · 521 赞 · 51 转
I'm going to show you how to build your first team of AI agents... and how to wire them into a self improving loop inside a shared workspace the team we're building has 5 agents, one for each function
中文介绍 该推文详细讲解如何构建首个 AI 智能体团队,并将其整合到自我改进循环的工作流中。教程涵盖在共享工作空间内连接智能体的步骤,特别提到构建一个由 5 个具备独立功能的智能体组成的团队。
@0xCodez · 23.9K 粉丝 · 154.5K 阅 · 510 赞 · 73 转
Most people who try to build a multi-step agent end up with a straight line. Step one, step two, step three - each waiting politely for the last to finish before it starts. 9/10 notice that half those
中文介绍 博主分享利用 Claude 进行「图工程」的 14 步路线图,旨在解决构建多步骤 agent 时常见的线性执行问题。许多人在设计 agent 时常陷入简单串联模式,而此教程将展示如何从零开始,通过图工程方法构建更复杂、非线性的 AI agent 工作流。
@satyanadella · 7.5M 粉丝 · 153.7K 阅 · 923 赞 · 114 转
In a world where software has real marginal cost for the first time, how do we ensure frontier benefits are diffused across the entire ecosystem? The key is to optimize the cost-to-outcome frontier in
中文介绍 微软 CEO Satya Nadella 探讨了在软件首次具有真实边际成本的时代,如何确保前沿技术(特别是 AI)的效益能够广泛扩散至整个生态系统。他强调关键在于优化「成本-结果」边界,以实现最大化的技术普及和价值创造,提出了对 AI 时代技术发展和经济模式的战略思考。
@Vtrivedy10 · 13.9K 粉丝 · 152.6K 阅 · 503 赞 · 50 转
Today we’re releasing our Eval Engineering Skill, a skill that helps coding agents build evals using context from a repository and agent traces. The skill inspects how an agent is structured, mines
中文介绍 博主发布了名为「Eval Engineering Skill」的新工具,旨在帮助编码智能体自动构建评估(evals)。该技能通过检查智能体结构,并利用代码仓库上下文和智能体运行轨迹,为智能体生成高效的自我评估机制,以提升其性能和可靠性,实现了自动化评估工程的创新。
@pmarca · 4.9M 粉丝 · 146.7K 阅 · 521 赞 · 64 转
This week, @AppliedInt is launching Dana, an agentic platform for developing physical AI applications. Applied Intuition began by building the tools engineers needed to develop autonomous systems,
中文介绍 Applied Intuition本周正式推出「Dana」平台,这是一个专注于开发物理AI应用的代理平台。它旨在为工程师提供构建自主系统所需的工具,助力加速实体AI的落地与规模化部署,推动智能机器的普及。
@eptwts · 116.8K 粉丝 · 140.0K 阅 · 514 赞 · 28 转
the consensus on self-hosted agents is that they're simply coding tools... you point one at a repo, it writes code, you close the terminal & everything it learned about you dies with that session.
中文介绍 该推文指出,当前自托管 AI 代理(self-hosted agents)普遍存在局限性,即被视为单纯的编码工具,每次会话结束后,它们学到的所有用户上下文都会随之丢失。博主认为这种「即用即丢」模式限制了代理的持续学习和效率,暗示需要一种能保留上下文的新系统。
@EXM7777 · 128.5K 粉丝 · 124.5K 阅 · 520 赞 · 54 转
I'm going to show you how to build your first agent graph and put it to work in your business today: A team of AI agents that researches in parallel, tries to kill its own findings, and hands you one
中文介绍 该博主将展示如何构建首个「智能体图」(agent graph)并将其应用于业务中。这个智能体团队能够并行进行研究、主动验证并「反驳」自身发现,最终提供精炼的见解。这是一个关于如何设计和实现高效协作式 AI 智能体工作流的教程,旨在帮助用户掌握图工程技术。
@jack · 10.3M 粉丝 · 109.6K 阅 · 782 赞 · 93 转
yesterday we released buzz. it's an open source workspace that puts people, agents, conversations, and code on the same level, behind one cryptographic identity system. we built it to reduce our
中文介绍 Jack Dorsey 发布了「buzz」,一个开源工作区,旨在将人员、智能体、对话和代码整合到一个统一的加密身份系统之下。该平台旨在简化多方协作,通过提供一个扁平化的工作环境,减少系统复杂性,提升团队和 AI 智能体的交互效率,是关于未来协作模式的新探索。
@almonk · 12.8K 粉丝 · 107.4K 阅 · 531 赞 · 69 转
I like AI. I worked at an AI company for nearly three years and I use it every day. I am glad software is getting easier to make. But we can recognise that when the bar to entry drops, quality drops
中文介绍 博主指出,AI虽然降低了软件开发门槛并加速制作过程,但伴随进入门槛的下降,软件质量也可能随之下降。这是AI普及后软件开发领域需警惕的现象,引发对软件行业未来发展方向的思考。
@herrcore · 15.4K 粉丝 · 64.2K 阅 · 514 赞 · 84 转
tl;dr K3 makes us question why we are paying Anthropic. We’ve been using Opus as our go-to model for reverse engineering tasks since the release of 4.5, and with each new release, it feels like we
中文介绍 博主对 Kimi K3 进行了逆向工程任务评测,并与 Anthropic 的 Opus 模型对比。评测结果表明,Kimi K3 在此类任务中表现出色,甚至让博主质疑继续为 Opus 付费的必要性。这暗示 Kimi K3 可能是逆向工程领域中,一个性能与性价比俱佳的替代方案。
@TheVixhal · 22.7K 粉丝 · 53.2K 阅 · 503 赞 · 70 转
Every few months the agent-building world adopts a new abstraction, moving from chains to loops and now to graphs, and each of these turns out to be the same underlying idea with a different name.
中文介绍 探讨AI代理构建中抽象概念的演变,从早期的chains到loops,再到当前的graphs。指出这些不同的抽象模式,如状态机,实则反映了同一个底层思想,只是命名和表现形式有所不同,帮助理解代理设计的本质。
@IntuitMachine · 62.3K 粉丝 · 50.7K 阅 · 552 赞 · 47 转
What the shift in AI agent architecture is really about Peter Steinberger just posted nine words that gathered thousands of likes: https://x.com/steipete/status/2078277297791189132 "Are we still talking loops or did we
中文介绍 该推文探讨了 AI 智能体架构的关键转变,从传统的「循环工程」(Loop Engineering)转向「图工程」(Graph Engineering)。文章引用 Peter Steinberger 的热门观点,提出对当前智能体设计范式的深刻反思。
@enginoid · 1.1K 粉丝 · 49.9K 阅 · 522 赞 · 37 转
Linear is probably my best-value subscription at the moment. I pay the sole user fee of $12/mo and the company agents have eaten through ~400 issues in the past month. I use Linear to organize my
中文介绍 博主分享如何利用项目管理工具 Linear 管理 AI agent 的工作流。他每月支付 $12 订阅费,其公司 agent 在过去一个月内处理了约 400 个问题。该分享展示了将 Linear 与 AI agent 结合以大幅提升生产力的方法,并倡导构建「软件工厂」的理念。
@trq212 · 318.0K 粉丝 · 48.6K 阅 · 1.2K 赞 · 119 转
I’ve written previously about how to best prompt the newest generation of Claude 5 models and work with them iteratively to discover what you want to build. But when you send a message to Claude, the
中文介绍 博主分享了针对 Claude 5 模型「上下文工程」的新规则。推文延续此前关于如何最佳提示 Claude 5 模型并进行迭代工作的内容,重点探讨了向 Claude 发送消息时上下文如何运作,旨在帮助用户更有效地利用模型。
@mem0ai · 19.0K 粉丝 · 43.5K 阅 · 509 赞 · 49 转
In April 2026, Andrej Karpathy published a GitHub Gist describing a pattern he called the LLM Wiki. In the months since, four different teams have shipped the same idea without coordinating:
中文介绍 介绍了Andrej Karpathy于2026年4月提出的「LLM Wiki」模式。此后数月内,已有四个团队在未协调的情况下独立实现了相似的代理架构,凸显了该模式在LLM记忆和知识管理中的重要性与共识。
@trq212 · 318.0K 粉丝 · 48.6K 阅 · 7d 曝光 48.6K
The new rules of context engineering for Claude 5 models
@leerob · 272.8K 粉丝 · 32.9K 阅 · 7d 曝光 32.9K
How we teach AI models
@derrickcchoi · 9.1K 粉丝 · 40.1K 阅 · 7d 曝光 40.1K
I Can Finally Talk to ChatGPT the Way I Actually Think
@eptwts · 116.8K 粉丝 · 140.0K 阅 · 7d 曝光 140.0K
this system will change your life...
@satyanadella · 7.5M 粉丝 · 153.7K 阅 · 7d 曝光 153.7K
Frontier Diffusion & Control
@OptimaiNetwork · 99.3K 粉丝 · 6.1K 阅 · 7d 曝光 6.1K
Building the Next Layer of the Agent Economy on BNB Chain
@AdrianPunk115 · 20.0K 粉丝 · 243.9K 阅 · 7d 曝光 243.9K
Miora从0到1小白教程,人人都能当五分钟设计师
@FuckAnthropic · 787 粉丝 · 109.8K 阅 · 7d 曝光 109.8K
梁文锋投资人会议文字稿修正稿
@jack · 10.3M 粉丝 · 109.6K 阅 · 7d 曝光 109.6K
why we're buzzing
@HoodAI0x · 5.6K 粉丝 · 15.1K 阅 · 7d 曝光 15.1K
Robinhood let AI agents trade. Hood AI makes sure they can be trusted.
@PeterMcCrory · 46.5K 粉丝 · 399.2K 阅 · 7d 曝光 399.2K
Why hasn’t AI increased unemployment?
@Vtrivedy10 · 13.9K 粉丝 · 152.6K 阅 · 7d 曝光 152.6K
Towards Automating Eval Engineering
@EXM7777 · 128.5K 粉丝 · 124.5K 阅 · 7d 曝光 124.5K
How to master graph engineering (Full Course)
@sairahul1 · 130.6K 粉丝 · 1.5M 阅 · 7d 曝光 1.5M
How to Build a Team of AI Agents That Actually Work Together (Full Course)
👍 9
Multi-agent interactive world models should not only generate consistent observations, but also maintain world states that persist across agents and evolve across views. Existing autoregressive video diffusion pipelines carry forward observation history as conditioning context, which makes shared st
中文介绍 论文提出了一种流式多智能体自回归扩散模型,引入「世界状态寄存器」来维持跨智能体和跨视图的持久世界状态。这解决了现有自回归视频扩散模型仅将观测历史作为条件上下文的局限性,旨在生成更一致和演进的多智能体交互世界模型。
👍 2
Controllable video generation remains challenging due to the difficulty of specifying precise multi-object interactions using text prompts or motion-control inputs that primarily constrain pixel movement. In practice, trajectory-based control often requires users to draw accurate tracks for multiple
中文介绍 GraphVid提出一种交互式图控视频生成方法,旨在解决现有文本或运动控制输入难以精确指定多对象交互的问题。该模型通过图结构来表示和控制视频中对象间的复杂互动,从而实现更精细和用户友好的视频内容生成。
👍 13
Understanding motion in video is a fundamental challenge for visual learning, as frame-to-frame change entangles two sources of dynamics: camera motion and object motion. This decomposition has remained underexplored in representation learning, partly because these factors are tightly coupled in nat
中文介绍 该论文探讨了从视频中学习结构化动态的自监督方法,旨在解决视频运动理解中相机运动与物体运动纠缠不清的挑战。通过分解这两种动态来源,模型能更有效地进行表征学习,以提升对视频内容的深度理解和分析能力。
👍 0
Modern AI agents rely on elaborate inference harnesses such as Claude Code, Codex, and OpenClaw to drive multi-turn reasoning, tool use, and access to external systems. While powerful, these complex harnesses also make agents hard to train end-to-end with open infrastructure, whose SFT/RL stacks can
中文介绍 OpenForgeRL提出一种在任意环境中训练原生推理框架AI智能体的方法。现有智能体依赖Claude Code、Codex等复杂框架进行多轮推理和工具使用,但这些框架使得在开放基础设施上进行端到端训练变得困难。OpenForgeRL旨在简化这一训练过程。
👍 39
On-policy self-distillation (OPSD) is promising as it removes the external teacher required by on-policy distillation (OPD), yet it still needs asymmetric information between teacher and student to ensure that the self-teacher provides a stronger learning signal than the student. Existing methods cr
中文介绍 论文介绍了「视觉对比自蒸馏」方法,改进了策略自蒸馏(OPSD),后者无需外部教师。尽管OPSD仍需教师与学生间的不对称信息以确保更强的学习信号,该研究旨在优化这一机制。新方法可能通过视觉对比学习,提升模型在自蒸馏过程中的效率和性能。
👍 14
We introduce SANA-Video 2.0, a hybrid video diffusion transformer instantiated at 5B and 14B scales under a unified architecture. Designed to generate high-quality video up to 720p on a single GPU, SANA-Video 2.0 matches full-softmax video DiTs in quality while retaining the favorable long-sequence
中文介绍 论文发布了SANA-Video 2.0,一个5B和14B参数规模的混合视频扩散Transformer模型。该模型采用混合线性注意力与注意力残差机制,旨在单GPU上高效生成高达720p的高质量视频。SANA-Video 2.0在保持效率的同时,质量上与全softmax视频DiTs相当。
👍 0
We present DONDO, a family of open, permissively licensed automatic speech recognition (ASR) base models for African languages, built on the w2v-BERT 2.0 self-supervised speech encoder. DONDO comprises twenty-one monolingual models and five multilingual models spanning twenty-seven language varietie
中文介绍 DONDO项目发布了一系列开放且许可宽松的非洲语言自动语音识别(ASR)基础模型。这些模型基于w2v-BERT 2.0自监督语音编码器构建,包含21个单语模型和5个多语模型,覆盖27种非洲语言,旨在提升非洲语言的语音技术可及性。
👍 0
Production AI agents' failures are less often due to an inability to reason well and more often because they cannot manage what is in their reasoning context: conversation histories, large prompts, large tool definitions, and ballooning tool outputs. Agents drown in their own accumulating history wh
中文介绍 论文指出生产AI智能体失败的主要原因,并非推理能力不足,而是无法有效管理其推理上下文,包括对话历史、大型提示和工具输出等。为解决智能体的内存和成本问题,该研究建议将其视为生命周期和架构问题进行处理,以优化智能体的性能和可靠性。
👍 0
AI agents are increasingly created inside organizations by non-engineering users through low-code, no-code, and conversational development environments. This democratization enables rapid local innovation, but it also creates a reliability gap: agents that appear to users as simple productivity arti
中文介绍 随着低代码/无代码工具普及,非工程用户在企业内创建AI智能体的现象日益增多,这推动了AI的民主化和创新。然而,这也带来了可靠性差距,因表面简单的智能体可能隐藏复杂风险。本研究旨在为工业界AI智能体创建的民主化提供持续保障。
👍 6
We study sinusoidal recurrence as an iterative mechanism for harmonic spectral enrichment in implicit neural representations (INRs). Our analysis reveals that sinusoidal activations induce a harmonic line spectrum, providing a spectral account of how recurrent unrolling enriches the effective spectr
中文介绍 论文研究了在隐式神经表示(INRs)中,正弦循环作为迭代机制如何增强谐波频谱。分析表明,正弦激活能产生谐波线谱,揭示了循环展开如何丰富频谱,从而实现高效的高保真表示。
👍 0
Dynamic-scene reconstruction is almost always evaluated inside the observed time window, yet deployment settings such as AR overlays, robot interaction, and anticipatory planning need the future surface: the geometry at times beyond those captured. No standard benchmark measures this. We introduce F
中文介绍 论文指出,动态场景重建通常仅在观测时间窗内评估,而增强现实、机器人交互等应用需要「未来表面」(即超出观测时间的几何形态)。为解决这一需求,研究提出了一项新基准和数据集,用于评估超越观测窗口的动态表面重建能力。
👍 115
Deep research requires agents to find answers that jointly satisfy multiple constraints. Discovering such answers is costly, whereas verifying a candidate can often be decomposed into tractable constraint-wise checks. This discovery--verification asymmetry suggests that a research agent should do mo
中文介绍 AREX项目旨在开发一种递归自改进的深度研究智能体。深度研究需智能体寻找同时满足多个约束的答案,其中发现成本高昂,而验证候选答案则相对容易分解。这种发现与验证不对称性提示,通过递归自改进机制,可提升研究型智能体在复杂问题解决中的效率。
👍 0
The ability to handle long-term memory in LLMs is becoming increasingly critical, yet existing benchmarks remain English-centric and rely on aggregate retrieval metrics, failing to capture interactions between long-range context, temporal information, and reasoning. To address this, we introduce RUM
👍 0
In long-horizon LLM agent reinforcement learning, weak policies often repeat similar failures, producing uninformative rollout trajectories and limiting effective policy optimization. Existing skill-centric methods improve exploration by optimizing, filtering, or internalizing reusable skills. Howev
👍 0
While memory systems are essential for agent architectures, pervasive architectural fragmentation restricts systematic research. Existing implementations typically couple different stages of the memory lifecycle, entangle evaluation logic with specific datasets, and provide limited support for the m
👍 0
Autonomous AI agents increasingly execute actions, invoke tools, and operate on protected resources with limited human oversight. Existing authentication and authorization mechanisms establish identity and delegate authority, but do not inherently provide cryptographic evidence that a concrete reque
👍 0
Machine unlearning has emerged as a tool for removing personal data from trained models to comply with recent AI regulations. To evaluate unlearning effectiveness in multimodal large language models (MLLMs), prior works fine-tune models on fictitious identities, simulating unlearning requests on sub
👍 1
Extracting structured content from news pages remains challenging due to heterogeneous HTML layouts, inconsistent markup, and substantial boilerplate such as navigation elements and advertisements. Rule-based news crawlers can achieve high extraction accuracy by encoding site-specific structure, but
👍 0
Dense per-step supervision is an appealing remedy for sparse-reward, long-horizon LLM agents: reward the agent for predicting its next observation, and memory should follow. We show that under group-normalized RL (GRPO), this recipe does not merely fail -- it destroys the policy. Across Qwen3-1.7B/4
👍 5
The recent emergence of vibe-coding workflows is changing what coding agents are expected to do. Instead of merely completing code under fully specified instructions, agents are increasingly expected to transform incomplete product intent into working software by combining various abilities includin
👍 0
Effective memory is crucial for LLM agents, yet constructing it effectively remains challenging. A memory-construction policy decides what information to extract, store, update, compress, or discard as interactions accumulate. Heuristic memory methods rely on subjective, task-specific rules, which c
👍 0
We present VibeVoice-ASR-BitNet, a compressed variant of VibeVoice-ASR optimized for real-time inference on edge CPUs. We apply heterogeneous quantization tailored to the computational characteristics of each stage: the VAE acoustic tokenizer uses full-pipeline INT8 quantization (I8_S) with kernel f
👍 34
Spatial intelligence is essential for agents to move from static semantic understanding toward interacting with the physical world. Many spatial tasks are grounded in continuous visual scenes, where locations, regions, and paths are more naturally expressed by pointing, marking, or drawing than by r
👍 0
Almost every large language model that reaches a broad audience is quantized: trained in full precision, then compressed for efficiency. This step is assumed harmless and its safety is rarely re-checked. We find its principal side effect is increased bias that standard safety evaluation misses. Hold
👍 7
Real-world agent learning is often constrained by costly environment interactions, such as running time-consuming experiments or obtaining human feedback. In-context learning offers a highly sample-efficient way for agents to learn from their own interaction histories, but its gains disappear once t
👍 5
The development of generalizable robotic manipulation policies is inherently bounded by the availability of large-scale, high-fidelity scene data. While recent automated synthesis methods attempt to bridge this gap via text-to-layout hallucination or simplified procedural generation, they frequently
👍 0
Agent Skills package reusable procedural knowledge as external artifacts for frozen language-model agents, yet existing optimizers do not jointly resolve where a failure occurs in a workflow, which mechanism caused it, and how relevant knowledge from third-party Skills should be reused locally. We i
👍 0
As large language model agents increasingly operate autonomously with access to tools and external environments, ensuring their safe and reliable behavior becomes critical. We present GuardianAgentBench (GABench), a benchmark of 580 scenarios across six domains evaluated on three production-ready fr
👍 0
Coding agents ship with one kind of memory: documents. Instruction files, plan artifacts, and auto-written memory directories are deliberately authored and deliberately retrieved: the agent must choose to write them and choose to read them back. Human expertise runs on a second tier that never gets
👍 0
BoN improves model outputs by sampling several candidates and selecting one with a proxy score, but it assumes that complete candidates can be evaluated reliably. Many vision-language tasks instead provide only partial verification: a finding, span, value, region, or relation may be checkable even w
Our most accurate Search API for AI agents.
中文介绍 Firecrawl推出了全新的“/search”API,专为AI智能体设计,提供高精度的搜索功能,旨在提升AI代理的数据获取准确性。
Bring the world's best AI agents into your app, with one API
中文介绍 HarnessRouter提供统一API接口,使用户能够将全球顶尖的AI智能体整合到自己的应用程序中,简化AI功能集成流程。
Approve AI requests from your lock screen
中文介绍 Pushary是一款便捷的应用,用户无需解锁手机即可直接从锁屏界面审批AI请求,极大提升了AI交互的即时性和便利性。
Give every AI agent trusted context
中文介绍 Fluree AI致力于为每个AI智能体提供可信赖的上下文信息,确保AI在处理任务时能够基于准确且可靠的数据进行判断。
Highlight text on any page and turn it into audio.
中文介绍 Liso是一款工具,用户可以在任何网页上选中高亮文本,并将其转换为音频播放,方便用户以听觉方式获取信息。
Publish and grow your profile across social apps
中文介绍 Fedica 2.0版本推出,旨在帮助用户在多个社交媒体平台上发布内容并拓展其个人影响力,实现跨平台管理与增长。
Describe your problem, get the YC startup that solves it
中文介绍 “YC has it”是一项服务,用户只需描述其面临的问题,系统即可匹配并推荐由Y Combinator孵化的、能够解决该问题的初创公司。
Learn languages by exploring worlds and talking to locals.
中文介绍 Speakworld是一款语言学习应用,用户通过探索虚拟世界并与“当地人”对话来学习新语言,提供沉浸式的学习体验。
Your people, your agents, your project — all in one place
中文介绍 Buzz是一款协作平台,它将用户团队成员、AI智能体和项目管理功能整合于一处,旨在提升团队协作效率和项目管理集中性。
Full-Stack Platform for Training Small Language Models
中文介绍 Freesolo Flash是一个全栈平台,专门用于训练小型语言模型(SLM)。它提供完整的工具链,助力开发者进行模型训练与部署。
中文介绍 OpenAI 发布了其名为 Codex Voice 的新产品。该产品被描述为类似电影中「贾维斯」(Jarvis)的人工智能系统,暗示它可能具备先进的语音交互或智能助手功能,代表了AI在自然语言处理和人机互动方面的新进展。
中文介绍 YouTube用户Riley Brown发布视频,展示了他如何将Codex(推测为OpenAI Codex)改造为一个“业务增长机器”。该视频围绕利用AI技术,尤其可能是代码生成能力,来加速企业发展的实际策略展开。
中文介绍 该视频探讨了人工智能模型实际「知道」什么的核心问题。内容可能涉及AI模型的知识边界、其学习和理解机制与人类认知的异同,以及AI系统如何获取、处理和表达信息。
中文介绍 这则由Claude发布的YouTube短视频,探讨了人工智能(AI)出现「幻觉」现象的原因。AI幻觉是指大型语言模型在生成文本时,提供看似合理但实际不准确或虚假信息的问题。该视频旨在解释为何AI会生成不符合事实的内容。
中文介绍 由Claude在YouTube发布的一则短视频,探讨了人工智能(AI)如何形成其“性格”。视频以此为主题,讨论AI系统在学习和训练过程中发展出独特行为模式的现象。
中文介绍 这段来自Claude(YouTube)的短视频,以“什么是阿谀奉承?”为题,旨在清晰阐释「阿谀奉承」(sycophancy)这一概念。视频内容可能涵盖该行为的定义、特征及其在人际互动中的表现形式,帮助观众深入理解这种社会现象的本质。
中文介绍 这段YouTube短视频展示了如何运用名为「Claude」的工具,将美国纽约市的标志性建筑或街景制作成微缩模型。视频内容可能涵盖了从设计到实现微缩模型的过程,突出了Claude在创意制作领域的应用,暗示了其在辅助视觉艺术和模型构建方面的潜力。
中文介绍 该视频探讨了人工智能模型实际「知道」什么的核心问题。内容可能涉及AI模型的知识边界、其学习和理解机制与人类认知的异同,以及AI系统如何获取、处理和表达信息。
中文介绍 这则由Claude发布的YouTube短视频,探讨了人工智能(AI)出现「幻觉」现象的原因。AI幻觉是指大型语言模型在生成文本时,提供看似合理但实际不准确或虚假信息的问题。该视频旨在解释为何AI会生成不符合事实的内容。
中文介绍 由Claude在YouTube发布的一则短视频,探讨了人工智能(AI)如何形成其“性格”。视频以此为主题,讨论AI系统在学习和训练过程中发展出独特行为模式的现象。
中文介绍 这段来自Claude(YouTube)的短视频,以“什么是阿谀奉承?”为题,旨在清晰阐释「阿谀奉承」(sycophancy)这一概念。视频内容可能涵盖该行为的定义、特征及其在人际互动中的表现形式,帮助观众深入理解这种社会现象的本质。
中文介绍 这段YouTube短视频展示了如何运用名为「Claude」的工具,将美国纽约市的标志性建筑或街景制作成微缩模型。视频内容可能涵盖了从设计到实现微缩模型的过程,突出了Claude在创意制作领域的应用,暗示了其在辅助视觉艺术和模型构建方面的潜力。
7 回复 · 程序员 节点
34 回复 · 程序员 节点
11 回复 · 程序员 节点
8 回复 · 程序员 节点
17 回复 · Apple 节点
17 回复 · Python 节点
12 回复 · Apple 节点
41 回复 · Apple 节点
29 回复 · Apple 节点
33 回复 · Apple 节点
该源今日无内容。
90 points · 17 comments
20 points · 5 comments
73 points · 40 comments
37 points · 2 comments
31 points · 9 comments
32 points · 6 comments
https://www.anthropic.com/claude-opus-5-system-card
67 points · 33 comments
48 points · 10 comments
5 points · 0 comments
306 points · 155 comments
41 points · 50 comments
62 points · 26 comments
65 points · 33 comments
98 points · 124 comments
Letter: https://images.nvidia.com/pdf/Open-Weights-and-American-AI-L... [pdf]https://x.com/JensenHuang/status/2080643682408321103, https://xcancel.com/JensenHuang/status/2080643682408321103https://www.wired.com/stor
220 points · 38 comments
309 points · 267 comments
429 points · 154 comments
189 points · 226 comments
296 points · 47 comments
655 points · 373 comments
35 points · 9 comments
538 points · 125 comments
56 points · 32 comments
62 points · 55 comments
22 points · 1 comments
35 points · 0 comments
5 points · 1 comments
388 points · 117 comments
What's changed Added Claude Opus 5 (claude-opus-5), now the default Opus model — 1M context, fast mode at $10/$50 per Mtok Added sandbox.network.strictAllowlist setting to deny non-allowlisted hosts for sandboxed commands without prompting Added DirectoryAdded hook that fires after /add-dir or the S
中文介绍 Anthropic的Claude-code项目发布v2.1.219更新。此版本引入了Claude Opus 5(claude-opus-5)作为默认Opus模型,具备1M上下文。其快速模式定价为每百万token $10/$50。同时,更新新增“sandbox.network.strictAllowlist”设置,增强沙盒命令的网络安全。
What's changed Changed /code-review to run as a background subagent, so review work no longer fills your conversation and keeps stacked slash commands as its review target Added screen-reader announcements of deleted text for word and line deletions (Option+Delete, Ctrl+W, Cmd+Backspace, Ctrl+U, Ctr
中文介绍 Anthropic的Claude Code项目发布了v2.1.218版本。更新内容包括将/code-review功能改为后台子代理运行,避免占用对话空间,并改进了屏幕阅读器对删除文本(如通过Option+Delete、Ctrl+W等)的播报,提升了无障碍体验。
What's changed Added emoji shortcode autocomplete in the prompt input: type :heart: to insert ❤️, or :hea for suggestions — disable with the emojiCompletionEnabled setting Added warnings when transcript writes are failing (e.g. disk full) or when session saving is off due to an inherited environment
中文介绍 Anthropic的Claude Code项目发布了v2.1.217版本。此次更新主要增加了提示词输入中的表情符号短代码自动补全功能,用户可以通过输入":heart:"等来插入表情符号,该功能可通过emojiCompletionEnabled设置禁用。同时,新版本还加入了在转录写入失败或会话保存关闭时的警告提示。
What's changed Added sandbox.filesystem.disabled setting to skip filesystem isolation while keeping network egress control Fixed a slowdown in long sessions where message normalization cost grew quadratically with the number of turns, causing multi-second stalls and slow resumes Fixed auto mode deny
What's changed Claude no longer runs the /verify and /code-review skills on its own; invoke them with /verify or /code-review when you want them
What's changed Fixed single-segment dir/** allow rules like Edit(src/**) auto-approving writes to nested dir/ directories anywhere in the tree instead of only /dir Fixed a permission-check bypass affecting commands run in Windows PowerShell 5.1 sessions Fixed Bash permission checks to fail closed on
What's changed /fork now copies your conversation into a new background session (its own row in claude agents) while you keep working; the in-session subagent it used to launch is now /subtask Added claude auto-mode reset to restore the default auto-mode configuration, with a confirmation prompt (pa
What's changed Added --forward-subagent-text flag and CLAUDE_CODE_FORWARD_SUBAGENT_TEXT environment variable to include subagent text and thinking in stream-json output Fixed permission previews relayed to chat channels not neutralizing bidirectional-override, zero-width, and look-alike quote charac
What's changed Added a live elapsed-time counter to the collapsed tool summary line so long-running tool calls visibly tick instead of looking stuck Added a startup warning for Write(path), NotebookEdit(path), and Glob(path) permission rules — use Edit(path) or Read(path) instead Fixed isolation: 'w
What's changed Fixed /model and other dialogs being blocked in claude agents background sessions (reverts an overly broad guard)
Release 0.146.0-alpha.7
中文介绍 OpenAI Codex项目发布了Rust语言版本的0.146.0-alpha.7更新。此为该项目的一个alpha阶段版本,通常包含开发中的新功能或修复。
Release 0.146.0-alpha.6
中文介绍 OpenAI Codex项目发布了Rust语言版本的0.146.0-alpha.6更新。此为该项目的一个alpha阶段版本,通常包含开发中的新功能或修复。
Release 0.146.0-alpha.3.1
中文介绍 OpenAI Codex项目发布了Rust语言版本的0.146.0-alpha.3.1更新。此为该项目的一个alpha阶段版本,通常包含开发中的新功能或修复。
Release 0.146.0-alpha.5
中文介绍 OpenAI旗下的Codex项目发布了软件的0.146.0-alpha.5版本更新。此次发布是一个alpha测试版,聚焦于Rust相关组件的迭代与改进,持续推进软件开发进展。
Release 0.146.0-alpha.4
中文介绍 OpenAI旗下的Codex项目发布了软件的0.146.0-alpha.4版本更新。此次发布是一个alpha测试版,聚焦于Rust相关组件的迭代与改进,持续推进软件开发进展。
Release 0.146.0-alpha.3
中文介绍 OpenAI旗下的Codex项目发布了软件的0.146.0-alpha.3版本更新。此次发布是一个alpha测试版,聚焦于Rust相关组件的迭代与改进,持续推进软件开发进展。
Release 0.146.0-alpha.2
中文介绍 OpenAI Codex项目发布了Rust语言的0.146.0-alpha.2版本更新,这是一次处于早期测试阶段(alpha)的版本发布,但现有信息未提供具体更新细节。
Release 0.146.0-alpha.1
中文介绍 OpenAI Codex项目发布了Rust语言的0.146.0-alpha.1版本更新,这是一次处于早期测试阶段(alpha)的版本发布,但现有信息未提供具体更新细节。
Release 0.145.0-alpha.30
中文介绍 OpenAI Codex项目发布了Rust语言的0.145.0-alpha.30版本更新,这是一次处于早期测试阶段(alpha)的版本发布,但现有信息未提供具体更新细节。
New Features Added experimental paginated thread history with efficient resume, search, persisted names, sub-agent support, and memories. (#33364, #33907, #34085, #34229, #34386) Expanded /import to migrate Cursor and Claude Code settings, MCP servers, plugins, sessions, commands, and project-scoped
今日AI领域焦点集中于大模型能力的持续迭代与AI智能体实践的深度探索。Anthropic旗舰模型Claude Opus 5凭借卓越性能和成本效益,预示着大模型应用新高度。同时,开源工具和研究深刻剖析AI智能体在上下文管理、效率提升中的挑战与机遇,而行业并购与战略讨论则反映出AI加速普及背景下的市场重塑与伦理考量。
Anthropic宣布,其新的旗舰AI模型Claude Opus 5在编码和知识工作方面表现出色,达到了接近Fable 5的性能,但其token价格仅为Fable 5的一半。在ARC-AGI-3新问题解决基准测试中,Opus 5更是取得了30.2%的成绩,几乎是GPT-5.6 Sol的四倍,展现出其在复杂任务处理上的强大能力。
论文发布了SANA-Video 2.0,一个5B和14B参数规模的混合视频扩散Transformer模型。该模型采用混合线性注意力与注意力残差机制,旨在单GPU上高效生成高达720p的高质量视频。SANA-Video 2.0在保持效率的同时,质量上与全softmax视频DiTs相当,为视频生成领域带来显著进步。
`Kronos` 是一个专为金融市场语言设计的基础模型。它旨在理解并处理复杂的金融文本数据,包括新闻、财报、研报等,解决传统模型在金融领域专业性不足的问题。通过深入学习金融领域的独特术语和上下文,`Kronos` 能帮助金融分析师、量化研究员等进行更精准的市场情绪分析、信息提取和趋势预测。
OmniRoute 提供一个免费的 AI 网关,通过单一 API 端点集成超过231个 AI 提供商(其中50余个免费),旨在解决多模型调用的复杂性。它支持将 Claude Code、Codex、Cursor、Cline、Copilot 等编码助手连接至免费的 Claude、GPT、Gemini 等主流大模型,大幅降低开发成本。项目还采用 RTK+Caveman 堆叠压缩技术,可节省 15-95% 的数据传输开销,适合开发者统一管理 AI 服务、优化性能并利用免费资源进行高效开发。
Jack Dorsey 发布了「buzz」,一个开源工作区,旨在将人员、智能体、对话和代码整合到一个统一的加密身份系统之下。该平台旨在简化多方协作,通过提供一个扁平化的工作环境,减少系统复杂性,提升团队和 AI 智能体的交互效率,是关于未来协作模式的新探索,预计将改变信息流与协同的传统范式。
OpenAI 发布了其名为 Codex Voice 的新产品。该产品被描述为类似电影中「贾维斯」(Jarvis)的人工智能系统,暗示它可能具备先进的语音交互或智能助手功能,代表了AI在自然语言处理和人机互动方面的新进展,有望极大提升用户与AI的自然交流体验。
Firecrawl推出了全新的「/search」API,专为AI智能体设计,提供高精度的搜索功能,旨在提升AI代理的数据获取准确性。该API通过优化数据抓取和信息提取流程,使智能体能够更有效地访问和理解网络信息,从而解决传统搜索在AI应用中效率和精确度不足的问题,加速智能应用开发。
AI编码初创公司Cognition已收购AI助手Poke,此次交易使Poke的估值达到低九位数美元。此次收购旨在将Poke的对话风格和交互模式融入Cognition的编码智能体Devin,突显了AI个性化日益成为竞争优势的趋势,预示着未来AI产品将更加注重用户体验和情感交互。
知名AI图片生成公司Midjourney周四宣布,已收购个性化占星应用Co-Star。此举标志着Midjourney从AI图像生成扩展到占星领域,预示着AI技术在更广泛的消费者应用场景中寻找新的增长点和用户群体。Co-Star是一款免费应用,此次收购将为Midjourney带来新的用户基础和数据维度。
本期Uncanny Valley播客深入探讨了中国大模型公司Moonshot AI被指控窃取Anthropic技术的传闻。同时,OpenAI据报失去了对旗下两个模型的控制权,并且有观点指出美国陆军需要削减其AI技术的使用。这些事件共同引发了对AI伦理、知识产权保护、模型治理以及军事应用等深层次问题的广泛关注。
微软 CEO Satya Nadella 探讨了在软件首次具有真实边际成本的时代,如何确保前沿技术(特别是 AI)的效益能够广泛扩散至整个生态系统。他强调关键在于优化「成本-结果」边界,以实现最大化的技术普及和价值创造,提出了对 AI 时代技术发展和经济模式的战略思考,呼吁行业共同探索可持续发展路径。
论文指出生产AI智能体失败的主要原因,并非推理能力不足,而是无法有效管理其推理上下文,包括对话历史、大型提示和工具输出等。为解决智能体的内存和成本问题,该研究建议将其视为生命周期和架构问题进行处理,以优化智能体的性能和可靠性,从而推动智能体在实际应用中的普及和成功。
该推文指出,当前自托管 AI 代理(self-hosted agents)普遍存在局限性,即被视为单纯的编码工具,每次会话结束后,它们学到的所有用户上下文都会随之丢失。博主认为这种「即用即丢」模式限制了代理的持续学习和效率,暗示需要一种能保留上下文的新系统,以实现更智能、更持久的AI辅助。
Dive into LLMs 提供了一系列编程实践教程,旨在帮助学习者深入理解和应用大语言模型(LLMs)。它通过实际编码项目,涵盖LLMs的基础理论、常见模型结构、微调及部署等核心技术。该教程解决了LLM学习中理论与实践脱节的问题,特别适合希望通过动手实践来系统掌握LLM的AI开发者、研究人员及技术爱好者。
这则由Claude发布的YouTube短视频,探讨了人工智能(AI)出现「幻觉」现象的原因。AI幻觉是指大型语言模型在生成文本时,提供看似合理但实际不准确或虚假信息的问题。该视频旨在解释为何AI会生成不符合事实的内容,并可能提出一些理解和缓解这一挑战的方法,帮助用户更好地利用AI工具。
今天,AI产品的发布呈现出两大亮点:一是围绕「AI智能体」的生产力革新,从专门为智能体设计的浏览器到集成AI助手的协作平台,都致力于提升人与AI的协同效率;二是底层与垂直领域的AI工具持续深化,无论是AI驱动的数据库客户端、SLM训练平台,还是利用WiFi信号进行感知的新颖技术,都预示着AI在更多细分场景和基础设施层面的成熟。
citrolabs/ego-lite 是一款创新的浏览器,专为用户及其 AI 代理并行工作而设计。它解决了传统浏览器无法原生支持 AI 代理协同操作的痛点,使用户和 AI 智能体能够共同浏览网页、执行任务,显著提升工作效率。典型场景包括研究、数据收集和自动化Web任务,让AI成为浏览器内的原生伙伴。
RuView 项目创新性地将普通的 WiFi 信号转化为实时空间智能、生命体征监测和存在检测能力,完全无需使用任何视频设备。它通过分析 WiFi 信号在环境中因人体移动或呼吸等造成的微小扰动,提取出高价值的环境和生理数据。这解决了传统监控方案中隐私侵犯、硬件复杂或覆盖范围有限的问题。RuView 适用于智能家居、医疗保健(如老人跌倒预警、睡眠监测)、安防监控以及任何需要非接触式、隐私友好型人体感知的应用场景。
`worldmonitor` 是一个实时全球情报仪表板,利用AI技术聚合新闻、监测地缘政治事件及关键基础设施动态。它提供统一的态势感知界面,旨在帮助分析师、研究人员或企业迅速掌握全球宏观环境变化,提升决策效率。适用于需要持续追踪国际局势和重大事件的专业人士。
`likec4` 旨在通过从代码直接生成「实时」架构图,解决软件架构文档难以维护和过时的问题。它提供了一种将代码与可视化架构图同步演进的方法,促进团队协作。开发团队可利用 `likec4` 保持架构图与实际系统一致,提升设计沟通效率。适用于软件工程师、架构师,在设计、文档化和演进复杂系统时使用。
OmniRoute 提供一个免费的 AI 网关,通过单一 API 端点集成超过231个 AI 提供商(其中50余个免费),旨在解决多模型调用的复杂性。它支持将 Claude Code、Codex、Cursor、Cline、Copilot 等编码助手连接至免费的 Claude、GPT、Gemini 等主流大模型,大幅降低开发成本。项目还采用 RTK+Caveman 堆叠压缩技术,可节省 15-95% 的数据传输开销,适合开发者统一管理 AI 服务、优化性能并利用免费资源进行高效开发。
Chat2DB 是一款强大的AI驱动数据库工具和SQL客户端,提供直观的图形用户界面。它旨在简化数据库操作和管理,支持包括MySQL、Oracle、PostgreSQL在内的多种主流数据库。该工具通过AI能力辅助用户编写SQL查询、分析数据,有效解决了传统数据库客户端操作复杂、跨数据库兼容性差的问题。适用于开发者、DBA和数据分析师,显著提升数据库交互和管理效率。
Freesolo Flash是一个全栈平台,专门用于训练小型语言模型(SLM)。它提供完整的工具链,助力开发者进行模型训练与部署。该平台解决了SLM开发与部署的复杂性,提供从数据准备、模型训练到推理优化的完整流程。适用于AI研究员、工程师和企业,以更低的成本和更高的效率开发和部署定制化的语言模型。
Automattic/harper 是一个离线、隐私优先的开源语法检查器,采用 Rust 语言开发,以提供高性能的文本分析。它解决了在线语法检查工具可能带来的隐私泄露问题,用户无需上传敏感文本即可在本地进行快速校对。适用于作家、学生、开发者等需要高效且注重隐私的文本润色场景。
Instatic 是一款现代化的自托管可视化内容管理系统(CMS),主打一分钟快速部署体验。它提供直观的图形界面,让用户能够轻松创建、编辑和发布网站内容,无需复杂的编码知识。该项目解决了传统 CMS 部署繁琐、或商业 CMS 费用高昂的问题,为开发者、小型企业和内容创作者提供了一个功能强大且易于掌控的平台。用户可以将其部署到自己的服务器上,完全掌控数据和网站运行环境,非常适合需要高度自定义和自主管理内容的场景。
Prosed是一项AI图书服务,能将用户内容转化为书籍,并以「展示其工作」的方式,增强AI生成过程的透明度和可信度。它旨在帮助内容创作者、作者或企业高效地将文章、博客、报告等零散内容整合成专业的电子书或实体书,省去繁琐的排版和编辑工作。其强调AI生成过程可验证,适用于追求效率和内容质量的出版需求。
Buzz是一款协作平台,它将用户团队成员、AI智能体和项目管理功能整合于一处,旨在提升团队协作效率和项目管理集中性。该平台通过引入AI智能体,帮助团队自动化重复任务、提供智能洞察和辅助决策,从而解决传统协作工具在复杂项目管理中效率瓶颈的问题。适用于需要高效协同、并希望利用AI提升生产力的团队。
Pushary是一款便捷的应用,用户无需解锁手机即可直接从锁屏界面审批AI请求,极大提升了AI交互的即时性和便利性。它解决了AI任务审批过程中频繁切换应用或解锁设备的痛点,让用户能以最快速度对AI生成的内容或建议做出响应。适用于经常与AI助手互动,需要即时批准或拒绝各项任务的用户。
「YC has it」是一项服务,用户只需描述其面临的问题,系统即可匹配并推荐由Y Combinator孵化的、能够解决该问题的初创公司。它利用自然语言处理和匹配算法,解决了用户在庞大的创业生态中寻找特定解决方案的痛点,为创业者、企业寻求创新合作或个人用户提供了一个高效的问题解决路径。适用于需要快速找到创新解决方案的用户或投资者。
Speakworld是一款语言学习应用,用户通过探索虚拟世界并与「当地人」对话来学习新语言,提供沉浸式的学习体验。它打破了传统语言学习的枯燥模式,通过情境化的互动和模拟真实对话,帮助学习者更自然地掌握语言。适用于渴望高效、有趣且沉浸式语言学习体验的初学者或进阶者。