TechCrunch · 07/24 04:33
AMD正式推出其AI机架规模系统Helios,旨在与英伟达展开竞争。该系统预计将于今年晚些时候向客户发货,标志着AMD在AI芯片和集成解决方案市场上的战略性扩张,以期提升其在数据中心AI领域的竞争力。
推荐理由:AMD推出重磅AI系统,直接对标行业巨头英伟达,预示着AI硬件市场竞争将进一步加剧,对行业格局产生重要影响。
TechCrunch · 07/24 04:33
AMD正式推出其AI机架规模系统Helios,旨在与英伟达展开竞争。该系统预计将于今年晚些时候向客户发货,标志着AMD在AI芯片和集成解决方案市场上的战略性扩张,以期提升其在数据中心AI领域的竞争力。
推荐理由:AMD推出重磅AI系统,直接对标行业巨头英伟达,预示着AI硬件市场竞争将进一步加剧,对行业格局产生重要影响。
X 推文 (AttentionVC) · 07/24 00:31
微软CEO萨提亚·纳德拉在其推文中,深入探讨了在AI赋予软件真实边际成本背景下,如何确保前沿技术效益能够广泛渗透整个生态系统。他强调需优化「成本-结果」边界,以最大化技术普及和价值创造,提出了对AI时代经济与技术发展的战略性思考。
推荐理由:微软CEO的观点深刻剖析了AI时代技术普及和商业模式的挑战,对于理解未来技术发展趋势和战略布局具有重要指导意义。
Claude (YouTube) · 07/23 23:42
Claude发布的一则YouTube短视频深入探讨了人工智能(AI)生成「幻觉」现象的深层原因。该视频解释了大型语言模型在文本生成过程中,如何产生看似合理但实则不准确或虚假的信息,旨在帮助用户更好地理解AI的局限性。
推荐理由:对于希望深入理解AI局限性和工作原理的用户,该视频提供了一个简明扼要的解释,有助于提高对AI输出的辨别能力。
The Decoder · 07/24 03:30
OpenAI在美国推出“ChatGPT健康”功能,整合Apple Health、医疗记录等数据。尽管每周有数亿用户咨询健康问题,但报告指出,仅付费用户能访问更强大的GPT-5.6 Sol模型,从而获得更优质的健康建议,凸显了AI服务的分级策略。
推荐理由:这则新闻揭示了AI在医疗健康领域的应用潜力及其商业模式,同时也引发了对AI服务公平性和付费墙影响的讨论。
The Verge · 07/24 03:00
Anthropic公司宣布,其AI模型Claude的语音模式已扩展至更强大的Opus和Sonnet模型,此前仅Haiku模型支持此功能。此次更新还包括语音模式与Gmail、Slack和Canva等应用的集成,旨在显著提升用户在多平台上的AI交互体验。
推荐理由:Claude语音模式的升级和应用集成,大大增强了AI模型的实用性和便捷性,预示着更自然的AI交互将成为主流。
GitHub Trending
`text-to-cad` 项目整合了多项AI代理技能,专为计算机辅助设计(CAD)、机器人技术及硬件设计领域打造。它通过自动化和智能化手段,协助工程师处理从概念到实现阶段的复杂任务,如文本生成CAD模型和优化机器人路径,旨在提升设计效率和精确性。
推荐理由:该项目将AI代理能力引入CAD、机器人和硬件设计,为工程师提供高效自动化工具,具有很高的实用价值和探索潜力。
V2EX · 07/23 18:04
V2EX社区讨论了使用Claude Code与DeepSeek模型时,因不明缓存机制导致费用异常飙升的问题,并寻求解决方案。这反映了在利用AI工具进行开发时,成本控制和资源管理的重要性,特别是对API调用和缓存行为的深入理解。
推荐理由:针对AI工具使用中的实际痛点,提供了潜在的解决方案和讨论,对于使用类似服务的开发者具有直接的参考价值,避免不必要的成本。
Hacker News · 07/24 03:26
Echo项目(echo.tracerml.ai)致力于通过整合多种开源模型而非单一模型,以更低成本(Fable三分之一)实现Fable级别的AI系统性能。这代表了一种创新的AI系统构建思路,旨在优化性价比,降低高性能AI的门槛。
推荐理由:该项目展示了如何通过策略性整合开源模型,以显著降低成本达到高端AI系统的效果,为追求效率和经济性的AI应用提供了新方向。
Product Hunt · 07/24 04:49
AgentLoop是一款旨在优化AI代理工作流的工具。它通过在每个操作周期启动一个全新的Codex代理工作者和评论员,确保每次迭代都能获得独立且新鲜的评估,从而有效提升任务执行的质量和整体效率。
推荐理由:该工具提供了一种新颖的AI代理迭代评估机制,有助于提升AI代理的开发效率和性能,对AI开发者具有直接实用价值。
HuggingFace Trending Papers · 07/22 08:00
论文《SLAI T-Rex》详述了在华为昇腾SuperPOD平台上对万亿参数DeepSeek-V4 MoE模型进行全参数后训练的挑战与优化。该项目旨在解决大规模分布式训练中的内存压力、通信开销等系统级难题,以提升模型在特定硬件上的训练效率和性能。
推荐理由:这项研究展示了在特定国产AI硬件上优化顶级大模型训练的突破性进展,对大模型工程化和硬件-软件协同优化具有重要参考价值。
AMD is challenging its chipmaker rival with a new rack-scale system that will start shipping to customers later this year.
中文介绍 AMD推出名为Helios的AI机架规模系统,旨在挑战竞争对手英伟达。该系统预计将于今年晚些时候开始向客户发货。此举标志着AMD在AI芯片市场进一步拓展,通过提供集成解决方案来增强其竞争实力。
In a memo to staff that was posted online, Conte the company's core business is strong, but that the platform has to respond to market changes and adjust its cost structure to remain stable.
中文介绍 创作者平台Patreon宣布裁员20%。首席执行官Conte在一份发给员工的备忘录中表示,尽管公司核心业务表现强劲,但为应对市场变化并调整成本结构以保持稳定,公司不得不做出此决定。
Corgi had announced a B1 round of $106 million at a $2.6 billion valuation at the end of May.
中文介绍 保险科技初创公司Corgi据报道在八周内完成第三轮融资,估值达到40亿美元。此前,该公司于5月底宣布完成1.06亿美元的B1轮融资,当时估值为26亿美元。此轮新融资显示市场对其业务的持续看好。
The new rule-making process follows a series of incidents, including fatal ones, in which people have become stuck inside cars.
中文介绍 鉴于此前发生多起乘客被困车内甚至致死的事故,特斯拉的门把手设计问题可能促使美国政府制定新的汽车安全规定。新的法规制定程序旨在提高车辆紧急情况下的逃生便利性,以避免类似悲剧再次发生,确保乘员安全。
As the chairman of the Federal Communications Commission, Brendan Carr has authority over the nation’s TV, radio, and internet. But since Donald Trump was elected to his second term, Carr has wielded that power to threaten broadcasters that have exercised their free speech rights to make jokes about
中文介绍 美国联邦通信委员会(FCC)主席布伦丹·卡尔(Brendan Carr)被指控,自唐纳德·特朗普第二次当选总统以来,滥用其监管电视、广播和互联网的权力,威胁行使言论自由权利的广播公司。此举引发了对第一修正案保护的担忧。
Meta has made significant investments in natural gas over the past year. Now it's dropping out of an industry renewable energy group.
中文介绍 Meta公司已退出一项主要的清洁能源协议,此前该公司在过去一年中对天然气进行了大量投资,并退出了一个行业可再生能源组织。此举正值Meta加速建设天然气基础设施之际,引发了对其清洁能源承诺的关注。
OpenAI is rolling out "Health in ChatGPT" to U.S. users, connecting Apple Health, medical records, and wellness apps. More than 300 million people already ask ChatGPT health questions every week, but paying users get better answers. The more powerful GPT-5.6 Sol model is reserved for premium subscri
中文介绍 OpenAI正向美国用户推出“ChatGPT健康”功能,可连接Apple Health、医疗记录和健康应用。每周有超过3亿人向ChatGPT咨询健康问题,但付费用户将获得更优质的答案,因为更强大的GPT-5.6 Sol模型仅供付费用户使用。
Claude's new voice model will let you reschedule your meeting or draft an email.
中文介绍 Anthropic公司已更新其人工智能模型Claude的语音模式,现在支持更强大的模型,从而能够处理更复杂的任务。用户可以通过语音指令进行会议改期、起草电子邮件等操作,提升了交互的便捷性和效率,使AI助手功能更趋完善。
Until now, voice mode has only been available on Claude Haiku, Anthropic's faster but less powerful model. Now the company is making its Opus and Sonnet models available in voice mode, and extending its reach into apps like Gmail, Slack, and Canva. When Anthropic launched voice mode last year, it wa
中文介绍 Anthropic公司宣布,其人工智能模型Claude的语音模式现已支持更强大的Opus和Sonnet模型,此前该功能仅限于Haiku模型。此外,语音模式的应用范围也进一步扩大,可集成至Gmail、Slack和Canva等常用应用中,提升用户在多平台上的交互体验。
The clip features the David Bowie track “Five Years,” which includes lyrics such as “Earth was really dying (dying).”
中文介绍 Meta公司发布的新AI广告中,意外地选用了大卫·鲍伊(David Bowie)一首关于世界末日的歌曲「Five Years」,歌词中包含“地球正在死去”等内容。这种将末日主题歌曲用于“感觉良好”的AI广告,引发了公众对其广告意图和信息传达的讨论。
AegisAI co-founders developed AI agents that quickly analyze each message as a human would, paying attention to small anomalies that even the most elaborate checklist wouldn’t catch.
中文介绍 由前谷歌安全高管创立的AegisAI公司已获得3600万美元融资,专门用于开发阻止AI驱动的鱼叉式网络钓鱼的技术。该公司的AI代理能够像人类一样快速分析每条消息,并识别出传统检测方法难以发现的微小异常,从而提升网络安全防护能力。
Patreon is laying off 20 percent of its workers, or around 93 employees, as reported earlier by 404 Media. In a memo to employees, Patreon CEO Jack Conte writes that the company isn't making these changes "because we believe AI replaces humans," but says AI has "fundamentally transformed the tech in
中文介绍 创作者平台Patreon宣布将裁员20%,涉及约93名员工。首席执行官杰克·孔戴(Jack Conte)在致员工的备忘录中指出,此次调整并非源于人工智能(AI)取代人类,而是因为AI“从根本上改变了”行业格局,公司需据此调整运营策略。
Black Forest Labs has released Flux 3, a multimodal foundation model that learns from images, video, and audio and can generate video with native sound for the first time. BFL's own tests put it just ahead of market leader Seedance 2.0, though independent results aren't yet available. The company ul
中文介绍 Black Forest Labs发布了多模态基础模型Flux 3,该模型首次能够生成长达20秒并带有原生音频的视频,实现了一项重要突破。Flux 3通过学习图像、视频和音频数据进行生成。根据Black Forest Labs内部测试,Flux 3的性能略优于市场领导者Seedance 2.0。
Also, the full trailer for Zach Cregger's Resident Evil features a likable everyman.
中文介绍 电影《Coyote vs. Acme》的最终预告片已在圣地亚哥国际动漫展(SDCC)上正式发布。
An updated government advisory warns that Iranian hackers are exploiting systems used by water and energy providers.
中文介绍 美国政府发布最新警告称,与伊朗有关联的黑客正在攻击并干扰美国的供水和能源供应商所使用的系统。政府咨询报告指出,这些黑客正在利用系统漏洞,对关键基础设施构成威胁,已导致相关服务中断。
Rust · ★ 6,497 · 🍴 520 · 📈 2,460 stars today
A hive mind communication platform
中文介绍 block/buzz 是一个“蜂巢思维”通信平台,旨在为团队或社区提供高效的分布式协作与沟通方式。它可能通过聚合多方信息流,促进集体决策和知识共享,解决传统通信工具在大型、去中心化组织中效率低下的问题。适用于需要紧密协同、信息高度共享的团队或组织。
TypeScript · ★ 71,351 · 🍴 10,781 · 📈 3,196 stars today
Real-time global intelligence dashboard. AI-powered news aggregation, geopolitical monitoring, and infrastructure tracking in a unified situational awareness interface
中文介绍 `worldmonitor` 是一个实时全球情报仪表板,利用AI技术聚合新闻、监测地缘政治事件及关键基础设施动态。它提供统一的态势感知界面,旨在帮助分析师、研究人员或企业迅速掌握全球宏观环境变化,提升决策效率。适用于需要持续追踪国际局势和重大事件的专业人士。
Python · ★ 32,984 · 🍴 5,643 · 📈 398 stars today
Kronos: A Foundation Model for the Language of Financial Markets
中文介绍 `Kronos` 是一个专为金融市场语言设计的基础模型(Foundation Model)。它旨在理解并处理复杂的金融文本数据,包括新闻、财报、研报等,解决传统模型在金融领域专业性不足的问题。通过深入学习金融领域的独特术语和上下文,`Kronos` 能帮助金融分析师、量化研究员等进行更精准的市场情绪分析、信息提取和趋势预测。
Rust · ★ 8,842 · 🍴 611 · 📈 563 stars today
Empowering everyone to host fast and efficient Minecraft servers.
中文介绍 `Pumpkin` 旨在赋能所有用户轻松托管快速高效的 Minecraft 服务器。它解决了传统 Minecraft 服务器部署复杂、性能优化困难的问题,通过提供简化的工具或优化的底层实现,确保服务器运行流畅、资源利用率高。无论是个人玩家、小型社区还是希望提供卓越游戏体验的服务器管理员,`Pumpkin` 都能帮助他们以更低的门槛和更高的效率搭建和管理自己的 Minecraft 世界。
JavaScript · ★ 1,538 · 🍴 89 · 📈 219 stars today
The best browser for both you and your AI agents work in parallel.
中文介绍 citrolabs/ego-lite 是一款创新的浏览器,专为用户及其 AI 代理并行工作而设计。它解决了传统浏览器无法原生支持 AI 代理协同操作的痛点,使用户和 AI 智能体能够共同浏览网页、执行任务,显著提升工作效率。典型场景包括研究、数据收集和自动化Web任务,让AI成为浏览器内的原生伙伴。
Assembly · ★ 71,043 · 🍴 7,915 · 📈 599 stars today
Original Apollo 11 Guidance Computer (AGC) source code for the command and lunar modules.
中文介绍 `Apollo-11` 项目收录了阿波罗11号任务中指令舱和登月舱制导计算机(AGC)的原始源代码。这份历史性代码不仅是早期航天工程的瑰宝,也展现了在极其有限的计算资源下,工程师如何编写出可靠且关键的飞行控制程序。它对于计算机历史研究者、软件考古学家及航天爱好者具有极高的参考和教育价值。
TypeScript · ★ 26,957 · 🍴 3,537 · 📈 1,925 stars today
Never stop coding. Free MIT AI gateway: one endpoint, 290+ providers (90+ free), 500+ models — Kimi, Claude, GPT, OpenAI, Gemini, GLM, DeepSeek, MiniMax. Works with Claude Code, Codex, Cursor, OpenCode, Cline & Copilot. Quota-aware auto-fallback, RTK+Caveman compression saves 15-95% tokens, MCP/A2A,
中文介绍 OmniRoute 提供一个免费的 AI 网关,通过单一 API 端点集成超过231个 AI 提供商(其中50余个免费),旨在解决多模型调用的复杂性。它支持将 Claude Code、Codex、Cursor、Cline、Copilot 等编码助手连接至免费的 Claude、GPT、Gemini 等主流大模型,大幅降低开发成本。项目还采用 RTK+Caveman 堆叠压缩技术,可节省 15-95% 的数据传输开销,适合开发者统一管理 AI 服务、优化性能并利用免费资源进行高效开发。
Python · ★ 69,352 · 🍴 7,848 · 📈 637 stars today
A curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows
中文介绍 `awesome-claude-skills` 是一个精选资源列表,专门收集了用于定制和扩展 Claude AI 工作流的“技能”、工具和相关资源。它旨在帮助开发者和AI爱好者发现和利用各种插件、API 集成或功能调用方法,从而更高效地构建基于 Claude AI 的自定义应用和自动化流程,解决在特定场景下Claude原生能力不足的问题。
JavaScript · ★ 9,907 · 🍴 1,094 · 📈 293 stars today
A collection of agent skills for CAD, robotics and hardware design
中文介绍 `text-to-cad` 汇集了一系列专门为计算机辅助设计(CAD)、机器人技术和硬件设计领域打造的AI代理技能。这些技能旨在通过自动化和智能化方式,辅助工程师和设计师处理从概念到实现过程中的复杂任务,例如基于文本生成CAD模型、优化机器人路径规划或辅助硬件布局。它能显著提升设计效率和精确性。
TypeScript · ★ 2,322 · 🍴 323 · 📈 315 stars today
Web UI for the pi coding agent
中文介绍 `pi-web` 项目为 `pi coding agent` 提供了一个直观易用的Web用户界面。它旨在简化用户与AI编程代理的交互过程,摆脱命令行操作的复杂性,通过浏览器即可轻松部署、配置和管理agent,并查看其工作输出。此Web UI极大地提升了 `pi coding agent` 的可访问性和用户体验,适合各类开发者。
Go · ★ 11,393 · 🍴 785 · 📈 265 stars today
Open-source & free — Battle-tested at Alibaba's scale. Hybrid architecture code review tool: deterministic pipelines + LLM Agent, precise line-level comments, built-in fine-tuned ruleset (NPE, thread-safety, XSS, SQL injection), OpenAI & Anthropic compatible.
中文介绍 alibaba/open-code-review 是阿里巴巴开源且免费的代码审查工具,经阿里大规模实践验证。它采用混合架构,结合确定性分析流水线和 LLM 智能体,能生成精确到行级别的代码评论。内置针对 NPE、多线程等问题的预训练规则集,旨在提升代码质量与开发效率。适用于各类团队进行高效、智能化的代码审查。
Rust · ★ 85,097 · 🍴 11,363 · 📈 1,726 stars today
π RuView turns commodity WiFi signals into real-time spatial intelligence, vital sign monitoring, and presence detection — all without a single pixel of video.
中文介绍 RuView 项目创新性地将普通的 WiFi 信号转化为实时空间智能、生命体征监测和存在检测能力,完全无需使用任何视频设备。它通过分析 WiFi 信号在环境中因人体移动或呼吸等造成的微小扰动,提取出高价值的环境和生理数据。这解决了传统监控方案中隐私侵犯、硬件复杂或覆盖范围有限的问题。RuView 适用于智能家居、医疗保健(如老人跌倒预警、睡眠监测)、安防监控以及任何需要非接触式、隐私友好型人体感知的应用场景。
Rust · ★ 1,315 · 🍴 163 · 📈 395 stars today
中文介绍 Julian-adv/OpenMMO 是一个开源的大型多人在线(MMO)游戏开发框架或服务器端解决方案。它旨在为游戏开发者提供构建 MMORPG 等大规模在线游戏所需的基础架构,解决从网络同步、数据持久化到玩家交互等核心挑战。开发者可基于此项目快速启动自己的MMO游戏项目。
TypeScript · ★ 4,652 · 🍴 314 · 📈 475 stars today
Visualize, collaborate, and evolve the software architecture with always actual and live diagrams from your code
中文介绍 `likec4` 旨在通过从代码直接生成“实时”架构图,解决软件架构文档难以维护和过时的问题。它提供了一种将代码与可视化架构图同步演进的方法,促进团队协作。开发团队可利用 `likec4` 保持架构图与实际系统一致,提升设计沟通效率。适用于软件工程师、架构师,在设计、文档化和演进复杂系统时使用。
Rust · ★ 12,170 · 🍴 451 · 📈 590 stars today
Offline, privacy-first grammar checker. Fast, open-source, Rust-powered
中文介绍 Automattic/harper 是一个离线、隐私优先的开源语法检查器,采用 Rust 语言开发,以提供高性能的文本分析。它解决了在线语法检查工具可能带来的隐私泄露问题,用户无需上传敏感文本即可在本地进行快速校对。适用于作家、学生、开发者等需要高效且注重隐私的文本润色场景。
C# · ★ 54,696 · 🍴 5,164 · 📈 66 stars today
The Free Software Media System - Server Backend & API
中文介绍 jellyfin/jellyfin 是一个免费的开源媒体系统,提供完整的服务器后端与 API。它使用户能够自主管理、整理并流式传输个人影音、图片等媒体内容至各种设备,摆脱对付费或闭源服务的依赖。Jellyfin 旨在构建一个完全由用户掌控的媒体中心,是自建家庭影院或媒体库的理想选择。
@sairahul1 · 130.6K 粉丝 · 1.5M 阅 · 507 赞 · 59 转
I run a one-person business. No team. No employees. No co-founder. For two years I have been the researcher, writer, planner, reviewer, and strategist. All of it. At once. Last week I tried something
中文介绍 这位独立创业者分享了如何利用 AI 智能体组建一个「虚拟团队」,以应对研究、写作、规划、审核和策略制定等多重业务角色。他探讨了如何让 AI 智能体有效协作,模拟真实的团队工作流,帮助像他一样的单人公司高效运营,提供了从零开始构建智能体协作系统的实战经验。
@addyosmani · 407.1K 粉丝 · 636.9K 阅 · 503 赞 · 49 转
A software factory is harnessed loops at scale. You can run the loop with humans in it (light factory): trading judgment and concentration against speed and breakage. Or you can ignore the humans
中文介绍 博主阐述了「软件工厂」概念,将其分为两种模式:由人类参与的「明工厂」(Light Factory),通过权衡判断力与速度;以及完全自动化、忽略人类参与的「暗工厂」(Dark Factory)。探讨了大规模软件开发中的不同策略与挑战。
@PeterMcCrory · 46.5K 粉丝 · 399.2K 阅 · 514 赞 · 106 转
I thought I’d share a few high-level reflections and a framework that helps me make sense of why we (so far) don’t see significant impact of AI on the US labor market. I focus on the US because (a) AI
中文介绍 博主分享了对 AI 至今尚未显著提升美国失业率的看法,并提出了一个分析框架来解释这一现象。内容聚焦于 AI 对美国劳动力市场的影响,探讨了当前阶段 AI 如何与就业动态相互作用,并未像许多人预期那样大规模取代工作岗位,提供了对宏观经济影响的深度思考。
@nifinet · 11.0K 粉丝 · 337.0K 阅 · 518 赞 · 33 转
Earlier this year, Andrej Karpathy (@karpathy) pointed an agent at his own training code and let it run for two days. It ran 700 experiments, kept the 20 that beat the benchmark, and made the model
中文介绍 介绍如何构建一个自我改进的系统,灵感源于 Andrej Karpathy 的实验。Karpathy 让一个 agent 针对自身训练代码运行两天,执行了 700 次实验,并筛选出 20 个优于基准的成果。此方法展示了通过 AI agent 驱动的自动化实验,持续优化模型和代码的潜力。
@CliffordSosin · 16.4K 粉丝 · 197.0K 阅 · 514 赞 · 49 转
Superintelligence arrived. You probably didn't notice, because it turned out to be kind of incremental. Don't believe me? Run the test. Talk to Fable 5 for an hour, then talk to your ten smartest
中文介绍 博主探讨了「超级智能」的到来,指出其以渐进式而非颠覆性方式出现,因此可能未被察觉。他建议进行一项测试:与 Fable 5 交流一小时,再与十位最聪明的人交流,以感受这种「增量式超级智能」。
@EXM7777 · 128.5K 粉丝 · 173.6K 阅 · 521 赞 · 51 转
I'm going to show you how to build your first team of AI agents... and how to wire them into a self improving loop inside a shared workspace the team we're building has 5 agents, one for each function
中文介绍 该推文详细讲解如何构建首个 AI 智能体团队,并将其整合到自我改进循环的工作流中。教程涵盖在共享工作空间内连接智能体的步骤,特别提到构建一个由 5 个具备独立功能的智能体组成的团队。
@0xCodez · 23.9K 粉丝 · 154.5K 阅 · 510 赞 · 73 转
Most people who try to build a multi-step agent end up with a straight line. Step one, step two, step three - each waiting politely for the last to finish before it starts. 9/10 notice that half those
中文介绍 博主分享利用 Claude 进行「图工程」的 14 步路线图,旨在解决构建多步骤 agent 时常见的线性执行问题。许多人在设计 agent 时常陷入简单串联模式,而此教程将展示如何从零开始,通过图工程方法构建更复杂、非线性的 AI agent 工作流。
@satyanadella · 7.5M 粉丝 · 153.7K 阅 · 923 赞 · 114 转
In a world where software has real marginal cost for the first time, how do we ensure frontier benefits are diffused across the entire ecosystem? The key is to optimize the cost-to-outcome frontier in
中文介绍 微软 CEO Satya Nadella 探讨了在软件首次具有真实边际成本的时代,如何确保前沿技术(特别是 AI)的效益能够广泛扩散至整个生态系统。他强调关键在于优化「成本-结果」边界,以实现最大化的技术普及和价值创造,提出了对 AI 时代技术发展和经济模式的战略思考。
@Vtrivedy10 · 13.9K 粉丝 · 152.6K 阅 · 503 赞 · 50 转
Today we’re releasing our Eval Engineering Skill, a skill that helps coding agents build evals using context from a repository and agent traces. The skill inspects how an agent is structured, mines
中文介绍 博主发布了名为「Eval Engineering Skill」的新工具,旨在帮助编码智能体自动构建评估(evals)。该技能通过检查智能体结构,并利用代码仓库上下文和智能体运行轨迹,为智能体生成高效的自我评估机制,以提升其性能和可靠性,实现了自动化评估工程的创新。
@pmarca · 4.9M 粉丝 · 146.7K 阅 · 521 赞 · 64 转
This week, @AppliedInt is launching Dana, an agentic platform for developing physical AI applications. Applied Intuition began by building the tools engineers needed to develop autonomous systems,
中文介绍 Applied Intuition本周正式推出「Dana」平台,这是一个专注于开发物理AI应用的代理平台。它旨在为工程师提供构建自主系统所需的工具,助力加速实体AI的落地与规模化部署,推动智能机器的普及。
@EXM7777 · 128.5K 粉丝 · 124.5K 阅 · 520 赞 · 54 转
I'm going to show you how to build your first agent graph and put it to work in your business today: A team of AI agents that researches in parallel, tries to kill its own findings, and hands you one
中文介绍 该博主将展示如何构建首个「智能体图」(agent graph)并将其应用于业务中。这个智能体团队能够并行进行研究、主动验证并「反驳」自身发现,最终提供精炼的见解。这是一个关于如何设计和实现高效协作式 AI 智能体工作流的教程,旨在帮助用户掌握图工程技术。
@jack · 10.3M 粉丝 · 109.6K 阅 · 782 赞 · 93 转
yesterday we released buzz. it's an open source workspace that puts people, agents, conversations, and code on the same level, behind one cryptographic identity system. we built it to reduce our
中文介绍 Jack Dorsey 发布了「buzz」,一个开源工作区,旨在将人员、智能体、对话和代码整合到一个统一的加密身份系统之下。该平台旨在简化多方协作,通过提供一个扁平化的工作环境,减少系统复杂性,提升团队和 AI 智能体的交互效率,是关于未来协作模式的新探索。
@almonk · 12.8K 粉丝 · 107.4K 阅 · 531 赞 · 69 转
I like AI. I worked at an AI company for nearly three years and I use it every day. I am glad software is getting easier to make. But we can recognise that when the bar to entry drops, quality drops
中文介绍 博主指出,AI虽然降低了软件开发门槛并加速制作过程,但伴随进入门槛的下降,软件质量也可能随之下降。这是AI普及后软件开发领域需警惕的现象,引发对软件行业未来发展方向的思考。
@elliotarledge · 40.7K 粉丝 · 69.3K 阅 · 506 赞 · 45 转
This is the Kimi K3 post you guys have been waiting for. I got some early access to this model and have been testing it on kernels, and even before seeing the benchmark scores I was impressed with its
中文介绍 博主获得了Kimi K3模型的早期访问权限,并对其进行了初步测试和KernelBench基准评估。在未查看具体分数前,博主已对Kimi K3的性能印象深刻。这篇分享为期待Kimi K3的用户提供了第一手体验和性能洞察,预示着该模型可能在某些任务上展现出强大的能力。
@herrcore · 15.4K 粉丝 · 64.2K 阅 · 514 赞 · 84 转
tl;dr K3 makes us question why we are paying Anthropic. We’ve been using Opus as our go-to model for reverse engineering tasks since the release of 4.5, and with each new release, it feels like we
中文介绍 博主对 Kimi K3 进行了逆向工程任务评测,并与 Anthropic 的 Opus 模型对比。评测结果表明,Kimi K3 在此类任务中表现出色,甚至让博主质疑继续为 Opus 付费的必要性。这暗示 Kimi K3 可能是逆向工程领域中,一个性能与性价比俱佳的替代方案。
@TheVixhal · 22.7K 粉丝 · 53.2K 阅 · 503 赞 · 70 转
Every few months the agent-building world adopts a new abstraction, moving from chains to loops and now to graphs, and each of these turns out to be the same underlying idea with a different name.
中文介绍 探讨AI代理构建中抽象概念的演变,从早期的chains到loops,再到当前的graphs。指出这些不同的抽象模式,如状态机,实则反映了同一个底层思想,只是命名和表现形式有所不同,帮助理解代理设计的本质。
@IntuitMachine · 62.3K 粉丝 · 50.7K 阅 · 552 赞 · 47 转
What the shift in AI agent architecture is really about Peter Steinberger just posted nine words that gathered thousands of likes: https://x.com/steipete/status/2078277297791189132 "Are we still talking loops or did we
中文介绍 该推文探讨了 AI 智能体架构的关键转变,从传统的「循环工程」(Loop Engineering)转向「图工程」(Graph Engineering)。文章引用 Peter Steinberger 的热门观点,提出对当前智能体设计范式的深刻反思。
@enginoid · 1.1K 粉丝 · 49.9K 阅 · 522 赞 · 37 转
Linear is probably my best-value subscription at the moment. I pay the sole user fee of $12/mo and the company agents have eaten through ~400 issues in the past month. I use Linear to organize my
中文介绍 博主分享如何利用项目管理工具 Linear 管理 AI agent 的工作流。他每月支付 $12 订阅费,其公司 agent 在过去一个月内处理了约 400 个问题。该分享展示了将 Linear 与 AI agent 结合以大幅提升生产力的方法,并倡导构建「软件工厂」的理念。
@mem0ai · 19.0K 粉丝 · 43.5K 阅 · 509 赞 · 49 转
In April 2026, Andrej Karpathy published a GitHub Gist describing a pattern he called the LLM Wiki. In the months since, four different teams have shipped the same idea without coordinating:
中文介绍 介绍了Andrej Karpathy于2026年4月提出的「LLM Wiki」模式。此后数月内,已有四个团队在未协调的情况下独立实现了相似的代理架构,凸显了该模式在LLM记忆和知识管理中的重要性与共识。
@ClaudeDevs · 614.2K 粉丝 · 40.3K 阅 · 689 赞 · 40 转
Code migrations, projects that port a production codebase to a new language, were multi-year endeavors until recently. In the last month, individual developers at Anthropic migrated 10 code packages
中文介绍 Anthropic 团队分享了如何利用 Claude Code 大幅加速代码迁移项目。此前耗时多年的大规模生产代码库迁移,现在通过 Claude Code 的辅助,单个开发者在一个月内即可完成 10 个代码包的移植,极大地提升了效率。
@satyanadella · 7.5M 粉丝 · 153.7K 阅 · 7d 曝光 153.7K
Frontier Diffusion & Control
@FuckAnthropic · 787 粉丝 · 109.8K 阅 · 7d 曝光 109.8K
梁文锋投资人会议文字稿修正稿
@jack · 10.3M 粉丝 · 109.6K 阅 · 7d 曝光 109.6K
why we're buzzing
@HoodAI0x · 5.6K 粉丝 · 15.1K 阅 · 7d 曝光 15.1K
Robinhood let AI agents trade. Hood AI makes sure they can be trusted.
@PeterMcCrory · 46.5K 粉丝 · 399.2K 阅 · 7d 曝光 399.2K
Why hasn’t AI increased unemployment?
@Vtrivedy10 · 13.9K 粉丝 · 152.6K 阅 · 7d 曝光 152.6K
Towards Automating Eval Engineering
@EXM7777 · 128.5K 粉丝 · 124.5K 阅 · 7d 曝光 124.5K
How to master graph engineering (Full Course)
@sairahul1 · 130.6K 粉丝 · 1.5M 阅 · 7d 曝光 1.5M
How to Build a Team of AI Agents That Actually Work Together (Full Course)
@ClaudeDevs · 614.2K 粉丝 · 40.3K 阅 · 7d 曝光 40.3K
How Anthropic runs large-scale code migrations with Claude Code
@GoogleAIStudio · 188.3K 粉丝 · 26.4K 阅 · 7d 曝光 26.4K
What's new in Gemini 3.6 Flash and 3.5 Flash-Lite
@mem0ai · 19.0K 粉丝 · 43.5K 阅 · 7d 曝光 43.5K
The State of Agent Wikis
@Tesla · 24.8M 粉丝 · 348.9K 阅 · 7d 曝光 348.9K
Summer Release 2026
@pmarca · 4.9M 粉丝 · 146.7K 阅 · 7d 曝光 146.7K
Making a Billion Intelligent Machines
@pontusab · 31.6K 粉丝 · 41.4K 阅 · 7d 曝光 41.4K
How to Get a 100 PageSpeed Score with Next.js and Vercel - Without Killing Your Design
@almonk · 12.8K 粉丝 · 107.4K 阅 · 7d 曝光 107.4K
Quality Software
@addyosmani · 407.1K 粉丝 · 636.9K 阅 · 7d 曝光 636.9K
Software Factories, Light and Dark
👍 2
3D Gaussian Splatting (3DGS) achieves high-quality novel-view synthesis by optimizing freely placed primitives in 3D and adaptively densifying them in under-reconstructed regions. However, this scene-adaptive capacity allocation is largely lost in existing feed-forward 3DGS methods, which commonly r
中文介绍 ATSplat 提出一种紧凑的前馈 3D 高斯泼溅 (3DGS) 方法,通过自适应令牌扩展解决了现有前馈 3DGS 方法中场景自适应容量分配的缺失问题。3DGS 以优化 3D 基元和自适应稠密化实现高质量新视图合成。该研究旨在提升 3DGS 在复杂场景中的效率与表现。
👍 0
Optical Character Recognition (OCR) for Persian remains substantially less mature than for Latin-script languages despite Persian being spoken by more than 110 million people across multiple countries. This gap arises from two fundamental challenges: the intrinsic complexity of the Perso-Arabic writ
中文介绍 针对波斯语光学字符识别 (OCR) 技术相对不成熟的问题,研究者提出了一个名为「Persian Pixel」的大规模合成波斯语 OCR 数据集。波斯语使用者超过 1.1 亿,但其 OCR 发展滞后于拉丁语系,主要源于语言自身的复杂性。该数据集旨在推动波斯语 OCR 的进步。
👍 2
Natural-language autoencoders score explanations of hidden activations by reconstruction: an explanation is deemed faithful if the activation can be regenerated from it. The test is structurally insensitive to individual false claims: if flipping a claim does not change the reconstruction, the claim
中文介绍 该研究探讨了自然语言自编码器中可验证激活解释的问题。现有方法通过重建得分评估解释的忠实性,但这种测试对单个虚假断言不敏感。论文提出「可解码性监督」(Decodability Supervision) 方法,旨在训练模型而非依赖读者来提供更准确、可验证的隐藏激活解释,以提高模型可解释性。
👍 29
Recent autoregressive video diffusion methods are increasingly built upon Self Forcing, where the student is trained on histories produced by its own rollout rather than ground-truth video contexts. This reduces exposure bias, but the historical key-value cache is still used by future frames only as
中文介绍 该论文提出了「自梯度强制」(Self Gradient Forcing) 方法,用于原生长时间视频外推。当前自回归视频扩散方法常依赖「自强制」训练,即学生模型学习自身生成的历史数据以减少曝光偏差。然而,历史键值缓存仍存在局限性。新方法旨在克服这些限制,提升长视频生成的能力。
👍 0
Large language models (LLMs) can generate fluent Arabic answers, yet factual errors remain difficult to detect, localize, explain, and verify. Existing hallucination benchmarks often provide response-level labels, with limited support for identifying the exact erroneous content, explaining why it is
中文介绍 针对大型语言模型 (LLMs) 在阿拉伯语问答中出现的幻觉问题,研究者提出了「HalluTruthQA」基准测试。尽管 LLMs 能生成流利的阿拉伯语回答,但事实错误难以检测、定位、解释和验证。现有幻觉基准通常仅提供响应级别标签。HalluTruthQA 旨在提供更细粒度的支持,以精确识别错误内容。
👍 0
Practical robotic grasping in complex scenes requires both 3D spatial reasoning and alignment with task-specific requirements. Vision-language models (VLMs) offer a natural way to specify these requirements using language, but existing approaches either use a VLM to predict the grasp directly with l
中文介绍 该论文介绍了「SeededGrasp」方法,旨在实现复杂多实体场景下的语言引导机器人抓取。实用的机器人抓取需兼顾 3D 空间推理和任务特定要求。视觉-语言模型 (VLMs) 能以自然语言指定这些需求,但现有方法在预测抓取方面存在局限。SeededGrasp 旨在克服这些挑战,提升机器人抓取能力。
👍 44
Full-parameter post-training of trillion-parameter-scale MoE models introduces substantial system-level challenges for large-scale distributed training, including severe memory pressure, non-overlapped communication overhead, and inefficient kernel execution. While most large-scale LLM training syst
中文介绍 该论文介绍了「SLAI T-Rex」项目,旨在华为昇腾 SuperPOD 上对万亿参数规模的 DeepSeek-V4 系列 MoE 模型进行全参数后训练。这种大规模分布式训练面临严峻的系统级挑战,包括内存压力、通信开销和内核执行效率低下。SLAI T-Rex 旨在克服这些挑战,优化 DeepSeek-V4 模型在特定硬件平台上的训练性能。
👍 0
LLM-based agents leverage third-party skills to extend their capabilities in open-world scenarios. However, third-party skills can introduce extra security vulnerabilities, as seemingly harmless skills can contain latent safety risks that only emerge during actual execution. In this work, we conduct
中文介绍 该论文提出了「OpenSkillRisk」,一个用于评估基于大型语言模型 (LLM) 的代理在使用现实世界第三方技能时安全性的基准。LLM 代理通过第三方技能扩展功能,但这些技能可能引入安全漏洞和潜在风险,只有在实际执行时才会显现。OpenSkillRisk 旨在量化和解决这些安全隐患。
👍 0
Contextual entrainment is the tendency of a model to let auxiliary context in its input pull its output, independently of whether that context is relevant, true, or even meaningful. Recently, it has been identified and given a mechanistic account in unimodal language models. Whether and how it manif
中文介绍 该论文提出了「ENTRAP-VL」,一种用于探测视觉-语言模型 (VLMs) 中双重上下文牵引现象的分类探针。上下文牵引指模型输出受输入中辅助上下文影响,无论其相关性或真实性。此现象已在单模态语言模型中被识别。ENTRAP-VL 旨在系统性地研究 VLMs 中多模态上下文如何相互作用并牵引模型行为。
👍 0
Long-horizon tasks require sustained perception, reasoning, and exploration, and are a persistent challenge for large language model (LLM) agents. This gap is reflected in their limited performance on continual learning benchmarks such as ARC-AGI-3, especially when models are evaluated out of the bo
中文介绍 针对大型语言模型 (LLM) 代理在长周期任务中感知、推理和探索能力不足的挑战,该论文提出了「PRO-LONG」方法。通过引入程序化记忆,PRO-LONG 旨在提升 LLM 代理在如 ARC-AGI-3 等持续学习基准测试中的表现。此方法有望使 LLM 代理能够进行更长时间、更复杂的推理。
👍 3
Embodied visual tracking (EVT) requires a mobile agent to continuously follow a specific target described in natural language using only onboard vision. While recent vision-language-action (VLA) policies unify target identification and trajectory planning, their chain-of-thought (CoT) reasoning ofte
中文介绍 该论文提出了「ReferTrack」方法,用于具身视觉跟踪 (EVT)。EVT 要求移动代理仅凭车载视觉持续追踪自然语言描述的特定目标。尽管近期视觉-语言-动作 (VLA) 策略已整合目标识别和轨迹规划,但其思维链过程存在局限。ReferTrack 旨在通过「指代后追踪」范式,提高具身代理在复杂环境中的目标跟踪效率和准确性。
👍 3
Large language models can answer scientific questions, yet a correct output does not reveal whether the model represents or uses the governing physics. Here we show that materials science mechanism information in the open-weight google/gemma-4-E4B-it model has three experimentally separable forms: c
中文介绍 该论文研究了开放权重语言模型 `google/gemma-4-E4B-it` 如何表征和运用材料科学机制信息。尽管大型语言模型能回答科学问题,但其是否真正理解潜在物理原理仍不明确。研究通过实验证实,该模型中的材料科学机制信息具备三种可验证的特性。这为理解和引导 LLM 在科学领域的内部表征提供了新视角。
👍 2
The ability to acquire skills rapidly and effortlessly while retaining those already mastered is essential for robots. However, current methods still rely on a cumbersome training-time loop that is costly and slow, while eroding skills already mastered. In this paper, we introduce HOST (Human-to-rob
👍 0
tiny_schiller closes the small-language-model prototyping, fine-tuning, education, and research gap for German literary text, providing a single-file, drop-in counterpart to Karpathy's tiny_shakespeare. The available German literary corpora are larger and richer, but require parser engineering befor
👍 2
This work introduces G-MAD, an open-source framework that uses Arma3 to generate synchronized multi-view RGB-T data for aerial object detection. G-MAD addresses key limitations of real-world aerial dataset construction, including limited viewpoint control, imperfect RGB-T alignment and high annotati
👍 0
Agent safety is moving from content moderation toward preventing operational failures before tool-using agents act. We propose Janus, a foresight-oriented framework for long-horizon agent safety that trains guards to anticipate delayed risks from partial trajectories. Janus synthesizes diverse agent
👍 4
As autonomous agents rapidly evolve, their ability to reliably manipulate ubiquitous digital documents has become critical for enabling general-purpose AI assistants and automating complex workspace workflows. In this paper, we introduce DocOps, a deterministically verifiable evaluation framework un
👍 1
There is growing evidence that data diversity is crucial for developing fair and robust NLP models. However, current approaches to measure diversity remain inconsistent and fragmented: While there exist a number of tools for measuring the lexical diversity of texts, researchers lack standardized too
👍 0
Traditional pentesting uses reconnaissance at each step to uncover unseen weaknesses, build stronger attacks, and advance the objective; we argue that AI agents require the same treatment. We formalize agent reconnaissance by modeling the process and identifying the knowledge assets it seeks to extr
👍 3
Reinforcement learning with verifiable rewards (RLVR) has substantially improved language-model reasoning, yet its extension to vision-language models remains constrained by the lack of training data that are simultaneously broad, exactly verifiable, and reproducible. We introduce Trace, a taxonomy-
👍 1
Model-based reinforcement-learning agents of the DreamerV3 family forget catastrophically when trained on task sequences, even when an unbounded replay buffer preserves every earlier experience. We ask a question the continual-RL literature has assumed an answer to but never measured: which componen
👍 24
As large language models and AI agents become the primary consumers of search results, document set quality determines the upper bound of downstream generation. Yet existing evaluation systems remain confined to scoring documents independently and aggregating via nDCG, ignoring inter-document intera
👍 3
Reinforcement learning with verifiable rewards has become the predominant recipe for eliciting test-time scaling in explicit Chain-of-Thought reasoners. Yet this scaling path remains computationally costly, since every intermediate step must be decoded as a language token. Latent reasoning instead c
👍 0
Real-to-sim conversion for robotic interaction with objects remains labor-intensive because it requires more than visual reconstruction: a streamlined real2sim process must recover scene geometries and object states, infer physical parameters, and assemble actors, objects, cameras, poses, and trajec
👍 14
Scaling executable agent training data for LLM post-training is bottlenecked by substrate-bound methods that tie task generation to predefined tools, repositories, or skill graphs: expanding coverage requires manual substrate engineering, each new domain demands a bespoke pipeline, and the resulting
👍 0
Vision-language models (VLMs) can follow complex textual instructions, yet they struggle to reason from purely visual context. In particular, current models fail to infer shared concepts from sets of example images and apply them to new inputs. We introduce Visual Concept Inference from Sets (VICIS)
👍 5
Reinforcement learning with verifiable rewards (RLVR) is rapidly advancing the reasoning capabilities of language models, yet the optimization layer that converts reward feedback into weight-space updates remains poorly understood. Building on our prior analysis (Zhu et al., 2025), we study this mis
👍 199
We present ABot-World-0, an action-conditioned video world model for real-time, long-horizon closed-loop interaction, supported by a multi-source data infrastructure spanning AAA games, simulation engines, and internet videos to learn controllable world dynamics. WorldExplorer performs agent-driven
👍 66
Generative world renderer AlayaRenderer receives structured world states exported from physics engines and synthesizes RGB frames. Unlike models that generate frames from text/control-hints prompts, AlayaRenderer preserves scene structure without altering the underlying world dynamics. This demonstr
👍 11
Injecting factual knowledge into large language models (LLMs) reliably and at scale remains an open challenge. Hypernetworks provide a promising solution to large-scale knowledge injection. Although hypernetworks are typically applied for test-time adaptation, we explore their use in train-time know
Agentic project management environment for creatives
中文介绍 RunEvr 是一个专为创意人士打造的代理式项目管理环境。它旨在通过自动化和智能代理技术,帮助创意专业人士更高效地规划、执行和管理项目,从而简化工作流程。
Starts a fresh Codex worker and critic every cycle
中文介绍 AgentLoop 是一款工具,旨在优化AI代理的工作流。它在每个操作周期内启动一个全新的 Codex 代理工作者和评论员,以确保每次迭代都能获得新鲜和独立的评估,提高任务执行的质量和效率。
Orchestrate agents at scale while reducing cost
中文介绍 AskCodi 提供了一个平台,用于大规模编排和管理AI代理。其核心目标是优化代理的工作效率,同时显著降低运营成本。该平台通过智能调度和资源分配,帮助用户高效部署和协调多个代理任务。
Automated documentation for developers, users, and AI Tools
中文介绍 Moxie Docs 是一款知识库工具,专为开发者、用户和AI工具提供自动化文档解决方案。它通过自动化流程生成和维护技术文档,旨在简化文档创建和更新,确保信息对不同受众(包括AI系统)的准确性和可访问性。
SEO Hub for GSC + GA4 + a 200-point crawl
中文介绍 CrawlRaven 是一个综合性的搜索引擎优化(SEO)中心。它整合了 Google Search Console(GSC)和 Google Analytics 4(GA4)的数据,并提供200点深入网站抓取分析。该平台旨在为用户提供全面的SEO洞察和优化建议。
Your AI twin hosts your video podcast
中文介绍 PodcastorAI 是一款创新工具,它能够创建用户的AI数字分身,并让这个AI分身来主持视频播客。该服务旨在帮助用户自动化播客制作流程,无需亲自出镜,即可生成专业品质的视频内容。
AI automation agent to get stuff done across apps or browser
中文介绍 Quaso 是一款智能AI自动化代理工具,旨在帮助用户跨应用程序和浏览器完成各种任务。它能够识别并执行复杂的操作流程,从而自动化日常工作,提高效率,并简化用户在不同数字环境中的交互。
Stop typing, start talking, get perfectly written text
中文介绍 Wispro 是一款语音转文本工具,旨在改变用户创建书面内容的方式。它允许用户通过说话来生成文本,并承诺输出“完美书写”的文本,从而取代传统打字,提高写作效率和文本质量。
The 1st Firewall for AI Agents
中文介绍 HOL Guard 被宣传为全球首款专为AI代理设计的防火墙。它旨在为AI代理提供强大的安全防护,检测并阻止潜在的恶意行为或未经授权的访问,确保AI系统在复杂网络环境中的安全稳定运行。
Ship AI analytics in your product, powered by GPT-5.6
中文介绍 Basedash for Excel是一款工具,能将任何Excel文件转换为实时数据看板。它旨在帮助用户快速、便捷地实现数据可视化,使得复杂的Excel数据能够动态呈现,方便团队共享和监控关键指标,从而提升数据分析与决策效率。用户无需复杂操作即可将静态数据转化为交互式仪表盘。
中文介绍 YouTube用户Riley Brown发布视频,展示了他如何将Codex(推测为OpenAI Codex)改造为一个“业务增长机器”。该视频围绕利用AI技术,尤其可能是代码生成能力,来加速企业发展的实际策略展开。
中文介绍 这则YouTube视频提供了Devin AI的全面初学者指南,深入探讨了这款人工智能工具在代码开发方面的应用潜力。视频可能通过演示和比较,向观众展示Devin AI的功能和使用方法,并讨论其与Claude Code相比的优劣,以帮助初学者快速掌握。
中文介绍 这则YouTube短视频介绍了OpenArt公司推出的一款名为「Director」的新产品或功能。该视频可能简要展示了「Director」的主要特点和用途,暗示其可能是一款用于创意或艺术领域的人工智能工具。
中文介绍 这则由Claude发布的YouTube短视频,探讨了人工智能(AI)出现「幻觉」现象的原因。AI幻觉是指大型语言模型在生成文本时,提供看似合理但实际不准确或虚假信息的问题。该视频旨在解释为何AI会生成不符合事实的内容。
中文介绍 由Claude在YouTube发布的一则短视频,探讨了人工智能(AI)如何形成其“性格”。视频以此为主题,讨论AI系统在学习和训练过程中发展出独特行为模式的现象。
中文介绍 这段来自Claude(YouTube)的短视频,以“什么是阿谀奉承?”为题,旨在清晰阐释「阿谀奉承」(sycophancy)这一概念。视频内容可能涵盖该行为的定义、特征及其在人际互动中的表现形式,帮助观众深入理解这种社会现象的本质。
中文介绍 这段YouTube短视频展示了如何运用名为「Claude」的工具,将美国纽约市的标志性建筑或街景制作成微缩模型。视频内容可能涵盖了从设计到实现微缩模型的过程,突出了Claude在创意制作领域的应用,暗示了其在辅助视觉艺术和模型构建方面的潜力。
中文介绍 这则由Claude发布的YouTube短视频,探讨了人工智能(AI)出现「幻觉」现象的原因。AI幻觉是指大型语言模型在生成文本时,提供看似合理但实际不准确或虚假信息的问题。该视频旨在解释为何AI会生成不符合事实的内容。
中文介绍 由Claude在YouTube发布的一则短视频,探讨了人工智能(AI)如何形成其“性格”。视频以此为主题,讨论AI系统在学习和训练过程中发展出独特行为模式的现象。
中文介绍 这段来自Claude(YouTube)的短视频,以“什么是阿谀奉承?”为题,旨在清晰阐释「阿谀奉承」(sycophancy)这一概念。视频内容可能涵盖该行为的定义、特征及其在人际互动中的表现形式,帮助观众深入理解这种社会现象的本质。
中文介绍 这段YouTube短视频展示了如何运用名为「Claude」的工具,将美国纽约市的标志性建筑或街景制作成微缩模型。视频内容可能涵盖了从设计到实现微缩模型的过程,突出了Claude在创意制作领域的应用,暗示了其在辅助视觉艺术和模型构建方面的潜力。
中文介绍 这则来自YouTube频道Two Minute Papers的视频指出,人工智能模型Claude揭示了当前AI领域面临的一个「最大问题」。视频可能探讨了AI技术在特定情境下展现出的局限性、伦理困境或技术挑战,旨在分析并讨论这些阻碍AI进一步发展的核心难题。
7 回复 · 程序员 节点
14 回复 · 程序员 节点
26 回复 · 程序员 节点
10 回复 · 程序员 节点
8 回复 · 程序员 节点
28 回复 · Apple 节点
23 回复 · Apple 节点
28 回复 · Apple 节点
19 回复 · Apple 节点
27 回复 · Apple 节点
该源今日无内容。
I’ve been building Echo (https://echo.tracerml.ai/), an experiment in making one AI system out of a pool of open-weight models rather than choosing a single model and using it for every task.It started with a simple experiment. I took a group of models, including GLM-5.2, Kimi K2.7 an
8 points · 0 comments
79 points · 31 comments
42 points · 5 comments
24 points · 24 comments
37 points · 25 comments
196 points · 81 comments
121 points · 84 comments
Hi Hacker News, I'm Louis. I built Screenpipe (https://screenpipe.com), an app that records your screen and audio locally (only!), and gives AI agents a searchable memory of what you've seen, said, and heard. This makes it easier to automate your repetitive tasks, turn them into
76 points · 58 comments
68 points · 6 comments
hey HN, Jonathan and Guy here, creators of OneCLI (https://onecli.sh/). OneCLI is an open source vault for AI Agents.Traditional vaults are used to store your secrets and, on demand, provide them to you all in a secure way, trusting the person to keep them safe. We figured that in the
https://littletech.org/https://static.politico.com/4a/bf/9c4021d8404386b0a311dcccf0...
Hi HN, we are Marcos and Harrison, cofounders of Palmier (https://palmier.io). We are building Palmier Pro, an open source macOS video editor, with built-in AI generation and a local MCP server that connects to your agent. Here are a few demos:- Making some AI transitions: https:/
58 points · 10 comments
135 points · 74 comments
71 points · 29 comments
732 points · 372 comments
85 points · 35 comments
195 points · 33 comments
74 points · 66 comments
167 points · 63 comments
119 points · 117 comments
485 points · 236 comments
Trifle is an open-source time-series analytics library that aggregates nested counters instead of storing raw events. All in the database you already have. After rebuilding it twice over 10 years, it now tracks ~1B events a day at my day job.It started in 2015 as my own Rails APM. I plugged into Act
6 points · 3 comments
9 points · 0 comments
26 points · 3 comments
20 points · 0 comments
87 points · 19 comments
What's changed Changed /code-review to run as a background subagent, so review work no longer fills your conversation and keeps stacked slash commands as its review target Added screen-reader announcements of deleted text for word and line deletions (Option+Delete, Ctrl+W, Cmd+Backspace, Ctrl+U, Ctr
中文介绍 Anthropic的Claude Code项目发布了v2.1.218版本。更新内容包括将/code-review功能改为后台子代理运行,避免占用对话空间,并改进了屏幕阅读器对删除文本(如通过Option+Delete、Ctrl+W等)的播报,提升了无障碍体验。
What's changed Added emoji shortcode autocomplete in the prompt input: type :heart: to insert ❤️, or :hea for suggestions — disable with the emojiCompletionEnabled setting Added warnings when transcript writes are failing (e.g. disk full) or when session saving is off due to an inherited environment
中文介绍 Anthropic的Claude Code项目发布了v2.1.217版本。此次更新主要增加了提示词输入中的表情符号短代码自动补全功能,用户可以通过输入":heart:"等来插入表情符号,该功能可通过emojiCompletionEnabled设置禁用。同时,新版本还加入了在转录写入失败或会话保存关闭时的警告提示。
What's changed Added sandbox.filesystem.disabled setting to skip filesystem isolation while keeping network egress control Fixed a slowdown in long sessions where message normalization cost grew quadratically with the number of turns, causing multi-second stalls and slow resumes Fixed auto mode deny
What's changed Claude no longer runs the /verify and /code-review skills on its own; invoke them with /verify or /code-review when you want them
What's changed Fixed single-segment dir/** allow rules like Edit(src/**) auto-approving writes to nested dir/ directories anywhere in the tree instead of only /dir Fixed a permission-check bypass affecting commands run in Windows PowerShell 5.1 sessions Fixed Bash permission checks to fail closed on
What's changed /fork now copies your conversation into a new background session (its own row in claude agents) while you keep working; the in-session subagent it used to launch is now /subtask Added claude auto-mode reset to restore the default auto-mode configuration, with a confirmation prompt (pa
What's changed Added --forward-subagent-text flag and CLAUDE_CODE_FORWARD_SUBAGENT_TEXT environment variable to include subagent text and thinking in stream-json output Fixed permission previews relayed to chat channels not neutralizing bidirectional-override, zero-width, and look-alike quote charac
What's changed Added a live elapsed-time counter to the collapsed tool summary line so long-running tool calls visibly tick instead of looking stuck Added a startup warning for Write(path), NotebookEdit(path), and Glob(path) permission rules — use Edit(path) or Read(path) instead Fixed isolation: 'w
What's changed Fixed /model and other dialogs being blocked in claude agents background sessions (reverts an overly broad guard)
What's changed Added screen reader mode: opt-in plain-text rendering for screen reader users. Run claude --ax-screen-reader, set CLAUDE_AX_SCREEN_READER=1, or add "axScreenReader": true to settings. Added vimInsertModeRemaps setting: map two-key insert-mode sequences like jj to Escape in vim mode Ad
Release 0.146.0-alpha.5
中文介绍 OpenAI旗下的Codex项目发布了软件的0.146.0-alpha.5版本更新。此次发布是一个alpha测试版,聚焦于Rust相关组件的迭代与改进,持续推进软件开发进展。
Release 0.146.0-alpha.4
中文介绍 OpenAI旗下的Codex项目发布了软件的0.146.0-alpha.4版本更新。此次发布是一个alpha测试版,聚焦于Rust相关组件的迭代与改进,持续推进软件开发进展。
Release 0.146.0-alpha.3
中文介绍 OpenAI旗下的Codex项目发布了软件的0.146.0-alpha.3版本更新。此次发布是一个alpha测试版,聚焦于Rust相关组件的迭代与改进,持续推进软件开发进展。
Release 0.146.0-alpha.2
中文介绍 OpenAI Codex项目发布了Rust语言的0.146.0-alpha.2版本更新,这是一次处于早期测试阶段(alpha)的版本发布,但现有信息未提供具体更新细节。
Release 0.146.0-alpha.1
中文介绍 OpenAI Codex项目发布了Rust语言的0.146.0-alpha.1版本更新,这是一次处于早期测试阶段(alpha)的版本发布,但现有信息未提供具体更新细节。
Release 0.145.0-alpha.30
中文介绍 OpenAI Codex项目发布了Rust语言的0.145.0-alpha.30版本更新,这是一次处于早期测试阶段(alpha)的版本发布,但现有信息未提供具体更新细节。
New Features Added experimental paginated thread history with efficient resume, search, persisted names, sub-agent support, and memories. (#33364, #33907, #34085, #34229, #34386) Expanded /import to migrate Cursor and Claude Code settings, MCP servers, plugins, sessions, commands, and project-scoped
中文介绍 OpenAI Codex发布了0.145.0版本,新增实验性分页线程历史功能,支持高效恢复、搜索、持久化名称、子代理支持和记忆功能。此外,该版本还扩展了导入功能,可迁移Cursor和Claude Code的设置、MCP服务器、插件、会话和命令,提升了用户数据管理和兼容性。
Release 0.145.0-alpha.29
中文介绍 OpenAI Codex发布了0.145.0-alpha.29版本。此版本属于alpha测试阶段,通常包含新功能或修复,旨在收集用户反馈。
Release 0.145.0-alpha.28
中文介绍 OpenAI Codex发布了0.145.0-alpha.28版本。此版本属于alpha测试阶段,通常包含新功能或修复,旨在收集用户反馈。
Release 0.145.0-alpha.27
中文介绍 OpenAI Codex发布了0.145.0-alpha.27版本。此版本属于alpha测试阶段,通常包含新功能或修复,旨在收集用户反馈。
今日AI领域,模型能力持续突破,涵盖金融专业语言和多模态长视频生成;同时,围绕AI智能体的开发与应用愈发成熟,从高效协作工具到安全防护方案层出不穷。行业动态则聚焦于AI对就业市场、企业战略及产品伦理的深远影响,尤其在安全与隐私方面的挑战成为关注焦点。
`Kronos` 是一个专为金融市场语言设计的基础模型,旨在通过深入学习金融文本的独特术语和上下文,解决传统模型在金融领域专业性不足的问题。它能帮助金融分析师、量化研究员等进行更精准的市场情绪分析、信息提取和趋势预测。该模型有望显著提升金融领域数据处理与分析的智能化水平,为金融行业的AI应用带来新机遇。
「ATSplat」提出了一种紧凑的前馈3D高斯泼溅(3DGS)方法,旨在解决现有方法中缺乏场景自适应容量分配的问题。通过优化3D基元和自适应稠密化,该方法能够实现高质量的新视图合成,显著提升复杂场景中的渲染效率与视觉表现力。这项研究对于3D内容生成、虚拟现实以及计算机视觉领域具有重要意义,预示着更逼真、高效的3D重建与渲染前景。
Black Forest Labs发布了多模态基础模型Flux 3,实现了行业突破,首次能够生成长达20秒并带有原生音频的视频。Flux 3通过学习图像、视频和音频数据进行生成,内部测试显示其性能略优于市场领导者Seedance 2.0。这项进展预示着AI视频生成技术在时长和音画同步方面迈向新阶段,为内容创作、虚拟体验等领域带来新的可能性。
OmniRoute推出了一个免费的AI网关,通过单一API端点集成了超过231个AI提供商(其中50余个免费)。该平台旨在解决多模型调用的复杂性,支持连接各类编码助手至主流大模型,大幅降低开发成本。项目还采用RTK+Caveman堆叠压缩技术,可节省15%-95%的数据传输开销,极大优化了开发者管理AI服务和利用免费资源的效率,推动AI应用普及。
阿里巴巴开源了其内部大规模实践验证的免费代码审查工具 `alibaba/open-code-review`。该工具采用混合架构,结合确定性分析流水线和LLM智能体,能生成精确到行级别的代码评论。它内置了针对NPE、多线程等问题的预训练规则集,旨在显著提升代码质量与开发效率,为各类团队提供高效、智能化的代码审查方案,降低开发门槛。
Anthropic公司宣布,其人工智能模型Claude的语音模式已全面升级,现支持更强大的Opus和Sonnet模型,此前该功能仅限于Haiku模型。此次更新极大拓展了Claude语音助手的应用范围,可无缝集成至Gmail、Slack和Canva等常用应用程序中,使用户能够通过语音指令高效完成会议改期、起草电子邮件等复杂任务,显著提升了跨平台交互的便捷性和智能化水平。
HOL Guard 正式发布,被誉为全球首款专为AI代理设计的防火墙。该产品旨在为AI代理提供强大的安全防护,通过实时检测并阻止潜在的恶意行为或未经授权的访问,确保AI系统在复杂多变的网络环境中安全稳定运行。它的推出,为日益增长的AI代理应用带来了新的安全标准和解决方案,以应对AI系统面临的独特安全挑战,保障AI业务的安全合规。
AMD推出名为Helios的AI机架规模系统,正式进军高端AI硬件市场,旨在直接挑战竞争对手英伟达。该系统预计将于今年晚些时候开始向客户发货,标志着AMD在AI芯片领域通过提供集成解决方案来增强竞争实力的战略布局。此举将进一步加剧AI硬件市场的竞争格局,为用户提供更多选择,并推动整体AI算力发展。
由前谷歌安全高管创立的AegisAI公司成功获得3600万美元融资,将专注于开发阻止AI驱动鱼叉式网络钓鱼的创新技术。该公司旗下的AI代理能够像人类一样快速分析每条消息,并识别出传统检测方法难以发现的微小异常,从而大幅提升网络安全防护能力。这笔融资体现了市场对AI安全领域,特别是针对高级网络威胁解决方案的强劲需求和发展潜力。
创作者平台Patreon宣布裁员20%,涉及约93名员工。首席执行官杰克·孔戴(Jack Conte)在致员工的备忘录中明确指出,此次调整并非源于人工智能(AI)取代人类,而是因为AI“从根本上改变了”行业格局,公司需据此调整运营策略以保持竞争力。此事件凸显了AI技术对数字内容创作和平台经济深层次的结构性影响,促使企业重新思考商业模式。
OpenAI正在向美国用户推出“ChatGPT健康”功能,可连接Apple Health、医疗记录及健康应用。鉴于每周有超过3亿人向ChatGPT咨询健康问题,此功能备受关注。然而,OpenAI明确表示,更强大的GPT-5.6 Sol模型仅供付费用户使用,这意味着付费用户将获得更优质、更可靠的健康建议。这引发了关于AI服务质量与付费模式之间关系,以及AI医疗信息公平性的讨论。
一位独立创业者分享了如何利用AI智能体组建「虚拟团队」的实战经验,以应对研究、写作、规划、审核和策略制定等多重业务角色。他详细探讨了如何让AI智能体有效协作,模拟真实的团队工作流,帮助像他一样的单人公司实现高效运营。该分享为希望利用AI提升个人或小团队生产力的用户提供了宝贵的实践指南,揭示了智能体协作的巨大潜力。
本教程详细讲解了如何构建首个「智能体图」(agent graph)并将其应用于实际业务场景。该方法能让智能体团队并行进行研究、主动验证并「反驳」自身发现,最终提供精炼的见解。教程旨在帮助用户掌握图工程技术,设计和实现高效协作式AI智能体工作流,从而在复杂任务中获得更准确、更可靠的AI辅助,提升决策质量。
Anthropic公司通过其Claude官方YouTube短视频,深入探讨了人工智能(AI)出现「幻觉」现象的根本原因。AI幻觉指大型语言模型在生成文本时,提供看似合理但实际不准确或虚假信息的问题。该视频旨在通过简洁易懂的方式,向公众解释AI生成内容不符合事实的内在机制,帮助用户更好地理解和应对AI的局限性,提升对AI能力的理性认知。
今天,我们看到AI代理(Agent)技术从概念走向多领域应用,不仅有革新浏览器体验、自动化日常任务的智能代理,更有针对代理自身安全与编排管理的基础设施。同时,AI在提升开发者效率、赋能内容创作、以及探索非传统数据感知等前沿领域也持续发力,预示着一个智能体深度参与工作流的新时代正在到来。
citrolabs/ego-lite 是一款创新的浏览器,专为用户及其 AI 代理并行工作而设计。它解决了传统浏览器无法原生支持 AI 代理协同操作的痛点,使用户和 AI 智能体能够共同浏览网页、执行任务,显著提升工作效率。典型场景包括研究、数据收集和自动化Web任务,让 AI 成为浏览器内的原生伙伴,预示着未来人机协作的新范式。
Quaso 是一款智能AI自动化代理工具,旨在帮助用户跨应用程序和浏览器完成各种任务。它能够识别并执行复杂的操作流程,从而自动化日常工作,提高效率,并简化用户在不同数字环境中的交互。从数据收集到内容管理,Quaso 将 AI 代理的普适性提升到新的水平,为用户提供一个智能化的通用生产力助手。
HOL Guard 被宣传为全球首款专为 AI 代理设计的防火墙。它旨在为 AI 代理提供强大的安全防护,检测并阻止潜在的恶意行为或未经授权的访问,确保 AI 系统在复杂网络环境中的安全稳定运行。随着 AI 代理的普及,此类基础设施工具变得至关重要,它标志着 AI 代理生态系统安全防护迈向成熟。
`pi-web` 项目为 `pi coding agent` 提供了一个直观易用的 Web 用户界面。它旨在简化用户与 AI 编程代理的交互过程,摆脱命令行操作的复杂性,通过浏览器即可轻松部署、配置和管理 agent,并查看其工作输出。此 Web UI 极大地提升了 `pi coding agent` 的可访问性和用户体验,为各类开发者降低了 AI 编程工具的使用门槛。
alibaba/open-code-review 是阿里巴巴开源且免费的代码审查工具,经阿里大规模实践验证。它采用混合架构,结合确定性分析流水线和 LLM 智能体,能生成精确到行级别的代码评论。内置针对 NPE、多线程等问题的预训练规则集,旨在提升代码质量与开发效率。适用于各类团队进行高效、智能化的代码审查,特别适合追求高质量代码标准的团队。
`likec4` 旨在通过从代码直接生成「实时」架构图,解决软件架构文档难以维护和过时的问题。它提供了一种将代码与可视化架构图同步演进的方法,促进团队协作。开发团队可利用 `likec4` 保持架构图与实际系统一致,提升设计沟通效率。适用于软件工程师、架构师,在设计、文档化和演进复杂系统时使用,极大简化了架构管理的复杂度。
AskCodi 提供了一个平台,用于大规模编排和管理 AI 代理。其核心目标是优化代理的工作效率,同时显著降低运营成本。该平台通过智能调度和资源分配,帮助用户高效部署和协调多个代理任务,从而解决复杂工作流的自动化管理难题。对于需要运行大量 AI 代理的企业或开发者而言,AskCodi 提供了一个强大的解决方案。
Wispro 是一款语音转文本工具,旨在改变用户创建书面内容的方式。它允许用户通过说话来生成文本,并承诺输出「完美书写」的文本,从而取代传统打字,提高写作效率和文本质量。无论是作家、学生还是商务人士,都能利用 Wispro 更自然、更高效地完成各类文本创作,极大地提升了内容生产的便利性。
PodcastorAI 是一款创新工具,它能够创建用户的 AI 数字分身,并让这个 AI 分身来主持视频播客。该服务旨在帮助用户自动化播客制作流程,无需亲自出镜,即可生成专业品质的视频内容。这为内容创作者提供了全新的可能性,大幅降低了视频播客的制作门槛和时间成本,使个性化内容规模化成为现实。
Moxie Docs 是一款知识库工具,专为开发者、用户和 AI 工具提供自动化文档解决方案。它通过自动化流程生成和维护技术文档,旨在简化文档创建和更新,确保信息对不同受众(包括 AI 系统)的准确性和可访问性。这对于快速迭代的软件项目和需要高效知识管理的团队尤其有用,提升了知识共享的效率和质量。
RunEvr 是一个专为创意人士打造的代理式项目管理环境。它旨在通过自动化和智能代理技术,帮助创意专业人士更高效地规划、执行和管理项目,从而简化工作流程。无论是设计、写作还是多媒体项目,RunEvr 都能提供智能辅助,让创意人员摆脱繁琐的管理事务,更专注于核心创作,提升整体产出效率。
`worldmonitor` 是一个实时全球情报仪表板,利用 AI 技术聚合新闻、监测地缘政治事件及关键基础设施动态。它提供统一的态势感知界面,旨在帮助分析师、研究人员或企业迅速掌握全球宏观环境变化,提升决策效率。适用于需要持续追踪国际局势和重大事件的专业人士,通过智能化手段,将海量信息转化为 actionable intelligence。
RuView 项目创新性地将普通的 WiFi 信号转化为实时空间智能、生命体征监测和存在检测能力,完全无需使用任何视频设备。它通过分析 WiFi 信号在环境中因人体移动或呼吸等造成的微小扰动,提取出高价值的环境和生理数据。这解决了传统监控方案中隐私侵犯、硬件复杂或覆盖范围有限的问题。RuView 适用于智能家居、医疗保健和安防监控等需要非接触式、隐私友好型人体感知的应用场景。
PromptScout 是一款自动化工具,旨在帮助品牌提高其在 AI 生态系统中的可见性。它通过自动优化和管理品牌信息在 AI 模型和应用中的呈现方式,确保品牌内容能被 AI 系统更有效地发现和利用。这开创了品牌营销在 AI 时代的全新策略,帮助企业在由智能体主导的信息获取环境中,保持其品牌影响力和市场份额。