2026 08 18 HackerNews

2026-08-18 Hacker News Top Stories #

  1. Anthropic 对 Claude 进行语义水印处理以符合欧盟法规,但作者批评这种技术牺牲文本精确性,且存在隐私泄露风险,通过低概率统计特征嵌入来源标记,但易被小编辑破坏。
  2. Qwen 3.8 27B 模型默认极高推理等级导致简单任务过度消耗资源,降低等级后能力出色,但家用设备运行17GB文件已成可能,凸显消费级硬件进步。
  3. GitHub 在2026年8月17日发生影响API、Actions、Git操作等多项服务的事故,持续约7小时,因组件问题导致间歇性认证失败。
  4. 一位第三世界工程师反驳对RISC-V的批评,指出其低成本特性使偏远地区学生和开发者能真正拥有硬件,并证明它能覆盖从极低端到高端的全范围。
  5. DuckDB v2.0 预览版发布,代号"Cyanoptera",包含服务端模式、VARIANT升级、触发器功能及SQL方言增强等超10,000次提交。
  6. GitHub 2026年8月17日事故导致核心功能错误率高达50%,用户因长期缺乏领导力而寻求替代品。
  7. Stripe 以超70亿美元收购AI网关OpenRouter,旨在扩展业务到LLM抽象层,但面临合规和流量处理挑战。
  8. 耶鲁大学研究声称全民健康覆盖每年可节省1万亿美元并挽救11.4万生命,但被指基于仓促假设,忽视初级保健短缺和生活方式因素。
  9. AI模型正用知识和记忆换取推理能力,未来趋势是推理强的小模型配外部知识库以缓解幻觉。
  10. 基于AI生成的GitHub Copilot Autofix漏洞导致Snowflake Jira被入侵,凸显AI辅助编码的安全风险。

1. Anthropic 对 Claude 文本进行“水印”篡改是对写作的歪曲 (Anthropic’s ‘watermark’ text adulteration in Claude is a perversion of writing) #

https://daringfireball.net/2026/08/anthropics_watermark_text_adulteration_in_claude_is_a_perversion_of_writing

Anthropic 宣布所有 Claude 模型将开始对生成文本进行“水印”处理,以符合欧盟法规。最初 Anthropic 声称水印是“不可察觉的”,不会改变文本的含义、质量或可读性,但实际做法并非如此。

实际采用的技术是语义水印:在生成每个词时,模型会从“绿色”和“红色”词列表中做选择,略微偏向绿色列表中的词。这种偏差类似于一枚 51-49 的硬币,不会完全避免使用红色列表中的词。只有掌握密钥的人才能检测这种水印模式。

文章作者对此提出强烈反对,认为任何两个同义词的含义都不完全相同,这种技术会牺牲文本的精确性和质量。作者强调,文本生成只应考虑用户需求,而不应为了嵌入来源标记而损害内容本身。


HN 热度 753 points | 评论 669 comments | 作者:ropbear | 1 day ago #

https://news.ycombinator.com/item?id=49324087

  • 检查文本水印需要将完整文本发送给 AI 公司,存在隐私风险,且可能被用于训练。
  • 水印技术原理是在模型选择 token 时强制特定模式,利用低概率统计特征,但脆弱,小编辑可破坏。
  • 水印只能由模型所有者检测,需要发送数据,且无法在确定性输出(如事实回答)中工作。
  • 水印可以编码少量信息,但需要知道 prompt 才能提取,低信噪比下仍可编码一位信息,但需避免误报。
  • 任意约束(如强制词汇表)可改善文本质量,类似乔治·佩雷克避免字母 e 的写作风格。
  • 水印方案使用特定 PRNG,需要知道密钥和偏差,只需少量连续 token 即可检测。
  • 水印对代码输出可能不适用,模型知道哪些 token 是等概率的,可在非确定性位置嵌入水印。
  • 水印是安全剧场,无人真正负责。

2. Qwen 3.8 27B 非常优秀,但默认会过度思考。 (Qwen 3.8 27B is excellent, but it defaults to overthinking things) #

https://simonwillison.net/2026/Aug/16/qwen-38-27b/

Simon Willison 的博客文章,发布于 2026 年 8 月 16 日,主要介绍了阿里通义千问实验室新发布的 Qwen 3.8 27B 模型。

核心内容:

  • 模型概况:Qwen 3.8 27B 是一个 270 亿参数、Apache 2.0 许可的视觉语言模型,适合在配置不错的笔记本上运行。
  • 默认问题:模型默认的推理努力等级为“极高”(xhigh),导致即使是简单任务(如画一个圆)也会过度思考,消耗大量 token 和时间。作者强烈建议用户在使用时降低或关闭推理等级。
  • 性能亮点
    • SVG 生成:在极高推理等级下,生成的“骑自行车的鹈鹕”SVG 质量很高,但耗时 21 分钟。
    • 边界框识别:模型在照片中识别并返回鹈鹕的边界框(JSON 格式)表现非常出色。
    • 工具构建:作者利用该模型(在极高推理等级下)成功构建了一个用于可视化边界框的 HTML 工具,展示了推理能力在编码任务中的价值。

HN 热度 751 points | 评论 355 comments | 作者:bilsbie | 24 hours ago #

https://news.ycombinator.com/item?id=49324985

  • 17GB 文件能在家用机器上运行是奇迹,展示了消费级硬件的进步
  • Gemma 4 12B QAT 是另一个里程碑,能在笔记本上高速运行,支持多模态,体积小,但被 Google、Unsloth 和 Llama.cpp 的错误设置和模板搞砸了
  • 多个方面同时改进(模型变小、推理变好、推测解码、多模态、工具调用、上下文窗口等)导致本地模型变得惊人地有用
  • Gemma 4 12B 没有单独的 mmproj,完全集成,是今年最令人印象深刻的 LLM 之一,虽然编码细节有弱点,但作为消费级 AI 预测很有价值
  • 对于 Gemma 4,llama.cpp 需要 mmproj,但那是提取的部分;编码方面小模型会丢失细节,但可以通过提供上下文弥补
  • Google 提供了错误设置和模板,Unsloth 修改模板并微调,llama.cpp 采用错误默认值,导致模型能力受损
  • 初学者难以找到正确的设置,不同量化版本令人困惑,llama.cpp 和 LM Studio 速度差异大
  • 推荐 Llama-macOS app,声称有合理设置
  • 如果包管理器不是 Claude Code 或 Codex,就是在浪费时间
  • 如果目标是理解原理,即使困难也值得
  • 有些人避免使用 Anthropic/OpenAI
  • 几周前 Google 发布了修正版,官方 Hugging Face 文件应该没问题
  • 更新后的版本可能解决了问题

3. GitHub.com 事故 (Incident with Github.com) #

https://www.githubstatus.com/incidents/zkxwbgr0cnmx

GitHub 状态页面显示,2026 年 8 月 17 日发生了一起影响多项服务的事故。事故从 API 请求、Actions、Git 操作、Issues、Pages、Pull Requests 和 Webhooks 的降级开始,随后波及到 Copilot 认证、SAML/OIDC 认证、SCIM 和团队同步等功能。团队识别并修复了问题组件,但残留影响导致间歇性认证失败。经过多次缓解措施,事故最终在约 7 小时后解决,Copilot 在 GitHub CLI 和 GitHub App 上的使用未受影响。


HN 热度 694 points | 评论 2 comments | 作者:kevcampb | 10 hours ago #

https://news.ycombinator.com/item?id=49330684

  • 该帖子是重复内容,相关评论已移至另一链接。

4. 第三世界工程师回应“RISC-V:他们本该更明智” (A third world engineer responds to “RISC-V: They should have known better”) #

https://rvembedded.com/blog_post/12/

一位来自特立尼达和多巴哥的第三世界嵌入式工程师,回应了 Dmitry Grinberg 对 RISC-V 的批评文章。作者承认 RISC-V 确实存在一些架构上的奇怪之处(如压缩存储偏移、Zicsr 必须单独指定等),但认为批评带有偏见。

作者从自身处境出发:身处小岛国,获取开发板运费高昂(60-200 美元),学生也面临同样困境。因此,十美分和一美元的芯片差价不是小数目,而是决定一个班级能否人手一块板子的关键。Grinberg 自己推导出廉价微控制器核心应具备的特征(低中断延迟、小面积、好代码密度、无硬件除法等),并得出 RV32EC 正是这样的指令集,还承认 RISC-V 最终会占领廉价微控制器市场。但随后他又抱怨这个结果——作者认为这很讽刺。

作者强烈不同意 Grinberg 的核心论点:高端 CPU 和廉价微控制器的需求对立,因此单一 ISA 无法同时服务两端。作者用自己桌上的三款芯片反驳:CH32V003(十美分、16 寄存器、无乘除法、仅机器模式)、CH32H417(双核 400MHz+144MHz、USB 3.2、以太网、图形加速等高性能 MCU)、Baochip(带 MMU、运行 Xous 微内核和 Linux 的 RISC-V SoC)。这些芯片覆盖了从极低端到高端的整个范围,证明 RISC-V 确实能同时满足两端需求。

作者总结:RISC-V 为第三世界创造了低成本硬件可及的空间,这与架构优雅无关,而是让更多学生和开发者能真正拥有硬件。


HN 热度 600 points | 评论 317 comments | 作者:Narishma | 1 day ago #

https://news.ycombinator.com/item?id=49321717

  • 原文章批评 RISC-V 在高端性能不足和碎片化,而 Subero 的文章只强调其在嵌入式领域的低成本优势,两者讨论的不是同一层面
  • 两位作者对“高端”定义不同:Dmitry 指笔记本/手机/服务器级别,Subero 认为大于廉价 MCU 就算高端;实际上 VexRISC-V 核心只是最低端应用核心,RISC-V 在廉价 MCU 到低端应用处理器范围没问题,但高端应用处理器面临巨大困难
  • 花 2 亿美元开发高端微架构的公司不会抱怨 ARM 许可费,有钱就能获得相当的自由度
  • 钱不能买自由,只能让你的律师和 ARM 律师商量你能建什么功能
  • RISC-V 尽管有局限,但免费且可自由定制,最终会成为赢家;大公司会制作自己的版本,因为能让公司拥有资产,不一定要最好但一定是最佳选择
  • 决策不是工程师做的,廉价 CPU 即便有 bug 也能开启商业模式,性能不重要,便宜更重要
  • RISC-V 会取代 8051 等廉价嵌入式核心,因为便宜;但在高端仍需付费买乱序执行核心且二进制兼容更重要,RISC-V 不会取代高端 ARM64
  • x86 仍被使用是因为实现速度快、软件生态丰富,弥补了架构缺陷

5. DuckDB v2.0 预览版 (A Preview of DuckDB v2.0) #

https://duckdb.org/2026/08/17/duckdb-20-highlights

DuckDB v2.0 预览版发布,代号“Cyanoptera”,预计今年秋季正式推出。本次大版本更新包含多项重大特性:

  1. 服务端模式:通过 Quack 扩展实现客户端/服务器架构,支持 CONNECT 语句远程连接其他 DuckDB 实例,并可将 SQL 直接推送到 PostgreSQL 和 MySQL 执行。
  2. VARIANT 类型升级:成为一等公民,支持自动检测半结构化数据的共同模式并进行“碎片化”处理,实现高效压缩和快速查询,新增 variant_* 系列函数。
  3. 触发器功能:完整支持 BEFORE/AFTER、FOR EACH ROW/STATEMENT、过渡表、多触发器及 DROP TRIGGER,适用于审计日志等场景。
  4. SQL 方言增强:新增 NEAREST 连接(向量相似性搜索)、CTE 内 DML 操作、嵌套模式、变量语法($x)、JSON 修改函数、递归 CTE 的 USING KEY 聚合等。

此外,v2.0 还包含新的 SQL 解析器、默认存储格式、重构的 C API 以及少量破坏性变更,累计超过 10,000 次提交。


HN 热度 502 points | 评论 86 comments | 作者:ibotty | 9 hours ago #

https://news.ycombinator.com/item?id=49330781

  • 对 Quack(并发协议)感到兴奋,希望 DuckDB 能更集中地管理大型运行时文件,尝试过 Clickhouse 但更喜欢 DuckDB。
  • 为多租户平台使用 DuckDB,每个租户独立文件,Quack 缓解了并发限制,但 Clickhouse 有更完善的摄入系统。
  • DuckDB 适合小型湖仓,摄入应使用 Python/DLTHub、Spark 或 Kafka 等工具,而非 DuckDB 本身。
  • 熟悉度和易用性比“完美数据库”更重要。
  • DuckDB 分析 Nginx 日志非常出色,应成为开发者标配工具(如 ripgrep)。
  • 推荐 Arc 项目,以 DuckDB 为引擎。
  • DuckDB 能处理超内存数据,降低资源需求,用于 ETL 管道、CLI 后处理、SvelteKit 应用等场景。
  • 使用 DuckDB WASM 和 Parquet 在浏览器中构建仪表盘,无需 REST 接口。
  • 可视化方面推荐 Vega-Lite/Vega 或 ECharts。
  • 用 DuckDB 替代 Pandas 做数据转换,在 BigQuery 数据上构建仪表盘,发现最小化分区效果更好。

6. GitHub.com 事件 (Incident with Github.com) #

https://www.githubstatus.com/incidents/zkxwbgr0cnmx

这是一个关于 GitHub 服务中断的事件报告页面。

事件状态:已解决(2 小时前更新)。

事件摘要:GitHub 在 2026 年 8 月 17 日经历了一次持续数小时的服务中断,影响了多项核心功能。

受影响的服务及时间线

  • 初期(约 7 小时前):API、Actions、Git 操作、Issues、Pages、Pull Requests 和 Webhooks 均出现严重错误,错误率高达 20%,归档和原始内容下载错误率达 50%,SAML/OIDC 认证、SCIM 和团队同步也受到影响。
  • 中期:团队定位到问题组件并采取纠正措施,服务逐步恢复,但仍有残余影响,包括 Copilot 在某些应用中出现间歇性认证失败。
  • 后期:Issues 和 API 请求恢复,Git 操作问题被缓解。Copilot 认证问题在最后阶段仍在处理中,预计 30 分钟内完全恢复。
  • 最终:所有服务恢复正常,事件关闭。

通知方式:页面提供了通过邮件、短信、Slack、Webhook 以及 RSS/Atom 订阅获取未来状态更新的选项。


HN 热度 486 points | 评论 869 comments | 作者:SpyCoder77 | 10 hours ago #

https://news.ycombinator.com/item?id=49330597

  • 伪领导者推动快速功能开发,忽视系统稳健性,导致无法重构,CEO 无法承认错误,新公司循环重演
  • GitHub 已有一年没有自己的 CEO
  • 有公司正在利用 GitHub 缺乏领导力的机会
  • 宕机三小时仍未解决,愿意支付 5-10 美元/月寻找替代品,需要 PR、issues、CI、Pages 等功能
  • GitLab 免费版够用但付费太贵,希望有可靠且价格合理的服务
  • 5-10 美元/月的定价难以盈利,网络效应难以复制,不如卖咖啡
  • 通过选择高效技术栈可以在 5-10 美元/月范围内构建解决方案
  • 规模效应下 VPS 可托管大量仓库,闲置仓库只占磁盘空间
  • 推荐 Contabo VPS,6 美元/月
  • 希望摆脱“你即产品”的商业模式,sourcehut.org 有潜力,GitHub 的社交功能并非核心价值
  • 自建方案:Forgejo 在 5 美元 Vultr VPS + Hetzner VPS 做 CI + Netlify 托管静态站点,感觉干净稳定
  • Forgejo 适合个人私有服务器,看重长期代码托管,GitHub 对他是代码的互联网档案馆
  • 厌倦 GitHub 宕机和账单,迁移到 Forgejo 自托管,需要重建一些功能但满意
  • 推荐 Cloudflare 和 BunnyCDN 替代 Netlify,并询问安全设置

7. Stripe 据称将以超过 70 亿美元收购 OpenRouter (Stripe will reportedly acquire OpenRouter for $7B+) #

https://techcrunch.com/2026/08/16/stripe-will-reportedly-acquire-ai-gateway-startup-openrouter-for-7b/

根据报道,Stripe 已达成协议收购 AI 网关初创公司 OpenRouter,交易价格超过 70 亿美元。OpenRouter 帮助客户根据需求和预算选择不同的 AI 模型,提供单一接入点,防止厂商锁定。该公司今年 5 月刚完成 1.13 亿美元 B 轮融资,估值达 13 亿美元,投资方包括 Sequoia、Andreessen Horowitz、Menlo Ventures 和 Alphabet 的 CapitalG。OpenRouter 拥有 800 万全球用户,接入超过 400 个模型。Stripe 发言人未对此置评。


HN 热度 450 points | 评论 281 comments | 作者:zacharyozer | 1 day ago #

https://news.ycombinator.com/item?id=49323381

  • Stripe 作为全球顶级 API 公司,收购 OpenRouter 旨在将业务从支付抽象层扩展到 LLM(大语言模型)的抽象层,成为“Token”的基础设施,而令牌本质上是轻量级的有价值资产。
  • 将 Token 作为订阅服务整合跨平台使用,能解决 AI 公司因成本波动(按 token 计费)而难以定价的核心难题,并可能最终让 Stripe 自建模型,成为“Token 界的 AWS”。
  • 支付公司(如 Chargebee/Lago)处理的 API 调用量级通常远小于广告或消费互联网公司,Stripe 在技术上并不特别适合处理 LLM 的高流量,因此收购并不能带来技术层面的神奇优势。
  • 尽管 Stripe 处理的支付总额高达 1.9 万亿美元(相当于全球 GDP 的 1.6%),但支付领域的 API 请求量(如每秒 500 笔交易已算高吞吐)与游戏或广告行业相比微不足道,真正挑战在于一致性和可靠性,而非高负载。
  • OpenRouter 作为一个“经过美化的反向代理网关”,会看到所有用户提示并把请求发送给不同供应商,这对任何注重合规的公司都是不可接受的。
  • 声称 OpenRouter 的全部功能可以在三个月内用 1000 万美元复现,而 Stripe 内部工程团队本应做得更好。

8. 全民健康覆盖每年可节省 1 万亿美元并挽救 11.4 万条生命——耶鲁大学研究 (Universal Health Coverage Could Save $1T and 114k Lives a Year, Yale Study) #

https://ysph.yale.edu/news-article/universal-health-coverage-could-save-one-trillion-dollars-and-114000-lives-every-year/

耶鲁大学公共卫生学院(YSPH)的官方网站提供了全面的学院介绍,包括战略计划、领导团队、社区文化、历史、捐赠信息等。战略计划涵盖创建途径、培养后代、促进社区、塑造数据科学、增强信任、实现卓越运营等六大方向。学院设有院长、领导委员会及行政团队,并发布新闻与媒体资源。捐赠部分列举了多个校友及捐赠者的故事,强调支持学生、教师和研究的重要性。此外,页面还包含职业机会(教职、博士后、行政岗位)、招生与资助信息(MPH、MS、PhD 等学位项目)、学术课程(如生物统计、慢性病流行病学、环境健康等)、研究领域(如老龄化、癌症、数据科学、全球健康、精神健康等)以及各系介绍。整体上,该页面是学院的综合门户,旨在为潜在学生、校友、捐赠者、雇主及公众提供一站式信息。


HN 热度 373 points | 评论 508 comments | 作者:karakoram | 7 hours ago #

https://news.ycombinator.com/item?id=49332981

  • 研究基于一系列仓促假设,$1.3T 成本节省的五大来源经不起推敲
  • Medicare 标准支付会迫使医院裁员或降薪,医疗体系没有免费午餐
  • “减少可避免急诊”假设前提是保险覆盖增加初级保健,但初级保健本身短缺,削减支付只会恶化问题
  • 降低行政开销会伴随 Medicare 未检测欺诈的增加,引用文献并未给出具体数字
  • 美国健康结果较差的主因是生活方式(肥胖、汽车依赖、远距离通勤),社会化医疗无法直接改变
  • 社会化医疗后政府为控费可能推动骑行、步行等健康政策,但美国城市形态积重难返
  • 欧洲与美国健康结果不能简单类比,需控制肥胖率、气候、运动习惯等环境差异
  • 研究将“全民医保”与“单一支付者”混为一谈,多数全民医保系统并非单一支付者
  • 医院实际运营利润率仅 1.5% 左右,$37 阿司匹林的高标价是为了覆盖其他亏损患者和成本
  • 医疗账单标价虚高是为了确保谈判后支付高于成本,实际无人支付标价

9. 模型正在故意变笨 (Models Are Getting Dumber on Purpose) #

https://w4g1.dev/blog/models-are-getting-dumber-on-purpose

这篇文章探讨了 AI 模型正在有意识地牺牲“知识记忆”来换取“推理能力”。

核心观点是:在数学和代码基准测试上,模型性能提升显著(如推理得分不断攀升),但在事实回忆测试(如 SimpleQA)中表现糟糕,顶级模型正确率也仅过半,小模型幻觉率高达 80%。这是因为存储事实知识需要大量参数(约每比特知识需 2 个参数),而推理过程所需参数更少,且能通过蒸馏和强化学习高效压缩到小模型中。

知识会过时,但推理过程不会。将事实内化在权重中需要高昂的重新训练成本,而将推理与知识分离,让模型专注于程序性能力,知识由外部工具(如搜索引擎、知识库)实时提供,能有效解决知识陈旧问题。

未来趋势是,推理能力极强的小模型能在消费级 GPU 上运行,但需要通过“外部工具”获取知识。这种设计也将极大缓解“幻觉”问题:当错误答案源自外部文档时,错误有据可查、可编辑、可修正,而非像内化在权重中那样难以定位和修复。


HN 热度 327 points | 评论 187 comments | 作者:hruvhwe | 1 day ago #

https://news.ycombinator.com/item?id=49322695

  • 希望模型能像可插拔知识库一样,针对不同任务组合特定领域的知识,而非使用通用模型。
  • 广泛的世界知识对 LLM 至关重要,任务结构可以在不同领域间抽象,编程语言差异很小;过度蒸馏可能导致隧道视野。
  • 更多数据通常提升智能但有硬件和数据质量限制,后训练可能引起模式崩溃;不需要让模型遗忘无关知识,但要避免在无关问题上过度输出。
  • 有论文支持“通用智能”观点,即不同任务间存在普适的几何结构。
  • “认识上帝就认识一切”也可能指上帝不可知,因此一切也不可知。
  • 用户经验显示小模型对不同语言表现不同,训练数据与技能有关,但不足以实现可插拔模块。
  • 编程涉及大量隐性知识(协议、数据库、架构、法律等),不能简单分割为独立模块。

10. AI 生成的 GitHub Copilot“Autofix”功能致使 Snowflake 的 Jira 被入侵 (AI-Generated GitHub Copilot “Autofix” Allowed Compromise of Snowflake’s Jira) #

https://www.wiz.io/blog/red-agent-snowflake-copilot-cicd-bug

Wiz Red Agent(自主 AI 安全研究工具)在 Snowflake 的公开仓库中发现一个 GitHub Actions 工作流脚本注入漏洞。该漏洞源于一个由 Copilot Autofix 共同编写的 PR(#1218),它移除了原有的安全输入处理模式,导致攻击者可通过创建带有恶意标题的 GitHub Issue 来执行任意命令。Wiz 在漏洞上线仅 5 天后便自主发现并利用该漏洞,成功获取了 Snowflake 内部 Jira 的 API 令牌,并验证了对其工程、安全合规和漏洞赏金项目的读取权限。Snowflake 在收到报告当天即修复了漏洞,并轮换了受影响的凭证。事件凸显了 AI 辅助编码可能引入安全回归,以及自动化安全代理能极速发现和利用漏洞的现实。


HN 热度 298 points | 评论 122 comments | 作者:galnagli | 9 hours ago #

https://news.ycombinator.com/item?id=49331423

  • 使用 zizmor 等静态分析工具可以检测 GitHub Actions 中的代码注入和安全漏洞。
  • GitHub Actions 中存在隐蔽的条件判断陷阱,例如 github.event.pull_request 在非 PR 事件中为 null 导致保护条件失效。
  • 在 GitHub Actions 中应避免直接字符串插值,改用 env 和环境变量,并结合 shellcheck 进行脚本检查。
  • GitHub Actions 的文档不清晰且缺乏内置安全 linting,导致用户容易犯错。
  • AI 模型基于大量不安全的 GitHub Actions 示例训练,生成的代码也继承这些风险。
  • 将 shell 脚本嵌入 YAML 而不使用独立脚本文件是不合理且危险的设计。
  • 技术过度宣传(如 AI)导致用户忽视实际存在的安全问题和传统分析工具的重要性。

Hacker News 精彩评论及翻译 #

Anthropic’s ‘watermark’ text adulteration in Claud… #

https://news.ycombinator.com/item?id=49327751

“The exact words we choose when writing matter.”

Then write your own damn text if you care about the exact wording so much

voidUpdate

写作时我们选择的词语很重要。


Anthropic’s ‘watermark’ text adulteration in Claud… #

https://news.ycombinator.com/item?id=49328278

My biggest concern is that checking any text for watermarks requires sending the entire text to Anthropic. And even that is not sufficient, as the text might have been generated with ChatGPT, Gemini, Grok, Mistral, …

So every check requires sending the text to as many AI providers as offer a watermarking detection API, almost all of which have a very dubious track history with obtaining training data through illicit means.

Any university using AI detection in their submission pipeline, or lawyers, editorialists, proofreaders that check for AI marks will be sending significant amounts of text like unpublished research, books, potentially internal documents and more, most of which is high quality human written, to dozens of AI companies, blindly trusting they won’t train on any of that.

ghrl

我最担心的是,检查任何文本是否带有水印都需要将整段文字发送给Anthropic。而且即便这样也不够,因为文本可能是用ChatGPT、Gemini、Grok、Mistral等工具生成的。

因此,每次检查都需要把文本发送给所有提供水印检测API的AI服务商——其中绝大多数都有通过不正当手段获取训练数据的可疑记录。

任何在论文提交流程中使用AI检测功能的大学,或是检查AI痕迹的律师、评论员、校对员,都将把大量未发表的研究、书籍、潜在内部文件等内容发送给数十家AI公司,盲目相信它们不会将这些内容用于训练——而其中大部分其实是高质量的人类原创内容。


Qwen 3.8 27B is excellent, but it defaults to over… #

https://news.ycombinator.com/item?id=49326409

“The fact that a 17GB file can do all of this stuff on my home machines is a miracle. Once again, I’m delighted and amazed at how much progress local models have made this year.”

I think that should be the blinking headline - this shows what can be done with consumer hardware.

chvid

17GB的文件能在我家电脑上完成所有这些操作,简直是奇迹。本地模型今年取得的进步再次让我既惊喜又震撼。

我觉得这应该是非常醒目的标题——它展示了消费级硬件能做到什么。


Anthropic’s ‘watermark’ text adulteration in Claud… #

https://news.ycombinator.com/item?id=49324316

I want any LLM I use to choose the very best, most precise words at every single decision point.

Then bad news: LLMs already use randomness in a fundamental way. Each time they go to generate a token, they first generate a probability distribution of possible tokens. Then they pick one randomly according to this distribution. The technique described can be thought of as making the random number generator pseudo random. The output it generates is one of the possible outputs it would have generated before, just now it’s deterministic and will generate the same thing every time.

syrrim

我希望我使用的任何大语言模型在每个决策点都能选择最准确、最精确的词汇。

那么坏消息是:大语言模型本质上已经在使用随机性了。每次生成一个词元时,它们首先生成可能词元的概率分布,然后根据这个分布随机选择一个。所描述的技术可以理解为让随机数生成器变成伪随机的。它生成的输出是之前可能生成的结果之一,但现在它是确定性的,每次都会生成相同的内容。


On AI regulation and messaging #

https://news.ycombinator.com/item?id=49328012

I think it is fundamentally a crisis of trust. I think that ordinary people don’t trust companies, governments, or the tech industry and always suspect that we are cooking up some new way to screw them over.

[…]

I don’t think that a glitzy marketing campaign with a positive spin (which some have advocated that Anthropic do) is the way to win back that trust — at this point, saying that AI will cure cancer is more a cliche than it is inspiring, and most people think it is deceptive. The thing that will work is actually curing cancer. I think by far the most accurate criticism of AI companies including Anthropic is that we haven’t yet delivered on our big promises to benefit the world. That is totally on us, and I think it’s the criticism you should be making, instead of all this stuff about messaging and marketing.

We are however doing our best to fix this: Anthropic is ramping up its efforts very quickly in biology and medicine, and we hope to have incredible results in the coming years and some early glimmers in the coming months. When we’ve actually accomplished something real, the whole world will hear about it, as loudly as possible, you have my word on that.

Turns out “winning back trust” doesn’t have anything to do with any actual concerns people may have re: employment, electricity prices, stock market bubble, intellectual property, scams, cybersecurity, environmental issues etc. Rather we’ll just do all of that even harder and the miracles (“curing cancer”, lol) we’ve so far failed to deliver are bound to arrive in short order!

kilpikaarna

我认为这从根本上是一场信任危机。我认为普通人既不信任企业、政府,也不信任科技行业,总觉得我们在想方设法搞出新花样来坑他们。

[…]

我不认为靠一场花哨亮眼、积极正面的营销活动(有些人曾建议Anthropic这么做)就能赢回信任——到了这个地步,说“AI会治愈癌症”更像是陈词滥调,而非鼓舞人心,而且大多数人觉得这是在骗人。真正有用的办法是切实治愈癌症。我认为对包括Anthropic在内的AI公司最准确的批评是:我们至今还没有兑现自己造福世界的重大承诺。这完全是我们自己的问题,我觉得这才是你们该提出的批评,而不是那些关于话术和营销的乱七八糟的东西。

不过我们确实在尽最大努力解决这个问题:Anthropic正在生物和医学领域迅速加大投入,我们希望在今后几年取得令人难以置信的成果,并在未来几个月看到一些初步的曙光。等我们真正做出实际成就时,全世界都会以尽可能响亮的声音听到这个消息,我向你们保证。

结果,“赢回信任”跟人们真正关心的那些实际问题毫无关系——比如就业、电价、股市泡沫、知识产权、诈骗、网络安全、环境问题等等。相反,我们只会把这些事儿做得更猛,而我们迄今没能兑现的“奇迹”(“治愈癌症”,呵呵)也很快就要来了!


AI;DR (AI; Didn’t Read) #

https://news.ycombinator.com/item?id=49336966

The part that astonishes me is that in the year of our common era two thousand twenty-six that it’s not universally offensive and reviling to post an AI-generated response to another person.

If I’m reading something on the internet, I’m either reading it to learn, or I’m reading it to be persuaded. If I wanted the LLM to teach me (thank you, no), I would ask an LLM. I’m reading your website/newsletter/email because I want to hear from you.. If you can’t be bothered to put your time into writing it and teaching me what you think, why should I be bothered to read it?

gortok

令我震惊的是,在公元二零二六年,竟然还有人觉得用AI生成的回复去回应他人不是一种普遍冒犯和侮辱的行为。

如果我在网上阅读内容,要么是为了学习,要么是为了被说服。如果我想让大语言模型来教我的话(不了,谢谢),我会直接去问大语言模型。我读你的网站、通讯或邮件,是因为我想听你本人的观点。如果你连花时间亲自写出来、让我了解你的想法都不愿意,那我凭什么还要费心去读呢?


Anthropic’s ‘watermark’ text adulteration in Claud… #

https://news.ycombinator.com/item?id=49324513

Crazy how a smart person like this fails to understand the gumbel softmax technique. It does not affect writing quality at all, provably. The very fact that there is generally no “best next token” with 100% certainty is precisely why the trick works (you cannot watermark a response to “respond with the To be or not to be soliloquy from the first folio Hamlet”, for precisely this reason).

levocardia

真疯狂,像这样聪明的人居然不理解Gumbel Softmax技术。它完全不影响写作质量,这是可证明的。正因为通常不存在100%确定的"最佳下一个词"——这正是该技巧有效的原因(你无法给"用第一对开本中《哈姆雷特》的‘生存还是毁灭’独白来回应"这个回应打水印,正是因为这个原因)。


Stripe will reportedly acquire OpenRouter for $7B+ #

https://news.ycombinator.com/item?id=49325457

You’d be surprised how little volume of api calls payments companies get compared to advertising companies or consumer internet companies. Stripe aren’t especially well placed to own this asset on a technical level. That doesn’t make this a bad acquisition per se, but there is no magic stripe can inject here as far as infra/technology is concerned.

danielmarkbruce

你会惊讶地发现,支付公司获得的API调用量相比广告公司或消费互联网公司少得多。Stripe在技术层面并不特别适合拥有这一资产。这本身并不意味这是一笔糟糕的收购,但就基础设施/技术而言,Stripe无法在此注入任何魔法。


Incident with Github.com #

https://news.ycombinator.com/item?id=49330987

This is starting to feel like Twitter. For a variety of reasons, we had a centralized place where everyone of a particular set of persuasions could connect, and this had outsize benefits for the community as a whole. That place is becoming untenable, and with the loss of goodwill and stability, the community’s started to dissipate. But there isn’t one obvious transition candidate, so the diaspora is finding itself spread across a bunch of disparate places and services. The stated need they satisfy (source control with a web interface and some technical features, like pull requests with reviews) will be fulfilled. But those emergent features like a core community and default expectation of where you can find someone will fade. And that is a very real loss for all of us.

Arubis

这感觉越来越像推特了。由于种种原因,我们曾有一个集中的平台,让持有特定观点的人们能够彼此联结,这对整个社区产生了巨大的益处。如今那个地方变得难以为继,随着善意与稳定性的流失,社区也开始分崩离析。但并没有一个明确的迁移目的地,于是离散的人群分散至各种不同的平台与服务。他们表面上声称满足的需求(带网页界面的源代码管理,以及诸如带审核的拉取请求等技术功能)终将得以实现。但那些涌现出来的特性——比如核心社群,以及默认你能在某个地方找到熟人的期待——将会消散。这对我们所有人而言,是实实在在的损失。


The federal keyword lists that canceled billions i… #

https://news.ycombinator.com/item?id=49326299

“Humanities” is literally on the list. As in, do not fund any Humanities research.

Also not allowed to use “solar energy”, “Geothermal energy”, “EV infrastructure”, “electrification”, “Hydrogen energy”.

Welp, America, you either gotta kick this administration out, or enjoy cosplaying the 1800s.

soundworlds

“人文学科”赫然在列。也就是说,不要资助任何人文研究。

还不允许使用“太阳能”、“地热能”、“电动车基础设施”、“电气化”、“氢能”。

唉,美国,你要么把这届政府赶下台,要么就享受扮演19世纪的乐趣吧。


Stripe will reportedly acquire OpenRouter for $7B+ #

https://news.ycombinator.com/item?id=49324405

To people asking why, this is a good lesson on the Collison’s ambitions. Stripe is one of the best API companies in the world. They know how to serve high volumes of latency and availability sensitive requests. They’ve abstracted the financial rails for payments and now want to abstract the rails for LLMs.

They’re the perfect company to own OpenRouter.

Tokens are simply a lightweight valuable asset. Stripe can serve as the middleman as well as anyone. They know how to route to many providers (payment rails) with huge differences in service characteristics. LLM providers are far easier.

Then they can work this into an offering where users can subscribe to tokens and use them across services. It solves one of the core monetization challenges of every AI company: how do you price when your costs are variable on usage, but nobody can make sense of charging by token?

From here, they can start hosting their own models and competing as an AWS for tokens. They can be the best provider of $OPEN_MODEL, or their own, and optimize for you.

tyre

有人问为什么,这正是一课关于科里森野心的好例子。Stripe是世界上最优秀的API公司之一,他们深谙如何服务高流量、对延迟和可用性敏感的请求。他们已经抽象化了支付金融通道,现在想要抽象化大语言模型的通道。

他们是拥有OpenRouter最合适的公司。

代币本质上只是轻量级的有价资产。Stripe能像任何人一样胜任中间商的角色。他们清楚如何路由到服务特性差异巨大的众多供应商(支付通道),而大语言模型供应商要简单得多。

接着他们可以将其整合成一项服务:用户订阅代币后能在不同服务间通用。这解决了所有AI公司核心的变现难题——当自身成本随用量波动,可没人能理解按token计费的方式?

从这里出发,他们可以开始托管自有模型,成为代币界的AWS。他们能成为$OPEN_MODEL或自有模型的最佳提供商,并为你优化体验。


Incident with Github.com #

https://news.ycombinator.com/item?id=49331087

That’s an overly optimistic view of things. For a lot of us GitHub is critical infrastructure, which if it goes down loses us and our customers money.

askonomm

这是对事情过于乐观的看法。对许多人来说,GitHub是至关重要的基础设施,一旦宕机,就会让我们和客户蒙受经济损失。


The federal keyword lists that canceled billions i… #

https://news.ycombinator.com/item?id=49325984

Math professors at my alma mater were instructed to remove references to “inequalities” to increase their chances of getting funded. The <= and >= type of inequalities.

whatever1

我母校的数学教授被指示删除对“不等式”的引用,以增加获得资助的机会。就是<=和>=这类不等式。


Incident with Github.com #

https://news.ycombinator.com/item?id=49331064

I have little sympathy that they’re buckling over a problem they helped create.

worble

我几乎不同情他们,因为他们对自己造成的问题束手无策。


Incident with Github.com #

https://news.ycombinator.com/item?id=49330791

I had a lot of goodwill for GitHub but I think today is the tipping point.

Looking at a unicorn page, I feel this lingering hope that it’s transient (like it usually was in the old days) but my mind reassures me it’s probably going to be a long full outage again.

The hope is dead.

khvn26

我曾经对GitHub充满好感,但今天我认为是转折点了。看到独角兽页面时,我仍抱有一丝侥幸希望这只是短暂的(就像过去常见的那样),但理智告诉我这很可能又是一次长时间的全面宕机。希望已经破灭。


Universal Health Coverage Could Save $1T and 114k … #

https://news.ycombinator.com/item?id=49333408

ACA has saved tons of lives. Due to the intense opposition, it was not structured in a way that could save money, but rather structured in the way that it could get through congress.

Additionally, as somebody who was around pre-ACA, I can not tell you how much better, in every single way, the post-ACA healthcare world is. Pre-existing conditions? Access to healthcare as an individual? These are life-changing possibilities, especially for entrepreneurs.

There’s a very clear type of fallacy you are engaging in here that only works in politics: you’re taking a vague general idea X, ignoring all particulars, and then lumping an idea Y together as if they identical and that any change in that general direction of Y could ever be different than what happened with X. There’s no intellectual rigor or honesty in that sort of thinking, yet it somehow pops up throughout all of politics.

epistasis

ACA拯救了无数生命。由于强烈的反对,它的设计并非以节省成本为目标,而是以能在国会通过的方式进行构建。

此外,作为经历过ACA实施前时期的人,我无法用语言形容ACA后的医疗体系在各方面有多么巨大的改善。既往病史?个人获得医疗保障的途径?这些都是改变人生的可能性,尤其对于创业者而言。

你这里存在一种只在政治中奏效的典型谬误:你拿一个模糊的广义概念X,忽略所有具体细节,然后强行将概念Y与之混为一谈,仿佛它们完全相同,仿佛Y的任一方向性改变都不可能产生与X不同的结果。这种思维既缺乏学术严谨性,也毫无诚实可言,却诡异地贯穿于整个政治领域。


Incident with Github.com #

https://news.ycombinator.com/item?id=49333670

Almost 3 hours in and still “We are still working to identify the root cause”

Can’t even view diffs in the web interface!

I’m out! I am willing to pay ~$5-10/mo for a reliable host I can swap as painlessly as possible. Mostly just building little static sites and little PWAs, no more than 500mb a repo and 10gb total. Need a repo with PRs and issues, where people can register free account and contribute or raise issues, GH actions CI, and pages host to deploy static sites. I don’t use more than 100 mins of CI a month. Any recommendations?

edit: GitLab free tier has all I need, but I kind of want to pay and have some kind of reliability (not necessarily an SLA, but). But their next tier is $29/mo, which is too much.

jubilanti

将近3小时过去了,状态依然是“我们仍在努力定位根本原因”。
连网页界面上的差异对比都看不了!
我受够了!我愿意每月花5-10美元找一个可靠的托管服务,切换起来尽可能无痛。主要只是搭建一些小型的静态网站和小型PWA,每个仓库不超过500MB,总容量10GB以内。需要支持PR和Issue的仓库,用户可以免费注册并贡献或提交问题,还要有GitHub Actions CI,以及能部署静态网站的Pages服务。我每月CI使用量不超过100分钟。有推荐吗?

编辑:GitLab免费版已经满足我所有需求,但我其实愿意付费换取一定的可靠性(不一定需要SLA,但至少稳定)。不过他们的下一个付费档次是每月29美元,太贵了。