音频里没有的数字,语音模型照样念出来
编辑精选 把 LibriSpeech 音频里的数字消音,多个高分模型仍有三到四成概率照念不误。它们学到的是数据集的书写习惯,拿 WER 排名去挑生产环境的语音方案,选中的可能恰好是最会应付考题的那一个。 Hume AI 的七名研究员贴出一组
编辑精选 把 LibriSpeech 音频里的数字消音,多个高分模型仍有三到四成概率照念不误。它们学到的是数据集的书写习惯,拿 WER 排名去挑生产环境的语音方案,选中的可能恰好是最会应付考题的那一个。 Hume AI 的七名研究员贴出一组
编辑精选 ClarityCheck 把 900 万张人脸连同邮箱电话堆在没设权限的 S3 桶里,取回地址就写在自家网站前端代码中。公司回应称这不算公开暴露,理由是普通人找不到那串 URL——安全性建立在没人翻源码上。 安全研究员 Jerem
编辑精选 透明背景把一次抠图省进了生成环节,但不透明区 alpha 停在 254、成品带一圈灰晕这两个毛病,决定它眼下只够进原型稿,进不了电商主图的合成流水线。 OpenAI 在 API 里给 GPT Image 2 开放了透明背景,目前标
编辑精选 DeepSeek 把视觉塞进了 Flash 的价目表:单图折算最多 384 token、不另收视觉费,等于给 GUI agent 的截图开销封了顶。省钱的另一面是图像表征被削薄,密集界面看不看得清,还得拿脏数据实测。 8 月 21
编辑精选 苹果内部检测能认出曲子出自哪个 AI 模型,却把标注义务甩给分发商,说明平台握着抽查能力、不想背审查责任;被这套规则挤压的是靠数量铺货的 AI 音乐工厂。 苹果向 Apple Music 的内容分发商发出邮件,要求凡是 AI 参与
编辑精选 同一个模型在名字、仓库说明和模型卡上给出了三种参数口径,这不算失误,它暴露的是统一多模态架构还没有公认的数法:理解塔和生成塔要不要合并计数,各家没谈拢。 商汤 8 月 20 日在 GitHub 上给 SenseNova U1.5
编辑精选 OpenAI 把这一轮限流的原因归到订阅转 API 的分发行为上,等于承认风控系统一直按流量形态识别账号;对国内规模不小的拼车生态来说,官方口径第一次从默许滑向明说不支持。 一批 Codex 用户最近发现自己的额度掉得异常快,Op
编辑精选 三档接入里 app server 最能说明 OpenAI 的算盘:把模型外面那层执行系统整个摊开做成通用接口,计费口子仍然留在模型侧。Cisco 和一家报税服务商已经照这个路子把 agent 塞进了自家产品。 8 月 19 日,O
编辑精选 向量规模从千万级跳到百亿级,不是模型变大逼出来的,是 Agent 把每一步动作都变成了一次检索。谷歌选择在通用数据库里解决这件事,而没有再推一个独立产品。 谷歌云更新了 AlloyDB 的 ScaNN 索引,官方给出的规模上限是
编辑精选 一套六月底才在国内开源的投机解码方法,两个月后被一家美国端侧模型公司做成了默认加速件,连推理框架里的算法开关都直接沿用了它的名字。开源代码的扩散速度,比论文引用数诚实得多。 8 月 20 日,Liquid AI 在 Hugging