最新文章

音频里没有的数字,语音模型照样念出来

编辑精选 把 LibriSpeech 音频里的数字消音,多个高分模型仍有三到四成概率照念不误。它们学到的是数据集的书写习惯,拿 WER 排名去挑生产环境的语音方案,选中的可能恰好是最会应付考题的那一个。 Hume AI 的七名研究员贴出一组

人脸搜索站900万张照片公开可下载

编辑精选 ClarityCheck 把 900 万张人脸连同邮箱电话堆在没设权限的 S3 桶里,取回地址就写在自家网站前端代码中。公司回应称这不算公开暴露,理由是普通人找不到那串 URL——安全性建立在没人翻源码上。 安全研究员 Jerem

DeepSeek上线视觉实验版,单图封顶384token

编辑精选 DeepSeek 把视觉塞进了 Flash 的价目表:单图折算最多 384 token、不另收视觉费,等于给 GUI agent 的截图开销封了顶。省钱的另一面是图像表征被削薄,密集界面看不看得清,还得拿脏数据实测。 8 月 21

苹果强制标注AI歌曲,上传曲目三成是纯AI

编辑精选 苹果内部检测能认出曲子出自哪个 AI 模型,却把标注义务甩给分发商,说明平台握着抽查能力、不想背审查责任;被这套规则挤压的是靠数量铺货的 AI 音乐工厂。 苹果向 Apple Music 的内容分发商发出邮件,要求凡是 AI 参与

商汤开源U1.5,8B模型直出4K原生图

编辑精选 同一个模型在名字、仓库说明和模型卡上给出了三种参数口径,这不算失误,它暴露的是统一多模态架构还没有公认的数法:理解塔和生成塔要不要合并计数,各家没谈拢。 商汤 8 月 20 日在 GitHub 上给 SenseNova U1.5

Codex限流指向拼车共享,官方称会触发风控

编辑精选 OpenAI 把这一轮限流的原因归到订阅转 API 的分发行为上,等于承认风控系统一直按流量形态识别账号;对国内规模不小的拼车生态来说,官方口径第一次从默许滑向明说不支持。 一批 Codex 用户最近发现自己的额度掉得异常快,Op

OpenAI把Codex执行层开源,Cisco已接入

编辑精选 三档接入里 app server 最能说明 OpenAI 的算盘:把模型外面那层执行系统整个摊开做成通用接口,计费口子仍然留在模型侧。Cisco 和一家报税服务商已经照这个路子把 agent 塞进了自家产品。 8 月 19 日,O

谷歌把 AlloyDB 向量索引撑到 100 亿条

编辑精选 向量规模从千万级跳到百亿级,不是模型变大逼出来的,是 Agent 把每一步动作都变成了一次检索。谷歌选择在通用数据库里解决这件事,而没有再推一个独立产品。 谷歌云更新了 AlloyDB 的 ScaNN 索引,官方给出的规模上限是

Liquid AI 用 300M 草稿模型把解码提速 3.18 倍

编辑精选 一套六月底才在国内开源的投机解码方法,两个月后被一家美国端侧模型公司做成了默认加速件,连推理框架里的算法开关都直接沿用了它的名字。开源代码的扩散速度,比论文引用数诚实得多。 8 月 20 日,Liquid AI 在 Hugging

按主题浏览