给智能音箱塞进大模型后,为什么还得重做交互?
给智能音箱加上大模型以后,为什么还得重做交互?
大模型让音箱说话变溜了,但没解决三个关键问题:该说多少、用谁的数据、能不能直接动手。文章用“下班后提醒我买牛奶”这句话,在书桌前、开车时、厨房里三种场景跑了一遍,发现同一句话需要的回复长度、账户归属和操作权限完全不同。开车时系统应该只回一句“已记下”,而不是念选项让人分心;厨房这种共享空间里,如果访客或小孩的话被记进主人日历,隐私就乱了;听懂“买牛奶”...
推荐理由:文章没发新产品,也没给技术方案,但用同一个 prompt 在三个真实场景里跑了一遍,把语音交互里“该说多少、用谁的数据、能不能直接动手”这三个问题拆得很清楚。对正在做语音 agent 的团队来说,这个框架可以直接拿来当自查清单,所以放在 featured 档。OpenAI 和 Jony Ive 的标签只是背景,正文没展开合作细节,这点先别太激动。