Token导航 LogoToken导航TokenDH.com

有嘴就能用电脑的时代来了

更新时间 2026-05-20来源 刘飞Lufy正文 2760字阅读约 9分钟

1

我自己前阵子用 Hammerspoon 搭过一个简陋的语音输入工具。

我用 Claude Code 帮我写了代码,把 Hammerspoon 和豆包的语音输入串起来,按下一个快捷键开始录音,松开就直接把识别结果填到当前光标位置。

是能用,但稳定性一般,识别速度也比不上原生。当时是没办法,市面上没有更合适的 Mac 端方案。

后来微信输入法 Mac 版也提供了类似的语音输入功能,我就切换到了微信。不过用一段时间后能感觉到,识别率还有提升空间,尤其是长句、中英混杂时。有错别字,总会让人想换回键盘,用语音输入省下来的时间,被反复校对修改的时间打平了。

再后来,最近豆包输入法 Mac 版上线了,我又切回到了豆包。

豆包输入法之前在手机端的口碑就已经很好,有不少评测把它的识别率形容成「断档」级别。


2

语音输入这件事,2026 年,和五年前已经是两回事了。

对于内容创作者来说,是很重要的。

比如我现在写的这篇文章,就是用豆包语音输入完成的,效率比之前提升了,少说有50%吧。

我身边切换到语音输入的朋友越来越多,而且大多不是内容创作者。

程序员现在写代码的主流方式已经是口述式 Vibe Coding,运营、产品经理日常和 AI 沟通完成工作流,也在变成常态。哪怕不是科技公司,查资料、写邮件、整理会议,当一个人每天有大量时间是在「跟 AI 说话」的时候,语音输入的重要性就体现出来了。

打字本来是为了和电脑沟通发明的输入方式。

回头看输入的历史,会发现一直在朝「门槛更低」的方向走。五笔需要专门学,对应一套字根表,学习成本极高,还要报培训班;拼音不用学,但需要会拼音拼法,并且要在屏幕上一个一个看候选词去选;语音不需要学,不需要看屏幕,不需要选词,只需要说话。每一代的输入方式,都把门槛降低了一截。

键盘的输入速度上限大概是每分钟 80 到 100 个字,专业打字员能到 120。说话的速度则是每分钟 200 到 250 个字。是两倍多的差距。

我之前为了让效率更高,是认真学过双拼的。但是哪怕双拼对于全拼的提升空间也真的很有限。真正效率碾压还是语音输入。

过去之所以没体现出来,是因为语音识别准确率不够。比如 95% 的准确率和 99.9% 的准确率,看似只差不到 5 个百分点,但最终的效果天差地别。错一两个字可以忍,错十几个字就要反复停下来回去改。哪怕时间成本节省下来一点点,整体体验还很差。而多数情况下,其实是根本都完成不好任务。

另外,现在的输入法,比如豆包,都做了专门的轻声识别和抗噪,所以真的可以放到真实的工作场景里了。

此时适合祭出一张值得怀念的老图。

就目前的体验来说,豆包输入法我写完这整篇文章,需要修改的次数不超过 10 次。而输入完所需要的时间,保守估计,是之前的 1/10 。


3

也简单说几个豆包输入法值得讲的点,就可以感受到为什么说语音输入法到今天,可用性才足够强。

首先还是识别率。识别率不仅仅是说能把词语和句子梳理通顺,还包括中英混说能识别,轻声细语能识别,离电脑屏幕一两米说话也能识别。我自己试过开着车说几百个字(车里噪音不小),事后翻看几乎没有错别字。

第二是流式上屏。说话的时候字就在屏幕上跟着出来,停下来思考它不会自作主张补全,临时改口也能实时改写。

第三是上下文感知。它不是只根据字和词来做识别,而是会根据整个句子的含义来做校正。当识别到你在聊一个历史问题的时候,它会回到历史的情境里去做校正。读取过的人名、专有词,下次说到能直接匹配上,写一篇带几个人名、概念的文章不用反复纠正同一个错别字。

第四是足够克制。没有皮肤商城,没有信息流,没有广告。安装包不到 200MB。

当然,单说豆包输入法,目前也有一些待完善的地方,比如小众的词库积累还有提升空间,跨端复制还都没有,快捷键不支持鼠标侧键。版本号现在是 0.9,的确还是差一些到 1.0 的状态。

不过整体的体验,已经是完全可以替代我日常 90% 以上的键盘输入的程度了。


4

把视角拉远一点。

语音输入也正在变成 AI 的核心场景。

LUI(Language User Interface,语言用户界面)这个词在两三年前还有不少争议,现在已经不太有人争了。从 ChatGPT 开始,自然语言已经在事实上替代了一部分搜索框、命令行、菜单栏的功能。问 AI 一句话,比在多个 App 之间来回切换更直接。是未来必然会成为主流的方式,只不过到达这个目标的路径,大家依然会有争议。

而 LUI 的基础显然就是语音输入。

我自己有个明显的感受,在内容创作者之外,自从语音输入变顺手之后,每天主动搜索、主动问 AI 、主动写作和主动 vibe coding 的频率大幅增加了。以前可能想到一个问题,觉得不重要,懒得打字就过了;现在直接说一句话就行,问就问。一天 10 次和一天 100 次,长期累积下来差别还挺大的。

往更长远看,还有一件事更有意思。既然都要语音输入了,为什么还要有文本框?

过去,用户对着麦克风说话,语音被转成文字,文字被填到文本框里,文本框再把文字发给 AI 模型,模型再处理。

未来更可能是直接说话给应用服务和 agent,「帮我订一张明天去上海的高铁票,下午两点之后的,二等座」、「把刚才那段会议纪要整理成邮件发给客户」、「打开剪映,把我手机里今天拍的视频拼一个一分钟的版本」。中间的文本框、按钮、菜单都是过渡形态。

Wispr Flow 、Gemini 、OpenAI 各家都在做类似的尝试。豆包自家的桌面端「超能模式」也是类似方向。

所以聊的是输入法,其实还是整个的交互方式。这里面显然也会有挺多创业机会的。

4

如果决定开始用语音输入,我有几个具体的建议。

一个比较实用的建议是,买一个便携麦克风。

笔记本和手机自带的麦克风在安静环境下够用,虽然有了轻声识别和降噪的功能,但稍微有点环境噪音、或者离屏幕远一点,识别率就会低。

另外,更关键的一点是,多数情况下我们不是在私人空间里,或者身边没有别人,所以便携麦克风能保证我们轻声细语也能被听到。

我自己在用猛犸的便携麦克风。市面上大疆和罗德也都有类似的产品,价格几百到一千多不等。

另外还有一个点。

刚开始用语音输入,大概率会觉得别扭。可能我作为播客主播已经比较习惯了,但是身边有一些朋友还是有这种自言自语的尴尬感。

也需要有一个习惯的过程,因为口述和打字的思维方式不一样。打字时有时间组织语言,口述时要边想边说,有时候在口述的时候卡壳,自己就会格外尴尬。

我感觉这个是完全可以训练的,倒不必特别有羞耻感,又或者感觉自己就是一个不善言辞的人。用习惯了之后,还是会发现是一种很奇妙且顺滑的体验。

甚至有时候会有一种讲话的同时也在用嘴思考的状态,这个李诞是经常提到的。

可以试试看了。我是觉得已经到跟大家都推荐语音输入法的时候了。

想想最早普及了拼音输入法的北大朱守涛老师的智能 ABC 输入法,简直就是几个世纪之前的事情了。但是,这是我小时候最重要的输入法。

时间过得太快了,我们真是经历过于丰富的一代人。

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多