1
我自己前阵子用 Hammerspoon 搭过一个简陋的语音输入工具。
我用 Claude Code 帮我写了代码,把 Hammerspoon 和豆包的语音输入串起来,按下一个快捷键开始录音,松开就直接把识别结果填到当前光标位置。
是能用,但稳定性一般,识别速度也比不上原生。当时是没办法,市面上没有更合适的 Mac 端方案。
后来微信输入法 Mac 版也提供了类似的语音输入功能,我就切换到了微信。不过用一段时间后能感觉到,识别率还有提升空间,尤其是长句、中英混杂时。有错别字,总会让人想换回键盘,用语音输入省下来的时间,被反复校对修改的时间打平了。
再后来,最近豆包输入法 Mac 版上线了,我又切回到了豆包。
豆包输入法之前在手机端的口碑就已经很好,有不少评测把它的识别率形容成「断档」级别。
2
语音输入这件事,2026 年,和五年前已经是两回事了。
对于内容创作者来说,是很重要的。
比如我现在写的这篇文章,就是用豆包语音输入完成的,效率比之前提升了,少说有50%吧。
我身边切换到语音输入的朋友越来越多,而且大多不是内容创作者。
程序员现在写代码的主流方式已经是口述式 Vibe Coding,运营、产品经理日常和 AI 沟通完成工作流,也在变成常态。哪怕不是科技公司,查资料、写邮件、整理会议,当一个人每天有大量时间是在「跟 AI 说话」的时候,语音输入的重要性就体现出来了。
打字本来是为了和电脑沟通发明的输入方式。
回头看输入的历史,会发现一直在朝「门槛更低」的方向走。五笔需要专门学,对应一套字根表,学习成本极高,还要报培训班;拼音不用学,但需要会拼音拼法,并且要在屏幕上一个一个看候选词去选;语音不需要学,不需要看屏幕,不需要选词,只需要说话。每一代的输入方式,都把门槛降低了一截。
键盘的输入速度上限大概是每分钟 80 到 100 个字,专业打字员能到 120。说话的速度则是每分钟 200 到 250 个字。是两倍多的差距。
我之前为了让效率更高,是认真学过双拼的。但是哪怕双拼对于全拼的提升空间也真的很有限。真正效率碾压还是语音输入。
过去之所以没体现出来,是因为语音识别准确率不够。比如 95% 的准确率和 99.9% 的准确率,看似只差不到 5 个百分点,但最终的效果天差地别。错一两个字可以忍,错十几个字就要反复停下来回去改。哪怕时间成本节省下来一点点,整体体验还很差。而多数情况下,其实是根本都完成不好任务。
另外,现在的输入法,比如豆包,都做了专门的轻声识别和抗噪,所以真的可以放到真实的工作场景里了。
此时适合祭出一张值得怀念的老图。
就目前的体验来说,豆包输入法我写完这整篇文章,需要修改的次数不超过 10 次。而输入完所需要的时间,保守估计,是之前的 1/10 。
3
也简单说几个豆包输入法值得讲的点,就可以感受到为什么说语音输入法到今天,可用性才足够强。
首先还是识别率。识别率不仅仅是说能把词语和句子梳理通顺,还包括中英混说能识别,轻声细语能识别,离电脑屏幕一两米说话也能识别。我自己试过开着车说几百个字(车里噪音不小),事后翻看几乎没有错别字。
第二是流式上屏。说话的时候字就在屏幕上跟着出来,停下来思考它不会自作主张补全,临时改口也能实时改写。
第三是上下文感知。它不是只根据字和词来做识别,而是会根据整个句子的含义来做校正。当识别到你在聊一个历史问题的时候,它会回到历史的情境里去做校正。读取过的人名、专有词,下次说到能直接匹配上,写一篇带几个人名、概念的文章不用反复纠正同一个错别字。
第四是足够克制。没有皮肤商城,没有信息流,没有广告。安装包不到 200MB。
当然,单说豆包输入法,目前也有一些待完善的地方,比如小众的词库积累还有提升空间,跨端复制还都没有,快捷键不支持鼠标侧键。版本号现在是 0.9,的确还是差一些到 1.0 的状态。
不过整体的体验,已经是完全可以替代我日常 90% 以上的键盘输入的程度了。
4
把视角拉远一点。
语音输入也正在变成 AI 的核心场景。
LUI(Language User Interface,语言用户界面)这个词在两三年前还有不少争议,现在已经不太有人争了。从 ChatGPT 开始,自然语言已经在事实上替代了一部分搜索框、命令行、菜单栏的功能。问 AI 一句话,比在多个 App 之间来回切换更直接。是未来必然会成为主流的方式,只不过到达这个目标的路径,大家依然会有争议。
而 LUI 的基础显然就是语音输入。
我自己有个明显的感受,在内容创作者之外,自从语音输入变顺手之后,每天主动搜索、主动问 AI 、主动写作和主动 vibe coding 的频率大幅增加了。以前可能想到一个问题,觉得不重要,懒得打字就过了;现在直接说一句话就行,问就问。一天 10 次和一天 100 次,长期累积下来差别还挺大的。
往更长远看,还有一件事更有意思。既然都要语音输入了,为什么还要有文本框?
过去,用户对着麦克风说话,语音被转成文字,文字被填到文本框里,文本框再把文字发给 AI 模型,模型再处理。
未来更可能是直接说话给应用服务和 agent,「帮我订一张明天去上海的高铁票,下午两点之后的,二等座」、「把刚才那段会议纪要整理成邮件发给客户」、「打开剪映,把我手机里今天拍的视频拼一个一分钟的版本」。中间的文本框、按钮、菜单都是过渡形态。
Wispr Flow 、Gemini 、OpenAI 各家都在做类似的尝试。豆包自家的桌面端「超能模式」也是类似方向。
所以聊的是输入法,其实还是整个的交互方式。这里面显然也会有挺多创业机会的。
4
如果决定开始用语音输入,我有几个具体的建议。
一个比较实用的建议是,买一个便携麦克风。
笔记本和手机自带的麦克风在安静环境下够用,虽然有了轻声识别和降噪的功能,但稍微有点环境噪音、或者离屏幕远一点,识别率就会低。
另外,更关键的一点是,多数情况下我们不是在私人空间里,或者身边没有别人,所以便携麦克风能保证我们轻声细语也能被听到。
我自己在用猛犸的便携麦克风。市面上大疆和罗德也都有类似的产品,价格几百到一千多不等。
另外还有一个点。
刚开始用语音输入,大概率会觉得别扭。可能我作为播客主播已经比较习惯了,但是身边有一些朋友还是有这种自言自语的尴尬感。
也需要有一个习惯的过程,因为口述和打字的思维方式不一样。打字时有时间组织语言,口述时要边想边说,有时候在口述的时候卡壳,自己就会格外尴尬。
我感觉这个是完全可以训练的,倒不必特别有羞耻感,又或者感觉自己就是一个不善言辞的人。用习惯了之后,还是会发现是一种很奇妙且顺滑的体验。
甚至有时候会有一种讲话的同时也在用嘴思考的状态,这个李诞是经常提到的。
可以试试看了。我是觉得已经到跟大家都推荐语音输入法的时候了。
想想最早普及了拼音输入法的北大朱守涛老师的智能 ABC 输入法,简直就是几个世纪之前的事情了。但是,这是我小时候最重要的输入法。
时间过得太快了,我们真是经历过于丰富的一代人。







