按钮不可用时先看页面是否提示浏览器不支持;能够开始却中断时,先保存已有文字,再记录错误内容。不要把所有故障都当成麦克风坏了,也不要连续刷新后重新口述整段重要内容。
按钮灰色时,先确认浏览器有没有识别接口
ToolboxHub 的语音转文字依赖浏览器提供的 SpeechRecognition 或 webkitSpeechRecognition。页面找不到这两个接口时,会显示不支持提示并禁用开始按钮,允许麦克风也不会补上缺失的功能。
页面提示可以尝试 Chrome 或 Edge,但这不是对所有版本、设备和运行环境的兼容承诺。先记录浏览器名称与版本,确认是在完整浏览器中打开页面;如果从其他应用内打开,可在自己已安装、允许使用的浏览器中重试。
截至 2026-09-12,MDN 的接口文档仍将此功能标为兼容性有限。这里没有一个适用于所有设备的最低版本号,判断依据应是当前页面是否能获得接口及短句识别是否成功。
能点击但没文字,要按错误提示缩小范围
先检查站点麦克风权限,再确认设备确实接收到自己的声音。工具没有麦克风设备选择器,也不能替你修复输入设备或解除组织策略。
例如准备口述一段社团活动通知,先说“周三下午三点,在二楼集合”。这句话不含真实姓名和联系方式,且时间、楼层都容易核对。只试这一句,观察页面是否进入“识别中”,再看有没有文字或错误弹窗。
根据 Web Speech API 规范中的错误定义,可以这样记录和排查:
not-allowed表示语音输入被禁止,先查站点权限与设备管理限制,不代表只要点击允许就必然解决。audio-capture表示音频采集失败,检查输入设备连接、静音状态与所选麦克风。no-speech表示没有检测到语音,确认正在收音后用正常音量说一句。network表示识别所需的网络通信失败;保留草稿,确认网络后再短测。language-not-supported表示当前识别语言不可用,页面能选到该语言并不保证服务提供支持。
每轮只改一个条件,比如先更换输入设备,再重复同一句话。一次同时改语言、网络与浏览器,即使恢复也难以知道原因。
说几句就停,先分清结束与报错
当前页面会尝试在识别正常结束且用户尚未停止时重新开始;出现错误时则会停止,并对多数错误显示代码。这个机制不能保证长时间不中断,不能把网页当成会议录音备份。
如果文本已经出现,先复制到自己的工作文档或下载一份,再排查中断。不要在未保存时刷新,也不要指望关闭页面后还能恢复文字。记录“最后识别到哪一句”和错误代码,比只记“又断了”更方便复现。
这项功能处理的是麦克风实时输入,页面没有导入已有音频文件的入口,也不提供原始录音下载。如果任务需要完整留存音频或多人轮流发言的可靠记录,应采用满足该任务要求且已获准的录音、转写流程。
有输出但词不对,检查语言和临时结果
先选与口述语言相符的选项,再用包含数字、否定词和专用名称的短句核对。当前列表只有中文(台湾)、中文(中国)、美式英语、英式英语、日语和韩语,不能据此声称支持所有方言。
页面会用方括号显示尚未确定的临时识别内容,这部分可能继续变化。停止后读完全文,确认末句没有缺失或重复,再编辑错字。文本框可以手动修改,适合补标点、改名称;但识别仍在运行时,新结果可能覆盖正在编辑的内容,最好停止后再整理。
检查“周三”有没有变成“周四”,“不要提前到场”有没有漏掉“不”。数字与否定词错误往往比标点更影响通知意思。不能用网页宣传中的准确率数字代替对这段内容的人工确认。
下载前检查文字,也检查使用场景
下载得到的是 transcript.txt 纯文本,不含录音、说话人标签或时间轴。打开下载文件核对首句、末句和修改过的词,再复制到通知或记录中。
需要缩短通知时,可以把校对后的版本放入字数统计查看长度;字数相同不代表两版意思相同,关键修改可以再用文字差异比对检查。
浏览器识别可能依赖远端服务,当前组件没有要求仅在本机识别,不能承诺离线或音频不离开设备。涉及客户信息、内部会议或他人声音时,先确认允许的处理方式;排错只用虚构短句。
常见问题
以下情况应分别处理,不要靠反复点击开始解决。
麦克风可以打电话,为什么这里不能识别?
通话收音正常只说明设备在那个应用中可用。这个页面还依赖浏览器接口、站点权限、语言和识别服务,需要逐项检查。
点了停止,刚出现的字还要检查吗?
要。停止不等于全文已校对,临时结果或末句可能仍有问题。下载前确认结尾,删除误带的临时标记并核对内容。
能把手机录音文件拖进来吗?
不能。当前工具没有音频文件导入功能;下载按钮也只下载文本,不会保存一份录音。
网络恢复后可以直接继续长篇口述吗?
先保存旧文本,再用短句确认恢复。正式口述分段检查,尤其核对重启前后的衔接,避免漏句或重复。