所有文章

2026年9月6日 · 12 min read

語音 AI 接电说:何时真正值得用,何时不值得

72% 机构把表现质素列为部署語音 AI 的首要障礙。本文誠实拆解电说自動化何时适合你的生意、成本结构有何不同,以及为何多数商家应先由讯息渠道入手。

語音 AI 电说客服与文字讯息渠道的取捨示意图,说明商家何时值得採用电说自動化

語音 AI 在 2026 年大幅进步,但多数商家仍不应以它为起点。Deepgram 的 2025 年 State of Voice AI 调查发现,72% 机构把表现质素列为部署語音 agent 的首要障礙——单是这个数字,已说明技术的真实位置。「应否把电说线自動化?」的誠实答案是:完全取决於你的来电形态,而非示范聽起来有多驚艷。本文拆解語音真正成熟的地方、仍会失敗的地方、成本结构,以及文字或讯息才是更聰明起点的具体情况。(文中数据属全球研究,仅作方向參考。)


2026 年的語音 AI 够好嗎?

直接答案:对一小类量大、清晰的来电已经够好,对其餘大部分場景仍然不够。技术这一輪的确跨过了门檻,但「技术是真的」与「适合你的生意」是兩个不同的判断,而不少供应商行销刻意把兩者混为一谈。

进步是真的。人类对说期望 300 毫秒以內的接说节奏——就是那个令对说「有生命」的短暫停頓。据 Hamming AI 对逾 400 萬通生产环境語音 agent 通说的分析(2025–2026),现代語音对語音模型已做到 160–400 毫秒端到端,对比旧式「語音转文字、語言模型、文字转語音」串接管道的 1,000–2,000 毫秒;800 毫秒以下是生产标准,最好的系统已经达标。这就是为何 2026 年的語音示范可以自然得驚人,而 2023 年的像在跟售票机说说。

動力讯号也有:a16z 的 2025 年报告指,做語音的初創佔近期一屆 Y Combinator 的 22%。但動力不是成熟——一批初創湧现代表资本与注意力湧入,不代表在真实口音、真实噪音、真实動气客人面前的中位数部署表现良好。把炒作当成学習的理由,不要当成购买的理由。

a16z 自己的说法值得记住——語音是「切入点,不是产品」:自然的声音已是入場券,真正决定电说自動化帮不帮到客人的,是系统能否可靠理解混亂的真实来电並做对事——而这部分仍然困难。

語音 AI 還是文字客服好?

直接答案:没有絕对的优劣——决定因素是你的来电形态、客户的预设渠道,以及你需不需要書面纪录。語音贏在一種特定形态的需求;文字与讯息贏在更广泛的日常客服,所以多数商家由文字入手会有更稳定的结果。

語音适合量大、清晰、交易型的来电:查订单狀态、预约、收市后分流。适合电说为主的行业与慣性打电说的客群——如果你的电说整天响著同样的五條问题,語音自動化可以实质分擔。文字与讯息則适合更广的情况:非同步查询、需要文件的答案、已在 WhatsApp、Telegram 或网站对说的客户,以及一切需要可審计書面纪录的事。讯息也更便宜、更易以知识庫为根据、更易乾淨转介真人。一表看清:

因素 适合語音 AI 适合文字/讯息
查询形态 量大、清晰、交易型 非同步、需文件、多步驟
客户渠道 以电说为主的客群 WhatsApp/Telegram/网站客群
风險与准确度 可容忍偶爾重问 需要有根据、可審计的書面回复
多語言 口音与噪音风險較高 风險較低、更易复蓋多語
成本与复杂度 多了語音转換层与电说网絡延迟 成本較低、易於落地与转介

留意文字一欄复蓋了商家日常面对的大部分情况——这不是巧合,也是「讯息优先」成为预设建议的原因;只有真正电说优先的生意才应把次序倒转。

一个实用自测:回想你最近五十次客户互動,有多少次用「講」比用「写」更好?上门服務的派单員整个上午被问「師傅還来不来?」——語音可能勝出:问题短、答案短、客人要即时。店舖多数答尺码、退換政策、订单追蹤——文字大勝:最好的答案是连结、清单与客人可以回头翻看的确认。渠道应該跟著工作走,不是倒过来。

語音 AI 为何失敗、为何聽起来像机械?

直接答案:三个頑固原因——真实环境令准确度下滑、延迟有一部分是网絡问题无法优化掉、商家把「没转真人」誤当「问题解决」。花一分钱之前,三个都值得弄懂。

准确度是第一道牆。在安靜、标准口音示范中完美的模型,遇上濃重口音、背景噪音与情緒激動的来电就会失准;每一次「不好意思,可以再说一次嗎?」都在加时间、蝕信任。这正是 Deepgram 那个 72% 首要障礙数字背后的现实,也是试点停滯最常見的原因。

延迟是第二道牆,而且更隐蔽,因为它不全是模型的事。即使 AI 反应快,通说仍要经电说网絡与公共互聯网传送,跨区网絡跳转動輒增加 50–300 毫秒以上,公网封包不是调校程式可以优化掉的。客人在一地、語音 agent 寄存在另一地,那種延迟不是升級模型可以解决。

第三道牆是量度陷阱。「攔截」(containment,通说没有转到真人)被当成功来卖,但它不等於「解决」(resolution,问题真正解决)。憤怒放棄掛线的客人也算「被攔截」。供应商若以攔截率行销,要追问:被攔截的通说之中,有多少真正解决了客人的问题?兩个数字之间的落差,正是许多語音部署靜靜失敗的地方。

三道牆還会互相放大:失准觸发重问,重问增加延迟,延迟令客人不耐烦、开始搶说,搶说又令准确度更差。安靜、有稿的示范剔走的,正是引发这个惡性循环的條件——所以许多語音试点在会议室驚艷、在现实失望。誠实的结论不是語音差,而是語音不寬容:只有用真实来电测试才知道行不行。

語音 AI agent 的成本是多少?

直接答案:定价正由純按分钟计费,转向平台费加用量的混合模式,因为底层模型成本在下降——但真正的成本故事是:語音背负著文字完全没有的成本层。只为「AI」那一项做预算,正是商家被成本嚇到的原因。

模型成本在跌,这是好事。OpenAI 把实时語音 API 减价约 20%,至约每百萬音讯输入 token US$32、输出 token US$64(OpenAI,2025,经 a16z 語音报告引述)。token 价格下跌是真的,用量开支逐年更可负擔。但語音在此之上多了兩层处理——入口的語音转文字、出口的文字转語音——再加上路由、接駁与维持通说稳定的电说网絡基建;文字自動化全部省掉。加总起来,示范画面上看似相若的語音与文字部署,語音在生产环境通常明显更貴、更复杂。成本层一览:

  1. 模型/推理成本——快速下降(实时 API 约每百萬音讯 token US$32/US$64),但語音与文字都有。
  2. 語音转文字层——語音独有;把来电音讯转成文字給模型。
  3. 文字转語音层——語音独有;把模型回复转回自然語音。
  4. 电说网絡基建——語音独有;路由、通说稳定与无法避免的跨区延迟。
  5. 调校与 QA 开销——語音較高,口音、噪音与插说处理都需要真实测试。

对多数商家而言,只有电说量真正够大、来电够重复,这层额外成本才值得背;未到那个门檻,你是在为一个文字或网站渠道可以更便宜、更准确处理的工作付复杂性稅。

商家何时不应該用語音 AI?

直接答案:来电量低、種类杂、情緒敏感、多語言,或客户本来已在用讯息渠道——这已涵蓋一大部分商家。把这句说直说很重要,因为幾乎没有供应商会说:这个类別的誘因,是把語音包装成必然。

客户主要经讯息或网站找你,就不要強迫改用語音跟机器对说——那是加摩擦,不是减摩擦。答案以连结、逐步清单或截图为佳的支援,口述是最差的格式。多語言与口音多元的客群要特別小心:語音准确度随口音与噪音下滑,文字則完全避开这个风險,是多語客服更稳的地基。至於情緒激動或高风險的来电——争议、投訴、答錯会造成实质损失的一切——应交真人处理,AI 的角色仅限於快而乾淨的分流。

工具层面也值得说白:Omago 是一个会做事的 AI agent 平台,协助商家在 WhatsApp、Telegram 与网站对说中自動处理客户对说,聚焦讯息与网站而非語音——因为那是多数商家的客户已经在的地方、答案最容易以知识庫为根据的地方,也是今天自動化成本效益最高、风險最低的地方。語音对合适的来电形态是可信的未来渠道,只是不是多数老闆的正确第一步。整体渠道选擇可參考 怎样为 AI agent 选擇合适的讯息渠道

合理的語音 AI 上线是怎样的?

直接答案:由窄入手、量度解决而非攔截、真人永远只差一步。用語音用得成功的商家,把它当成处理幾类清晰来电的精准工具——不是第一天就取代整條电说线。

先选一至兩个答案毫不含糊的高结构意图:查订单、预约,或把来电送往正确队列的收市后分流。抗拒把語音指向全部来电——窄范围才保得住准确度与通说体验,也給你乾淨数据判断应否扩展。然后誠实量度:追蹤被攔截通说中真正解决问题的比例、客人被要求重复的頻率、转真人的次数与原因。转介路徑要在上线前建好,不是等第一个灾难星期之后——客人一说「找真人」,系统应立即照办並帶完整脈絡交接。设定目标的方法,可參考 AI agent 的 30-60-90 日 KPI 计劃

貫穿所有誠实评估的主线相同:自動化要稳,不要趕潮流。2026 年的語音 AI 是真的、进步快、对合适的来电形态真有用;它同时比文字更难、更貴、更高风險——对多数商家而言,一个有根据的讯息或网站 agent 会更快、更便宜地交出更可靠的结果。来电量大、结构清晰、客群电说优先时,採用語音;在那之前,由客户已经在的地方开始。


常見问题

2026 年語音 AI 足以取代我的电说真人團队嗎?

对多数商家而言,不能整体取代。語音 AI 足以处理查订单、预约等一小类量大、清晰的来电,但 Deepgram 2025 年调查中仍有 72% 机构把表现质素列为首要障礙。成熟的模式是語音处理例行、结构化的通说,真人处理复杂、情緒与高风險的通说。

攔截率与解决率有甚麼分別?

攔截指通说没有转到真人;解决指客人的问题真正被处理好。供应商行销经常把兩者混为一谈,但憤怒掛线的客人也算「被攔截」。永远要问被攔截的通说中有多少真正解决了问题——那个落差正是许多語音部署失敗的地方。

語音 AI 为何聽起来延迟或机械?

兩个原因。其一,准确度随口音、背景噪音与情緒通说下滑,引发蝕信任的「可以再说一次嗎」循环。其二,延迟有一部分是网絡问题——跨区跳转增加 50–300 毫秒以上,公网封包无法优化掉,即使模型本身 160–400 毫秒內回应。

語音 AI 的预算要留意甚麼?

模型成本在跌(2025 年实时 API 约每百萬音讯输入/输出 token US$32/US$64),但要另外预算語音转文字、文字转語音与电说网絡基建这些文字自動化没有的层。对多数商家而言,只有电说量够大、来电够重复,这层额外开支才值得。

应該先做語音還是文字讯息?

多数商家应先做文字或讯息:更便宜、更易以知识庫为根据、对多語客群风險更低,並留有可審计的書面纪录。只有客群真正电说优先、来电量大而结构清晰时,才先做語音。


资料来源:Deepgram《State of Voice AI 2025》(72% 机构視表现质素为首要障礙,经 Telnyx 引述);Hamming AI(2025–2026,逾 400 萬通生产环境語音通说分析,160–400 毫秒端到端延迟);a16z《AI Voice Agents 2025 Update》(YC 22%、「切入点不是产品」框架,引 Cartesia);OpenAI「Introducing gpt-realtime」(2025,实时語音 API 减价约 20%)。以上属全球数据,仅作方向參考。本文不构成法律或专业意見。

准备好试用 Omago?

几分钟内设置你的 AI 助手。免费开始,无需信用卡。

免费开始