我给孩子的阅读 app,请了个 AI 陪读老师
孩子坐在 iPad 前,跟着阅读 app 读英语。读完一句,他抬头喊:
"爸爸,我读得对吗?"
我在厨房做饭,头也没回:"嗯,挺好,继续。"
其实我也不知道他读得对不对。😅
光"听"不"反馈",等于白读
我给孩子做了个英语阅读 app。本来挺得意——一百多本分级绘本,点一下就有标准发音朗读。
但用了一阵我发现个问题:它只能让孩子听,不能告诉孩子读得怎么样。
孩子跟着读完一句,app 没反应。读对了没人夸,读错了没人纠。时间长了,他读完就翻页,跟完成任务似的。
语言学习最怕这个。学说话、学弹琴,靠的都是反馈闭环——你做一个动作,立刻有人告诉你对不对。没有反馈,练习就是空转。
类比一下:这就像学钢琴,只让你听大师的示范曲,却不让你弹、不告诉你弹得对不对。听一百遍,手还是不会。🎹
可现实是,我没法句句陪着他、即时纠正。我英语没那么好,而且他读英语的时候,我多半在做饭、在忙。
那就请个 AI 陪读
念头很直接:我没法当这个陪读,让 AI 来当。
孩子按住按钮读一句,AI 听完,立刻告诉他:这句多少分,哪个词读得好,哪个词没读准。
想法简单,落地要解决三件事。
第一件事:给 AI 装上"耳朵"
首先得有个能听懂发音、还能打分的 AI。
我 app 里的朗读发音,用的是豆包的语音合成。我第一反应是看豆包有没有"语音评测"——结果没有。它会"说",但不会"听"、不会"判"。
那就找会的。一圈下来,选了腾讯的智聆口语评测(SOE)。理由很实在:
- 它能逐词打分,每个单词单独给个 0 到 100 的分。这正好对上我想要的效果——不只是给个总分,还能标出哪个词没读好。
- 它会从准确度、流利度、完整度三个维度评,比单纯"对不对"细得多。
- 按次收费,一千次也就几块钱。给娃用,量不大,几乎可以忽略。
选 AI 能力就是这样:不追最贵的、最有名的,追最对得上你需求的。我要的是"逐词评分",谁能给我这个,我就用谁。
第二件事:留个"插座",别把线焊死
这是我做的时候最得意的一点。
我没有让界面直接去调腾讯的接口。而是先定了一个抽象的"评测服务"——你可以理解成一个标准插座。界面只认这个插座,不认插座后面接的是哪家电器。
然后我先插上一个假的评测服务(返回随机分数),把整个界面、交互、动画全跑通了。
确认体验没问题,再把假插座拔下来,换上真的腾讯接口。
前端一行代码都没改。
为什么要这么绕?因为 AI 供应商是会变的。今天腾讯便宜好用,明天它涨价了、或者出了更好的,我只需要换一个"插头",整个 app 其他部分纹丝不动。
类比一下:你家墙上的插座是国标,今天插台灯,明天插风扇,墙里的线不用动。我做的,就是给 app 装了个"国标插座"。🔌
这个习惯救过我很多次。把"会变的"和"不变的"隔开,是软件工程里最值钱的几个道理之一。
第三件事:浏览器录音,藏着几个坑
让 AI 听到孩子读,得先录下来。这部分听着简单,坑不少。
格式不对。 浏览器录出来的声音是 WebM 格式,腾讯要的是 WAV。中间得转一道码,不然人家不收。
交互要顺。 我做成"按住录音、松开提交"。但手指抖一下、点了不到半秒就松开,那是误触,不能提交。录太久也不行,设了 15 秒上限——RAZ 的句子,够了。
这些都不是什么高深技术,但产品体验就藏在这些细节里。一个误触没处理好,孩子就会觉得"这破玩意儿怎么乱跳",然后不想用了。
最后:五色评分卡
评测结果,我做成一张卡片:
一个大号总分,下面把原句每个词标上颜色——
- 90 分以上:绿色,读得真棒
- 80 多分:蓝色,不错
- 70 多分:黄色,还行
- 60 多分:橙色,差点意思
- 60 分以下:红色,再练练
孩子不一定看得懂分数,但看得懂颜色。哪个词是红的,他就知道那个词没读好,会自己再读一遍。
卡片底下有个"再试一次"。我观察到,他看到红色,真的会主动点"再试一次",直到把那个词读绿。
反馈闭环,就这么转起来了。✅
写在最后
回头看,这个功能没什么黑科技。
它就是把一个现成的 AI 能力(语音评测),接到一个具体的小痛点上(孩子读书没人即时反馈)。AI 落地不神秘,难的是找到那个真痛点,然后把它接得顺滑。
过程中真正值钱的,反而是那些"笨功夫":
- 选型时,找最对得上需求的,不追名气。
- 设计时,留好抽象的插座,别把供应商焊死。
- 实现时,把误触、超时、格式转换这些细节磨平。
孩子现在读英语,会自己追着 AI 要分数了。那个"爸爸我读得对吗"的问题,终于有人能秒回他了。
虽然回他的不是我,是 AI。但挺好的。👨👦
如果你也在给孩子做学习工具,或者在琢磨 AI 怎么落地到小产品里,点个在看,转发出去,让更多人看到这条路。
你的 AI 落地踩了什么坑?欢迎评论区聊聊——每一条留言我都会看。