Whisper Input 是受到即友FeiTTT启发做的一个简单的 python 代码。可以实现按下 Option 按钮开始录制,抬起按钮就结束录制,并调用 Groq Whisper Large V3 Turbo 模型进行转译,由于 Groq 的速度非常快,所以大部分的语音输入都可以在 1-2s 内反馈。并且得益于 whisper 的强大能力,转译效果非常不错。
| 功能 | 快捷键 |
|---|---|
| 多语言语音转译 | Option 或者 Alt |
| 中文翻译为英文 | Shift + Option 或者 Shift + Alt |
查看视频效果演示
重点:Groq 只要注册,就提供一定的免费用量,并且在我们这个使用场景下免费已经完全够用了!
🧐 当然,如果你在国内使用,并且无法访问 Groq 或者无法获得 Groq API,也欢迎反馈。因为我过去还做了一个 Groq 的 Whisper 代理池,理论上可以免费提供相对比较大的并发以及日常使用。但这需要你来单独申请,我会根据大家的需求考虑在后续的代码更新里添加对应的支持
-
注册 Groq 账户:https://console.groq.com/login
-
复制 Groq 免费的 API KEY:https://console.groq.com/keys
-
打开
终端,进入到想要下载项目的文件夹git clone git@github.com:ErlichLiu/Whisper-Input.git
-
创建虚拟环境 【推荐】
python -m venv venv
-
重命名
.env文件cp .env.example .env
-
粘贴在第 2 步复制的 API KEY 到
.env文件,效果类似GROQ_API_KEY=gsk_z8q3rXrQM3o******************8dQEJCYz3QTJQYZ -
在最好不需要关闭的
终端内进入到对应文件夹,然后激活虚拟环境# macOS / Linux source venv/bin/activate # Windows .\venv\Scripts\activate
-
安装依赖
pip install -r requirements.txt
-
运行程序
python main.py
🎉 此时你就可以按下 Option 按钮开始语音识别录入啦!
由于这个程序需要一直在后台运行,所以最好找一个自己不会经常下意识关掉的终端或者终端里的 Tab 来运行,不然很容易会不小心关掉。
关注作者个人网站,了解更多项目: https://erlich.fun
[✅] 多语言转译功能
[✅] 中文或多语言转译为英文
[ ] 标点符号支持
[ ] 添加 Agents,或许可以实现一些屏幕截图,根据上下文做一些输入输出之类的
如果你也有想法: 欢迎 Fork 和 PR,如果你在使用当中遇到问题,欢迎提交 Issue。
1.增加了一个延迟 0.5s 的触发,方便在一些快捷键需要用到 Option/Alt 按钮时不会被误触 2.重构代码
- 支持快捷键按下后的状态显示【正在录音、正在转译/翻译、完成】
- 支持多语言语音转换为英文输出
- 支持基本的快捷键语音转文字输入
遵循 MIT 协议
