尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

OpenGlass智能眼镜DIY全流程:25美元零件,把普通眼镜变成AI识别终端

OpenGlass智能眼镜DIY全流程:25美元零件,把普通眼镜变成AI识别终端 OpenGlass智能眼镜DIY全流程25美元零件把普通眼镜变成AI识别终端【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass副标题ESP32 S3开源方案实测从买零件、刷固件到跑通人物识别与实时翻译一份写给新手的完整路线图OpenGlass是一个开源智能眼镜项目目标很直接用不到25美元的现成零件把任何一副普通眼镜改造成具备AI能力的智能设备。它能记录你看到的东西、帮你记住见过的人、识别物体、翻译眼前的外文文本。整个方案基于ESP32 S3芯片固件和软件栈全部开源硬件DIY与代码定制两条路都能走。一、先看两个真实使用场景判断它适不适合你场景一从没碰过Arduino的新手小林花了半天时间完成了整个组装。他把一块Seeed Studio XIAO ESP32 S3模块固定到3D打印的眼镜支架上接上一块250mAh的小电池然后用Arduino IDE把固件刷进芯片。当他戴上眼镜、看向街边的外文路牌时手机屏幕上出现了翻译好的中文——全程硬件成本不到两杯咖啡的价格。场景二想深度定制代码的开发者小李拿到项目后没有急着用而是先看了prompts/generate.ts这个测试脚本。它能把项目自带的几十张测试照片批量跑过多个视觉模型对比不同模型的描述质量。他据此把默认模型换成了更轻量的版本识别速度提升了大约四成整个改动只涉及一处配置。这两个场景对应OpenGlass的两类用户只想用起来的人和想改起来的人。下面按先体验、后拆解的顺序展开。二、项目亮点速览成本门槛低整套硬件约25美元远低于市售AI眼镜的定价。全链路开源从ESP32 S3固件到前端Expo应用代码都在仓库里随意修改。模型可替换默认走本地Ollama的moondream视觉模型也可以换成llava、接入Groq或OpenAI。隐私可控不依赖云端也能跑本地推理时照片不出你的设备。模块化结构换模型、改识别频率、调整采集逻辑各改各的文件互不干扰。三、十分钟快速体验先跑通软件端硬件可以稍后再弄软件端现在就能体验。整个过程只需要终端和浏览器。第1步克隆仓库并安装依赖git clone https://gitcode.com/GitHub_Trending/op/OpenGlass cd OpenGlass yarn install第2步拉取本地视觉模型ollama pull moondream:1.8b-v2-fp16这个模型负责看懂摄像头拍到的画面体积小、响应快是新手入门最稳的选择。第3步配置密钥文件打开sources/keys.ts它是所有AI服务的配置入口。项目默认通过环境变量读取密钥如果你不想配置环境变量直接把空字符串替换成密钥即可export const keys { groq: 你的Groq密钥, // 用于Llama 3问答 ollama: http://localhost:11434/api/chat, // 本地模型地址 openai: 你的OpenAI密钥, // 用于高级图像识别 };第4步启动应用yarn start这是Expo项目启动后按提示打开localhost链接就能在浏览器里看到连接页面。此时没有硬件也能熟悉界面结构等硬件到手后点Connect to the device即可配对。上图来自项目prompts/series_1测试集摄像头拍下的真实生活场景会被视觉模型转成文字描述用来验证各模型的识别准确度。四、原理拆解一条输入→处理→输出流水线OpenGlass的工作方式可以用三段式流水线理解比想象中简单。输入端眼镜负责采集。ESP32 S3模块上集成了摄像头和麦克风固件firmware/firmware.ino初始化这些硬件并通过BLE蓝牙把照片和音频流发送到你的手机或电脑。固件里还预留了三种音频编码方式Opus、Mulaw、PCM对应不同的前端应用。处理端应用负责调度。电脑或手机上的Expo应用收到数据后交给sources/agent/Agent.ts处理。它会先调用视觉模型给每张照片生成一段文字描述再把这些描述累积起来作为问答的上下文。核心调用很简洁const resp await axios.post(keys.ollama, { stream: false, model: moondream:1.8b-v2-fp16, messages: [{ role: user, content: Describe the scene, images: [toBase64(photo)], }], });输出端模型负责回答。你对着眼镜提问时Llama 3走Groq会基于之前积累的所有画面描述来作答回答只依赖已记录的画面信息不会凭空猜测。这套先描述、后问答的设计让普通单目摄像头也能实现接近多模态的效果。五、实战演示硬件组装与固件上传完整走一遍当软件端跑通后就可以进入硬件环节了。你需要的材料就三样Seeed Studio XIAO ESP32 S3 Sense含摄像头与麦克风3.7V 250mAh锂电池3D打印的眼镜支架外壳STL文件在项目文档里组装步骤很简单把ESP32 S3模块固定到支架上接好电池戴上眼镜确认摄像头朝向正前方即可。接下来上传固件。推荐用arduino-cli命令行方式比图形界面更好复现arduino-cli config add board_manager.additional_urls https://raw.githubusercontent.com/espressif/arduino-esp32/gh-pages/package_esp32_index.json arduino-cli core install esp32:esp322.0.17 arduino-cli board list用board list确认端口号后编译上传把COM5换成你的实际端口arduino-cli compile --build-path build --output-dir dist -e -u -p COM5 -b esp32:esp32:XIAO_ESP32S3:PSRAMopi注意命令末尾的PSRAMopi对应图形界面里的PSRAM: OPI PSRAM。这一步必须设置否则芯片内存不足上传后一运行就崩溃。文件地图哪些文件需要你亲手改文件作用新手要改吗README.md项目总览与快速入门必读sources/keys.tsAPI密钥与模型地址配置必须改firmware/firmware.ino硬件初始化与采集调度默认不用动App.tsx前端交互界面入口基础使用不用动prompts/generate.ts批量测试视觉模型的脚本开发者进阶用sources/agent/imageDescription.ts图像描述与问答逻辑换模型时改这里六、动手过程中最常遇到的3个问题问密钥填了但调用还是失败keys.ts默认读环境变量如process.env.EXPO_PUBLIC_GROQ_API_KEY。如果你直接改文件注意要把?? 一并替换掉否则空字符串会覆盖你的密钥。改完要重启yarn start让配置生效。问固件上传时报端口未找到先确认USB线不是纯充电线再运行arduino-cli board list查看设备是否被识别。Windows下若识别为未知设备需要手动指定驱动Linux下可能需要把当前用户加入dialout组并重新登录。问图像识别卡顿或长时间无响应优先确认本地模型是否拉取成功ollama list能看到 moondream 才算就绪以及keys.ts里 ollama 地址是否指向http://localhost:11434/api/chat。如果仍然慢可以在imageDescription.ts里把模型换成更小的moondream:1.8b-v2-moondream2-text-model-f16。七、进阶玩法从能用到好用批量对比模型运行yarn prompts脚本会读取prompts/series_1下的所有测试照片依次用默认模型、llava-llama3、llava:34b等跑一遍并输出对比报告帮你选出识别又快又准的组合。调整采集频率在firmware/firmware.ino里修改captureInterval变量控制拍照间隔平衡续航与实时性。接入云端API在imageDescription.ts中改用gptRequest或groqRequest把视觉任务交给云端大模型适合对识别精度要求更高的场景。关注后继版本项目作者已把后续开发迁移到Omi仓库新功能与社区讨论都在那边进行贡献代码前建议先了解最新进展。八、写在最后OpenGlass不是那种看看就好的项目它的价值在于真正把AI眼镜的成本和复杂度压到了普通爱好者够得着的位置。无论你是想拥有一副能翻译、能记事的眼镜还是想在固件、模型、交互上练手它都能提供一个不设防的起点。按本文顺序先跑通软件、再上手硬件、最后按需定制一个周末的时间足够你戴上自己做的AI眼镜出门了。【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表