端侧大模型驱动的飞书风格办公助手(飞书功能实现)
·
项目定位(见github)
模拟飞书 “跨平台办公套件” 场景,开发一款支持 端侧大模型本地化推理 的轻量办公助手,覆盖 “文档摘要 + 会议纪要生成 + 跨端消息同步” 核心功能,重点练手 C++ 跨平台开发、端侧 AI 性能优化、系统资源调度。
核心技术栈
- 开发语言:C++(主力)、Python(模型转换辅助)
- 跨平台框架:Electron(Windows/MacOS/Linux 适配,飞书客户端技术栈)
- 热门模型:端侧量化版 LLaMA-3(7B 参数,通过 llama.cpp 部署)、Whisper-Tiny(语音转文字,会议纪要场景)
- 性能优化工具:Xperf(Windows 性能分析)、Instruments(MacOS 内存监控)、Valgrind(Linux 内存泄漏检测)
关键实现点
-
端侧大模型轻量化落地
- 用 GPTQ 量化将 LLaMA-3 7B 模型压缩至 4bit,内存占用从 28GB 降至 7GB,满足客户端本地运行;
- 开发 “模型加载优先级调度” 逻辑:空闲时预加载模型,办公操作时自动降低模型线程优先级,避免占用 CPU 资源导致客户端卡顿,满足跨平台能力优化需求。
-
跨平台办公场景功能
- 文档摘要:解析飞书文档格式(.feishu),调用端侧 LLaMA-3 生成结构化摘要,支持 Windows/MacOS/Linux 三端同步;
- 会议纪要:通过 Whisper-Tiny 实时转写麦克风音频,结合大模型自动提取 “待办事项 + 责任人 + 时间节点”,生成飞书表格格式纪要。
-
性能优化(字节核心关注)
- 启动速度优化:将模型权重拆分为 “核心层 + 扩展层”,启动时仅加载核心层(1.2GB),启动时间从 15s 压缩至 3s;
- 内存管控:用 C++ 实现 “模型权重内存池”,闲置时释放未使用权重,内存占用峰值降低 40%
能力亮点
- 直接练手飞书岗位要求的 C++ 跨平台开发、系统级调试工具(Xperf/Instruments);
- 落地 “端侧大模型” 热门技术,契合飞书 “跨平台框架创新” 的需求;
- 产出可量化的性能优化成果(启动速度、内存占用),匹配字节 “闭环意识 + 技术追求” 的岗位特质。
更多推荐


所有评论(0)