Workspace
WebLLM 本地大模型引擎
真正的“断网可用”!利用最新 WebGPU 技术,将开源大语言模型直接加载到您的浏览器显存中运行。
没有任何 API 费用,您的聊天记录和数据 100% 绝对不会离开您的设备。企业级机密信息的终极堡垒。
引擎配置
环境检测中...
正在检测 WebGPU 支持情况
首次运行需下载权重(通常 1~4GB),后续将缓存于浏览器。
Downloading...
0%
取决于您的网速,大文件可能需要几分钟。
请勿关闭当前页面。
Powered by MLC WebLLM & WebGPU
AI 本地会话
未启动
生成的回答由浏览器本地运算得出,可能会包含错误或不当内容。
引擎未就绪
工具介绍
WebLLM 本地大语言模型引擎 是一款纯前端运行的 AI 引擎。利用最新的 WebGPU 技术和 MLC-LLM 编译的 WebAssembly,将数以 GB 计的大模型权重拉取到浏览器缓存中,并直接在您的独立显卡/集成显卡上进行推理。
核心优势
- 断网可用:首次加载模型后,所有缓存均保存在浏览器 IndexedDB。拔掉网线,依然可以流畅对话。
- 绝对隐私:您的任何问题、任何聊天记录,都只在当前设备的内存中处理,没有任何数据被上传至云端。完全杜绝隐私泄露风险,特别适合企业内部机密代码或文件的分析。
- 零 API 费用:不需要配置任何 API Key,因为算力全部由您的电脑提供。
支持的模型
目前默认提供以下顶尖开源量化模型:
- Qwen2.5-1.5B (通义千问):阿里开源的轻量级模型,中文表现极佳,1.5B 的体量运行飞快。
- Llama-3.2-1B:Meta 发布的最新小模型,推理速度快,适合英文及编程问答。
- Llama-3.1-8B:性能强大,但需要约 6GB 以上的显存,建议独立显卡用户尝试。
使用前须知
硬件要求:由于模型运算非常消耗资源,建议您的设备配备独立显卡(如 RTX/GTX 系列、Apple M1/M2/M3 系列)。
WebGPU 支持:请使用最新版的 Chrome、Edge 或 Safari 浏览器,Firefox 目前可能需要手动在 about:config 中开启 WebGPU。
信息
- 发布日期
- 2026-07-24
- 最近更新
- 2026-10-11
- 状态
- Normal