WebLLM 本地大模型引擎

利用 WebGPU 技术,直接在您的浏览器显存中运行大语言模型(如 Llama 3, Qwen 2),断网可用,数据绝对隐私。

Workspace

WebLLM 本地大模型引擎

真正的“断网可用”!利用最新 WebGPU 技术,将开源大语言模型直接加载到您的浏览器显存中运行。
没有任何 API 费用,您的聊天记录和数据 100% 绝对不会离开您的设备。企业级机密信息的终极堡垒。

引擎配置

环境检测中...

正在检测 WebGPU 支持情况

首次运行需下载权重(通常 1~4GB),后续将缓存于浏览器。

Powered by MLC WebLLM & WebGPU

AI 本地会话

未启动

您的数据永远不会离开此设备

请先在左侧选择模型并启动引擎

生成的回答由浏览器本地运算得出,可能会包含错误或不当内容。

引擎未就绪

工具介绍

WebLLM 本地大语言模型引擎 是一款纯前端运行的 AI 引擎。利用最新的 WebGPU 技术和 MLC-LLM 编译的 WebAssembly,将数以 GB 计的大模型权重拉取到浏览器缓存中,并直接在您的独立显卡/集成显卡上进行推理。

核心优势

  • 断网可用:首次加载模型后,所有缓存均保存在浏览器 IndexedDB。拔掉网线,依然可以流畅对话。

  • 绝对隐私:您的任何问题、任何聊天记录,都只在当前设备的内存中处理,没有任何数据被上传至云端。完全杜绝隐私泄露风险,特别适合企业内部机密代码或文件的分析。

  • 零 API 费用:不需要配置任何 API Key,因为算力全部由您的电脑提供。


支持的模型

目前默认提供以下顶尖开源量化模型:

  1. Qwen2.5-1.5B (通义千问):阿里开源的轻量级模型,中文表现极佳,1.5B 的体量运行飞快。

  2. Llama-3.2-1B:Meta 发布的最新小模型,推理速度快,适合英文及编程问答。

  3. Llama-3.1-8B:性能强大,但需要约 6GB 以上的显存,建议独立显卡用户尝试。


使用前须知

硬件要求:由于模型运算非常消耗资源,建议您的设备配备独立显卡(如 RTX/GTX 系列、Apple M1/M2/M3 系列)。

WebGPU 支持:请使用最新版的 Chrome、Edge 或 Safari 浏览器,Firefox 目前可能需要手动在 about:config 中开启 WebGPU。

讨论 0

请 登录 后参与讨论

暂无评论,成为第一个分享观点的人吧。