- 使用 Ollama 和 Continue 扩展实现私有 AI 环境。
- 使用 Qwen2.5-Coder 等专用模型来平衡聊天能力和自动完成速度。
- 云端解决方案生态系统与本地服务器数据主权的比较。
如今,几乎所有程序员都尝试过一些人工智能工具来辅助工作。像 GitHub Copilot 或 Cursor 这样的解决方案非常出色,因为它们能在瞬间给出整段代码的建议。然而,也存在一些问题。 我们不能忽视的重要细节要使这些工具正常工作,您的代码通常会传输到外部服务器,如果您从事机密项目或受严格的隐私协议约束,这可能会造成严重问题。
好消息是,你不再需要出卖灵魂给魔鬼,也不需要每月支付订阅费就能拥有一个强大的助手。现在,搭建一个这样的助手完全可行。 自动补全系统和私聊 我们将使用开源模型、一块不错的显卡和一些免费工具,来了解如何建立一个完全依赖于您自己的硬件的工作流程。
副驾驶与地方模式的主权
如果将 GitHub 的服务与自定义解决方案进行比较,主要区别在于控制权。而 Copilot 则…… 安装极其简便 即用型软件意味着您的数据会离开本地网络,如果您不是学生或不维护开源项目,则需要付费。另一方面,本地堆栈为您提供…… 对模型拥有绝对控制权 并完全保障您的代码隐私。
然而,我们不要自欺欺人:搭建自己的服务器并不意味着一切都是免费的。你必须考虑到…… 组件的初始成本 以及GPU满负荷运行时的功耗。我们并不打算完全复刻微软企业版的所有功能,而是着重介绍…… 开发人员的日常生活 信息不会离开公司或家庭基础设施。
技术架构和基本要求
这个过程相当线性且合乎逻辑。基本上,VS Code 负责收集代码上下文并将其发送到 继续扩展后者充当沟通的桥梁或中间人。 奥拉马它是负责在您自己的机器上运行专用编程语言模型的引擎。
为确保顺利运行,您需要安装 Visual Studio Code 和运行 Ollama 的服务器。强烈建议您拥有…… 具有足够 VRAM 的现代 GPU 并且还有大约 10 到 15 GB 的可用磁盘空间。最重要的是, 无需注册 在任何平台上或创建可疑账户。
分步指南:安装和型号
为了达到最佳性能,诀窍在于不要对所有事情都使用单一模型。理想情况下, 单独的聊天任务 自动补全功能。对于深入分析和聊天,我们可以使用 qwen2.5-coder:7b 甚至 14b 版本 如果显存超过 12 GB,这些模型的运行速度会变慢,但智能程度会更高。
对于自动补全功能(也就是你输入时弹出的信息),我们需要的是即时响应。这就是它的作用所在。 qwen2.5-coder:1.5b由于它更轻量级,因此可以保证建议流畅无延迟。使用命令下载后即可使用。 ollama pull我们可以通过运行一个简单的命令来验证它们是否正常运行。 ollama list 在终端。
如果你的 Ollama 服务器与你的编程机器不在同一台机器上,请记住,默认情况下它只监听本地主机。要解决这个问题,你需要使用 [方法/方法] 编辑 Ubuntu 中的服务配置。 sudo systemctl edit ollama 并添加环境变量 OLLAMA_HOST=0.0.0.0:11434重启服务后,请使用 curl 命令从您的电脑检查连接,以确保防火墙没有阻止连接。
在 Visual Studio Code 中继续设置
Continue 可能是连接本地模型最强大的扩展程序。只需在扩展程序市场中搜索并安装它,然后重启编辑器。图标出现在侧边栏后,您需要前往…… 本地配置并编辑 config.yaml 文件 告诉你我们的人工智能服务器的具体位置。
在这个文件中,我们需要定义模型。对于聊天功能,我们配置模型 14B 并为其赋予一个 特定系统消息 为了简化操作,避免不必要的解释,我们为自动完成功能指定了 1.5B 模型。保存更改后,VS Code 现在每次编写代码时都知道该向哪个模型查询。
测试本地助手
为了验证一切是否近乎完美,最好使用包含常见错误的脚本:未初始化的变量、旧的字符串连接或拼写错误。选中代码并按下 Ctrl + L.较大的模型会分析选择结果并提出改进建议。最简单的方法是使用按钮。 申请替换旧代码 无需手动复制粘贴即可创建新文件。
至于自动补全功能,只需开始输入新的函数即可。稍等片刻,您就会看到…… 灰色阴影文本 它会提示剩余的逻辑。如果提示正确,只需按 Tab 键即可。如果发现程序没有响应,一个快速的解决方法是从开发者命令面板重启扩展宿主程序。
其他替代方案和人工智能生态系统
如果出于某种原因,Ollama 的路线不合您的心意,市面上还有其他选择。亚马逊也有自己的路线。 暗语者它功能非常强大,尤其适用于 Java 和 Python。对于那些寻求更注重社区参与的开发者来说, 斯塔克船长 它很奇特,因为它使用 StackOverflow 的搜索结果,而不是纯粹的神经网络。
我们还有一些工具,例如 风筝非常专注于 JupyterLab,或者 谷歌的AlphaCode专为竞技编程而设计。还有像 Clara Copilot 这样更简单的选择。然而,它们都无法提供…… 隐私和个性化 这样,您就可以在自己的 GPU 上运行 Continue 和 Ollamama 组合程序。
合理的期望和表现
重要的是不要被乐观情绪冲昏头脑,要明白7亿或14亿的模型并不能在极其复杂的架构任务中撼动云巨头的地位。此外, 巨型存储库的索引 它初期可能会占用大量内存。最终画质始终取决于显卡的性能。
如果你拥有一块配备 12GB 显存的 RTX 3060 显卡,体验会非常好。但如果你升级到一块…… RTX 4090 24GB性能变得专业化,聊天响应几乎是即时的。无论如何,对于日常开发、生成单元测试和文档, 这个方案极具竞争力。.
分析了所有选项后,我们显然可以从订阅服务转向一个由我们掌控的环境。无论是使用 Qwen 模型配置 Ollama 以实现完全隐私,还是尝试 CodeWhisperer 等工具,人工智能都已成为程序员的得力助手。归根结底,重要的是找到合适的平衡点。 性能、成本和数据安全 使工作流程尽可能顺畅。
