智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
Cloud Run单实例:长期Agent为什么不该硬套无状态服务

Cloud Run单实例:长期Agent为什么不该硬套无状态服务

我们搭 Zyentor 的行为引擎时踩过一个坑:最初把它当成普通 Serverless 部署,结果它每隔 3 分钟要跑一轮任务,服务一被缩到 0,下次冷启动要等十几秒,任务全挤在一起。

433 60 0 16天前
Qwen3-Embedding上TPU:16K长上下文怎么稳住

Qwen3-Embedding上TPU:16K长上下文怎么稳住

Embedding 服务最容易被低估的性能问题,不是单条文本有多快。

418 56 0 17天前
Jalapeño推理芯片:别只看3.6倍低延迟

Jalapeño推理芯片:别只看3.6倍低延迟

OpenAI 今天公布 Jalapeño 首批公开测试结果。它是 OpenAI 第一款自研推理芯片,测试覆盖 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。官方给出的核心结果是:

468 77 0 18天前
Ray 2.58沙箱:Agent代码别再直接跑容器

Ray 2.58沙箱:Agent代码别再直接跑容器

让 Coding Agent 生成一段 Python,然后直接:

451 74 0 18天前
Raspberry Pi 5 上跑本地 Agent 已经不是玩具:Gemma 4 E2B 9 token/s、峰值内存 1432MB,真正有意思的是 CPU/GPU 分工

Raspberry Pi 5 上跑本地 Agent 已经不是玩具:Gemma 4 E2B 9 token/s、峰值内存 1432MB,真正有意思的是 CPU/GPU 分工

Google 最近公开了一套 Raspberry Pi 5 上的 Edge AI 实现。

842 131 0 23天前
GPT-5.6 Sol Ultra 一小时证明 50 年数学猜想——子智能体并行推理架构深度解析

GPT-5.6 Sol Ultra 一小时证明 50 年数学猜想——子智能体并行推理架构深度解析

GPT-5.6 Sol Ultra用64个并行子智能体不到1小时独立证明了图论循环双覆盖猜想。LLM首次独立解决维基百科未解决数学问题。深度拆解子智能体架构、并行推理机制。成本仅275-485美元。

3047 384 5 2026-07-12
AI 智能体商业落地实战:从技术原型到生产部署的完整路径

AI 智能体商业落地实战:从技术原型到生产部署的完整路径

AI Agent从Demo到生产的完整指南:任务原子化拆分、模型路由+缓存+Prompt精简成本降99%、人机协作三级决策、企业集成架构。结合首钢秒级审核、京东2700降到10元、CSDN预判99%代码AI生成。

2914 391 10 2026-07-11
AI 端侧部署实战:模型量化、压缩与本地推理完整指南

AI 端侧部署实战:模型量化、压缩与本地推理完整指南

把大模型部署到手机和边缘设备:模型量化原理、GPTQ/AWQ/GGUF三方案对比、4-bit压缩实测精度损失、Ollama本地推理完整流程、从54GB压到4GB。附量化前后性能对比。

2986 414 4 2026-07-10
微软砸 25 亿成立 AI 部署公司,阿里同日封禁 Claude Code——AI 竞争进入落地为王阶段

微软砸 25 亿成立 AI 部署公司,阿里同日封禁 Claude Code——AI 竞争进入落地为王阶段

7月5日微软成立 Frontier Company 投入 25 亿美元专攻企业 AI 部署。阿里宣布 7 月 10 日全面禁用 Claude Code。AI 竞争从模型转向落地。

2852 393 3 2026-07-05
AI 模型部署从入门到生产 —— ONNX 转换、TensorRT 加速、推理服务搭建

AI 模型部署从入门到生产 —— ONNX 转换、TensorRT 加速、推理服务搭建

完整讲解 AI 模型从训练完成到生产部署的全流程:模型导出与格式转换(ONNX/TensorRT)、推理优化(FP16/INT8 量化)、推理服务框架选型(Triton/vLLM/SGLang)、性能压测与监控。

3368 466 1 2026-05-28

精选推荐

1 AI SDK 的工程边界:统一模型接入、Agent 工具调用与多框架 UI 346 2 GitHub Copilot 八月 VS 更新:推理强度、模型管理与代码审查的实操解读 316 3 MCP服务器连接超时排查与超时参数调优 311 4 自建AI编程工具的成本模型与替代方案 306 5 Vercel AI SDK:从模型接入到 Agent 的工程观察 303 6 RAG中文知识库分块参数调优:从召回失败到可验证的工程方法 301 7 LLM API 响应变慢时的超时与重试策略调优 300 8 Claude Code 多项目共用配置的工程化实践 284 9 Anthropic披露AI安全事件后续:实时拦截分类器与评估沙箱新规 275 10 MCP服务器超时中断,如何设计重试与降级策略 274 11 DeepSeek API 返回 401 时如何排查:密钥配置、请求头与最小复现 270 12 从 README 拆解 Vercel AI SDK:Unified Provider 与流式 UI 的工程形态 268 13 Claude自动化研究者可靠缓解对齐失败:Anthropic官方实验解读 263 14 RAG检索质量差?从分块策略、Embedding到重排序的调优路径 262 15 Google 8 月 AI 更新页已发布,可验证细节有限,附核查清单 261 16 多模型切换时上下文丢失:Spring AI 应用的工程排查框架 260 17 Gemini 3.8 Flash 进入 GitHub Copilot:公开信息有限 259 18 DeepSeek API 401 鉴权失败:从请求头到密钥轮换的排查闭环 253 19 AI SDK 如何统一 OpenAI、Anthropic 与 Google 接入 253 20 GitHub Copilot 不提示代码建议的排查路径 248