Cloud Run单实例:长期Agent为什么不该硬套无状态服务
我们搭 Zyentor 的行为引擎时踩过一个坑:最初把它当成普通 Serverless 部署,结果它每隔 3 分钟要跑一轮任务,服务一被缩到 0,下次冷启动要等十几秒,任务全挤在一起。
Qwen3-Embedding上TPU:16K长上下文怎么稳住
Embedding 服务最容易被低估的性能问题,不是单条文本有多快。
Jalapeño推理芯片:别只看3.6倍低延迟
OpenAI 今天公布 Jalapeño 首批公开测试结果。它是 OpenAI 第一款自研推理芯片,测试覆盖 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。官方给出的核心结果是:
Ray 2.58沙箱:Agent代码别再直接跑容器
让 Coding Agent 生成一段 Python,然后直接:
Raspberry Pi 5 上跑本地 Agent 已经不是玩具:Gemma 4 E2B 9 token/s、峰值内存 1432MB,真正有意思的是 CPU/GPU 分工
Google 最近公开了一套 Raspberry Pi 5 上的 Edge AI 实现。
GPT-5.6 Sol Ultra 一小时证明 50 年数学猜想——子智能体并行推理架构深度解析
GPT-5.6 Sol Ultra用64个并行子智能体不到1小时独立证明了图论循环双覆盖猜想。LLM首次独立解决维基百科未解决数学问题。深度拆解子智能体架构、并行推理机制。成本仅275-485美元。
AI 智能体商业落地实战:从技术原型到生产部署的完整路径
AI Agent从Demo到生产的完整指南:任务原子化拆分、模型路由+缓存+Prompt精简成本降99%、人机协作三级决策、企业集成架构。结合首钢秒级审核、京东2700降到10元、CSDN预判99%代码AI生成。
AI 端侧部署实战:模型量化、压缩与本地推理完整指南
把大模型部署到手机和边缘设备:模型量化原理、GPTQ/AWQ/GGUF三方案对比、4-bit压缩实测精度损失、Ollama本地推理完整流程、从54GB压到4GB。附量化前后性能对比。
微软砸 25 亿成立 AI 部署公司,阿里同日封禁 Claude Code——AI 竞争进入落地为王阶段
7月5日微软成立 Frontier Company 投入 25 亿美元专攻企业 AI 部署。阿里宣布 7 月 10 日全面禁用 Claude Code。AI 竞争从模型转向落地。
AI 模型部署从入门到生产 —— ONNX 转换、TensorRT 加速、推理服务搭建
完整讲解 AI 模型从训练完成到生产部署的全流程:模型导出与格式转换(ONNX/TensorRT)、推理优化(FP16/INT8 量化)、推理服务框架选型(Triton/vLLM/SGLang)、性能压测与监控。