知鸦日报2026-09-01

2026-08-31 16:30:00 ~ 2026-09-01 16:30:00

Tecnología

为什么 Text-to-SQL 总是停在 Demo?

摘要

Text-to-SQL从Demo走向生产,核心挑战不在SQL语法,而在业务理解。真实环境中,指标口径、对象定义、权限规则等需提前明确,否则查询结果可能正确但不符合预期。企业需要建立可复用的语义层,将业务判断前置,才能让自然语言查数稳定可靠。

shopify技术:Upgrading Checkout Blocks app to Polaris web components

摘要

Checkout Blocks将UI扩展从React+Remote UI迁移至Preact+remote-dom,并重写为TypeScript。核心挑战是满足64KB的gzip限制,通过替换liquidjs和dayjs等依赖达成。升级后,扩展包体积减少40-85%,加载速度提升,并修复了ID冲突等平台问题。

shopify技术:Building an agentic harness that outlasts the model

摘要

Shopify构建了一个持久化的安全扫描框架,通过分区扫描、测试预言机和跨模型验证,在大型Rails单体应用中高效发现并验证漏洞。该框架成本低、可迭代,比模型本身更具长期价值,已发现价值超40万美元的漏洞。

登录后可查看文章图片

shopify技术:Sidekick's continual learning loop

摘要

持续学习循环将生产经验压缩进模型权重,而非停留在提示词或工具定义中。通过定义质量、校准评判、自动研究改进基线,再用自我修复流水线将失败转化为训练信号,最终实现更小、更快、更便宜的模型超越前沿基线。

登录后可查看文章图片

shopify技术:How we raised mobile end-to-end test stability to 98%

摘要

Shopify移动端E2E测试曾因Appium框架导致50%的稳定性,被迫从CI中移除。通过重构为严格API并引入计算机视觉替代Test ID,测试稳定性提升至98%。新框架强制每一步都包含断言,并让测试编写更直观可靠。

登录后可查看文章图片

shopify技术:Gisting: Compressing LLM Agent context to ↑ throughput and ↓ cost

摘要

gisting技术通过知识蒸馏将长系统提示压缩为短提示符,大幅降低推理成本和GPU需求。在4:1压缩比下,请求延迟下降38%,吞吐量提升16%,GPU用量减少14%。该技术可无缝部署,并与前缀缓存和持续学习相结合,实现高效模型优化。

登录后可查看文章图片

dropbox技术:Testing cookie behavior across hundreds of web surfaces with our in-house auditor

摘要

我们构建了一个内部Cookie审计工具,模拟真实用户访问Dropbox网站,自动检查Cookie加载是否符合用户隐私偏好。它解决了手动测试效率低、网站动态变化难以跟踪的问题。通过自动化验证,我们确保隐私承诺在快速演变的Web系统中持续得到兑现。

lyft技术:Rerouting the Stream: How Lyft Moved to the Apache Flink Operator

摘要

微信如何训练多模态 Embedding 模型

摘要

微信团队开源了WeMM-Embedding多模态模型,支持文本、图片、视频等输入。训练分为两阶段:先用数亿异构数据统一对齐,再通过重采样、清洗、难负样本和知识蒸馏提升表示能力。模型已应用于视频号、公众号等搜索推荐场景,在A/B测试中取得持续收益。

Claude Code vs Codex 记忆体系深度对比

摘要

Claude Code与Codex代表两种AI Agent记忆哲学:前者以四层分层架构实现自动记忆、离线整理与跨会话经验接力,走自动化优先路线;后者以两层扁平架构坚持纯手动声明式契约,追求行为确定与审计可控。选择取决于你更看重自动积累还是可控可审计。

腾讯技术:UniTraj:面向商业推荐的跨域长序列建模

摘要

腾讯广告技术团队针对广告场景行为稀疏、序列异构的挑战,提出UniTraj跨域长序列建模方案。精排引入TIN模型及解耦属性、堆叠深层结构,粗排采用Target-aware SASRec。平台通过稀疏参数预取、GPU优化等实现性能零增长,在视频号、朋友圈分别提升GMV 4.22%和1.96%。

登录后可查看文章图片

从 Loop 到 Graph Engineering 的演进思考与实战

摘要

从Loop Engineering到Graph Engineering,本质是从单一指标优化转向多循环协同监管。单Loop易陷入过拟合、目标盲视等陷阱,而Graph通过“循环监督循环”的结构,引入锚点、冻结节点和外部判断,确保系统不跑偏,实现更自主、可靠的AI决策。

登录后可查看文章图片

删掉80%的Prompt规则,Agent交付成功率反而更高了

摘要

交付瓶颈不在代码,而在工程环境。核心是三条:可信上下文(让Agent读到正确信息)、可执行约束(让规则能真正拦住错误)、可恢复流程(让任务中断后能继续)。Harness应随真实任务生长,从观测到根因修复,而非预先搭建平台。

登录后可查看文章图片

zozo技术:Thompson Samplingのコールドスタート対策 ── 過去の実績データを事前分布に活かす

摘要

cloudflare技术:The Cloudflare Blog – Brought to you by EmDash

摘要

面向 Agent 沙箱的内核全景观测

摘要

滴滴HUATUO华佗项目在CCF中国开源大会上分享了面向Agent沙箱的内核全景观测方案。它利用eBPF技术实现零侵入观测,覆盖网络、I/O、CPU争抢及硬件故障,通过AutoTracing自动捕获异常毛刺,持续性能剖析保留现场,助力AI时代复杂问题的根因定位。

登录后可查看文章图片

DeepSeek Harness:重新设计 Agent 运行时

摘要

dsh通过PTC和创造模式,让模型能编排现有工具并动态新增能力,底层Cordis框架支持插件的热插拔与依赖协调。这套运行时骨架为自进化Agent铺路,但当前体验不如Claude Code成熟,更像设计思路而非成品。

登录后可查看文章图片


‹ 2026-08-31 日报 2026-09-02 日报 ›

qrcode

关注公众号
接收推送