话题AI产品 › Kimi

AI产品:Kimi

Kimi K3, explained: how forgetting made the biggest open model possible

Kimi K3通过混合注意力机制(KDA与MLA)解决长上下文内存瓶颈,用固定大小的状态替换不断增长的KV缓存,实现2.8万亿参数下高效推理。其设计证明,选择性遗忘能让超大模型在长任务中保持性能与成本优势。

22580: From GPT2 to Kimi3, Explained

从GPT-2到KimiK3,模型规模增长22,580倍,但核心变化并非仅靠缩放。架构演进聚焦于状态存储与更新:线性注意力、DeltaNet、Gated DeltaNet、KDA与Kimi Linear逐步优化记忆与检索,最终KimiK3融合恒态记忆、软注意力、稀疏专家与深度残差访问,实现高效信息处理。

How to build a day-0 API for Kimi K3

基于Kimi K3发布日,我们构建了零日API,通过逆向工程和快速迭代,在模型上线当天就实现了稳定调用。核心是抓取请求、模拟签名、处理并发限流,最终让开发者能第一时间接入新模型。

You Don't Know LLM Training: Principles, Pipelines, and New Practices

2026年,大模型的能力差距不再仅依赖预训练,而是更多地体现在后训练阶段。预训练奠定基础,后训练通过指令微调、奖励设计、评估优化等环节,显著提升用户体验。数据配方、系统约束和训练管道设计是关键,模型的能力增强源于整个训练栈的协同优化,而非单一因素。

How Kimi, Cursor, and Chroma Train Agentic Models with RL

Moonshot AI的Kimi K2.5通过强化学习实现任务并行分解,优化多代理协作;Cursor的Composer 2采用自总结和实时RL提升长代码任务处理能力;Chroma的Context-1则专注于自编辑上下文,动态剪枝无关文档以提升搜索效率。三者在RL应用上均注重基础模型、生产环境训练、结果导向奖励和大规模并行扩展,展示了垂直领域模型的高效性与实用性。

"将注意力旋转90°":深入浅出解读 Kimi 最新出圈成果

【AI圈炸锅!17岁中国高中生破解Transformer祖传难题】Kimi团队提出"注意力残差"新机制,将注意力旋转90°应用在深度轴上,解决标准残差中信息逐层稀释的痛点。通过动态加权深层特征,模型处理复杂任务的能力显著提升,连马斯克都直呼"惊艳"!分块注意力方案更在效果与开销间取得完美平衡,或开启深度学习2.0新时代。论文已引爆全球AI大佬集体围观~

Kimi-Researcher End-to-End RL Training for Emerging Agentic Capabilities

Kimi研究员展现两大亮点:面对信息冲突时,能通过假设迭代实现自我纠偏,如在《聊斋·绿衣女》中精准核验书生对话次数;回答看似简单的问题也保持严谨,通过多轮交叉验证确认委内瑞拉球星胡安·阿朗戈的德甲经历。这波操作秀出了AI的深度检索与逻辑校验能力!

在DeepSeek阴影(或启发)下:OpenAI o1、Kimi 1.5、Qwen 2.5技术路线解读

大语言模型技术不断进步,OpenAI o1通过自我反思和错误修正提升推理能力,可能融合了CoT、PRM和MCTS;Kimi 1.5结合长上下文CoT和强化学习,展现了深入推理的潜力;Qwen 2.5则注重数据质量和多规模模型,配合离线与在线强化学习进一步提升性能。这些模型在推理、长文本处理和强化学习方面各有创新,推动了大语言模型的发展。

豆包、kimi 这些大模型系统提示词里写了啥?(一)

大模型系统提示词全解析(Prompt合集)。

  • «
  • 1
  • »

trang chủ - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-08-01 11:23
浙ICP备14020137号-1 $bản đồ khách truy cập$