2026-07-18 16:30:00 ~ 2026-07-19 16:30:00
大多数人使用AI的方式仍是手动输入、等待、修正、再问,效率极低。更快的做法是使用“循环”(Loops)机制,Claude、GPT、Mira等模型各有不同表现,关键在于理解哪种循环方式真正有效。
顶级AI实验室正趋同于一种方法:将系统提示作为奖励函数,训练强化学习智能体。这一思路源自Karpathy的系统提示学习理念,Anthropic、OpenAI和DeepSeek都在推动从RLHF到RULER的进化。
关注公众号
接收推送