昊梵体育网

财娃爱看科技的文章

真神 GPT6-Luna现世!

真神 GPT6-Luna现世!

真神 GPT6-Luna现世!
速看!AI 测试全绿正在快速贬值!

速看!AI 测试全绿正在快速贬值!

速看!AI 测试全绿正在快速贬值!
速蹬,9月22号 Codex 重置预告

速蹬,9月22号 Codex 重置预告

速蹬,9月22号 Codex 重置预告
Jev 可能压根不是什么“新一代大模型”。

Jev 可能压根不是什么“新一代大模型”。

Jev 可能压根不是什么“新一代大模型”。
别再拿 GPT-5.6 写 if 了,Agent 真没这么富 😂
	
很多 Agent 每一步都叫一次大模型:
	
“用户这句话,是退款、查物流、投诉,还是找人工?”
	
这种活让 GPT 深度思考,多少有点像:
请诸葛亮过来判断红绿灯。
	
Jev 干的就是这种“模糊 if”。
	
比如用户说:
“东西晚了三天,我已经不想要了。”
	
直接丢给 Jev:
	
Choice:
A. 查物流
B. 退款
C. 投诉
D. 转人工
	
返回:
退款 0.91
投诉 0.06
物流 0.02
人工 0.01
	
代码直接:
	
0.9 → 调退款 Skill
0.7~0.9 → 再让 LLM 判断
<0.7 → 转人工
	
阈值你自己定。
	
重点来了:
	
Jev 不写小作文,不输出 reasoning,
只负责回答一个问题:
	
“现在该走哪条路?”
	
输入目前只要 $0.042 / 百万 token,输出还不要钱。
	
以后 Agent 的合理分工可能是:
	
确定规则 → 代...

别再拿 GPT-5.6 写 if 了,Agent 真没这么富 😂 很多 Agent 每一步都叫一次大模型: “用户这句话,是退款、查物流、投诉,还是找人工?” 这种活让 GPT 深度思考,多少有点像: 请诸葛亮过来判断红绿灯。 Jev 干的就是这种“模糊 if”。 比如用户说: “东西晚了三天,我已经不想要了。” 直接丢给 Jev: Choice: A. 查物流 B. 退款 C. 投诉 D. 转人工 返回: 退款 0.91 投诉 0.06 物流 0.02 人工 0.01 代码直接: 0.9 → 调退款 Skill 0.7~0.9 → 再让 LLM 判断 <0.7 → 转人工 阈值你自己定。 重点来了: Jev 不写小作文,不输出 reasoning, 只负责回答一个问题: “现在该走哪条路?” 输入目前只要 $0.042 / 百万 token,输出还不要钱。 以后 Agent 的合理分工可能是: 确定规则 → 代...

别再拿 GPT-5.6 写 if 了,Agent 真没这么富 😂 很多 Agent 每一步都叫一次大模型: “用户这句话,是退款、查物流、投诉,还是找人工?” 这种活让 GPT 深度思考,多少有点像: 请诸葛亮过来判断红绿灯。 Jev 干的就是这种“模糊 if”。 比如用户说: “东西晚了三天,我已经不想要了。” 直接丢给 Jev: Choice: A. 查物流 B. 退款 C. 投诉 D. 转人工 返回: 退款 0.91 投诉 0.06 物流 0.02 人工 0.01 代码直接: 0.9 → 调退款 Skill 0.7~0.9 → 再让 LLM 判断 <0.7 → 转人工 阈值你自己定。 重点来了: Jev 不写小作文,不输出 reasoning, 只负责回答一个问题: “现在该走哪条路?” 输入目前只要 $0.042 / 百万 token,输出还不要钱。 以后 Agent 的合理分工可能是: 确定规则 → 代...
ds 4.1 flash 的几个隐藏小知识点

ds 4.1 flash 的几个隐藏小知识点

ds 4.1 flash 的几个隐藏小知识点
最近有一个很诡异的苗头

最近有一个很诡异的苗头

最近有一个很诡异的苗头
Claude大杀器!让你知道plugin是否有用!

Claude大杀器!让你知道plugin是否有用!

Claude大杀器!让你知道plugin是否有用!
claude code在opus4.8后不断翻车到现在,各种偷调参数、蒸馏他人、降智的传闻甚嚣尘上
	
codex 本来以一骑绝尘的harness desktop以及义父重置大法遥遥领先,但近期也深陷额度黑洞丑闻,同时老模型降智似乎成了公开的秘密
	
cursor则和gpt分道扬镳。让人猝不及防,引入kimi作为替代又是个什么鬼
	
国产三小强,各有各的不堪黑历史。加上最近Anthropic爆料出来的信息过于炸裂,让人实在不敢放心梭哈
	
qwen的灵魂人物离职,天天搞什么各种尺寸的开源模型,有个啥用
	
混元大模型似乎在尧舜禹的带领下,在workbuddy的加持下快速追上,但距离真正意义上的稳定第一梯队模型还带市场考验。workbuddy的考验其实还是低了一层,需要让这些coder实际过两招看看。
	
千万,千万不要让自己被绑定在某家模型或他们的harness上,我已经预见了目前在疯狂烧钱的巨头们,在未来落下镰刀,割下的,都是芸芸众韭菜的狗头…
	
#我这行的AI路 #ai #大...

claude code在opus4.8后不断翻车到现在,各种偷调参数、蒸馏他人、降智的传闻甚嚣尘上 codex 本来以一骑绝尘的harness desktop以及义父重置大法遥遥领先,但近期也深陷额度黑洞丑闻,同时老模型降智似乎成了公开的秘密 cursor则和gpt分道扬镳。让人猝不及防,引入kimi作为替代又是个什么鬼 国产三小强,各有各的不堪黑历史。加上最近Anthropic爆料出来的信息过于炸裂,让人实在不敢放心梭哈 qwen的灵魂人物离职,天天搞什么各种尺寸的开源模型,有个啥用 混元大模型似乎在尧舜禹的带领下,在workbuddy的加持下快速追上,但距离真正意义上的稳定第一梯队模型还带市场考验。workbuddy的考验其实还是低了一层,需要让这些coder实际过两招看看。 千万,千万不要让自己被绑定在某家模型或他们的harness上,我已经预见了目前在疯狂烧钱的巨头们,在未来落下镰刀,割下的,都是芸芸众韭菜的狗头… #我这行的AI路 #ai #大...

claude code在opus4.8后不断翻车到现在,各种偷调参数、蒸馏他人、降智的传闻甚嚣尘上 codex 本来以一骑绝尘的harness desktop以及义父重置大法遥遥领先,但近期也深陷额度黑洞丑闻,同时老模型降智似乎成了公开的秘密 cursor则和gpt分道扬镳。让人猝不及防,引入kimi作为替代又是个什么鬼 国产三小强,各有各的不堪黑历史。加上最近Anthropic爆料出来的信息过于炸裂,让人实在不敢放心梭哈 qwen的灵魂人物离职,天天搞什么各种尺寸的开源模型,有个啥用 混元大模型似乎在尧舜禹的带领下,在workbuddy的加持下快速追上,但距离真正意义上的稳定第一梯队模型还带市场考验。workbuddy的考验其实还是低了一层,需要让这些coder实际过两招看看。 千万,千万不要让自己被绑定在某家模型或他们的harness上,我已经预见了目前在疯狂烧钱的巨头们,在未来落下镰刀,割下的,都是芸芸众韭菜的狗头… #我这行的AI路 #ai #大...
赶紧看过来!疑似Codex最新bug天坑!

赶紧看过来!疑似Codex最新bug天坑!

赶紧看过来!疑似Codex最新bug天坑!
Mini2S 对比 Mini2,多花钱到底值不值?

Mini2S 对比 Mini2,多花钱到底值不值?

Mini2S 对比 Mini2,多花钱到底值不值?
🔥必看!我们大概率就在AI生命降临前夜!

🔥必看!我们大概率就在AI生命降临前夜!

🔥必看!我们大概率就在AI生命降临前夜!
💥Anthropic最新研究!真正的灾难才开始

💥Anthropic最新研究!真正的灾难才开始

💥Anthropic最新研究!真正的灾难才开始
🔥AI答不了题?那就解决考官!

🔥AI答不了题?那就解决考官!

🔥AI答不了题?那就解决考官!
OpenAI用近1万个Agent挑战世纪难题,关键突破却来自另外一道题。
	
他们先让近100个Agent花约50小时,研究更简单但结构相近的Euler问题。
	
突破出现后,才把这个成果交给Navier–Stokes小组,同时将其他方向的Agent调过来。最终,整个任务约88小时完成。
	
这招比“让AI再想想”高明多了:
	
任务卡住时,不要让Agent原地重试、无限补上下文。先造一道保留核心结构的“跳板任务”,解决后再把可迁移的规律送回主任务。
	
我根据OpenAI公开流程,提炼了一段可直接使用的提示词。非官方原文:
	
【提示词开始】
	
你是多Agent研究协调器。针对【主任务】,不要立即反复求解,先执行“跳板任务”流程:
	
1. 提取主任务不可丢失的核心结构、关键约束和验收标准。
2. 构造2—3个更简单但结构相近的跳板任务,可缩小范围、减少变量、放宽单个约束或使用小规模样例。逐一说明:保留了什么、简化了什么、成果为何可能迁移、什么情况下不能迁移。
3. 将每个跳板...

OpenAI用近1万个Agent挑战世纪难题,关键突破却来自另外一道题。 他们先让近100个Agent花约50小时,研究更简单但结构相近的Euler问题。 突破出现后,才把这个成果交给Navier–Stokes小组,同时将其他方向的Agent调过来。最终,整个任务约88小时完成。 这招比“让AI再想想”高明多了: 任务卡住时,不要让Agent原地重试、无限补上下文。先造一道保留核心结构的“跳板任务”,解决后再把可迁移的规律送回主任务。 我根据OpenAI公开流程,提炼了一段可直接使用的提示词。非官方原文: 【提示词开始】 你是多Agent研究协调器。针对【主任务】,不要立即反复求解,先执行“跳板任务”流程: 1. 提取主任务不可丢失的核心结构、关键约束和验收标准。 2. 构造2—3个更简单但结构相近的跳板任务,可缩小范围、减少变量、放宽单个约束或使用小规模样例。逐一说明:保留了什么、简化了什么、成果为何可能迁移、什么情况下不能迁移。 3. 将每个跳板...

OpenAI用近1万个Agent挑战世纪难题,关键突破却来自另外一道题。 他们先让近100个Agent花约50小时,研究更简单但结构相近的Euler问题。 突破出现后,才把这个成果交给Navier–Stokes小组,同时将其他方向的Agent调过来。最终,整个任务约88小时完成。 这招比“让AI再想想”高明多了: 任务卡住时,不要让Agent原地重试、无限补上下文。先造一道保留核心结构的“跳板任务”,解决后再把可迁移的规律送回主任务。 我根据OpenAI公开流程,提炼了一段可直接使用的提示词。非官方原文: 【提示词开始】 你是多Agent研究协调器。针对【主任务】,不要立即反复求解,先执行“跳板任务”流程: 1. 提取主任务不可丢失的核心结构、关键约束和验收标准。 2. 构造2—3个更简单但结构相近的跳板任务,可缩小范围、减少变量、放宽单个约束或使用小规模样例。逐一说明:保留了什么、简化了什么、成果为何可能迁移、什么情况下不能迁移。 3. 将每个跳板...
🔥快别让你的AI 帮你生成AGENTS.md了!

🔥快别让你的AI 帮你生成AGENTS.md了!

🔥快别让你的AI 帮你生成AGENTS.md了!
世界可能真的是虚拟的

世界可能真的是虚拟的

世界可能真的是虚拟的
就在刚刚!Codex官方承认Astra真的变傻了!

就在刚刚!Codex官方承认Astra真的变傻了!

就在刚刚!Codex官方承认Astra真的变傻了!
🔥必看!Codex是如何定义一个任务的!

🔥必看!Codex是如何定义一个任务的!

🔥必看!Codex是如何定义一个任务的!
🔥 Codex 最大的额度刺客找到了!赶紧优化!

🔥 Codex 最大的额度刺客找到了!赶紧优化!

🔥 Codex 最大的额度刺客找到了!赶紧优化!