検証: SKILL.md訓練ループ、最小構成で再現してみた
00:01:16 ・ source: https://zenn.dev/mskbhd/articles/lab-040-skill-mdstub
Transcript
hostenToday we verify: can we really treat skill optimization like a deep learning training loop?
guestja今日は、スキル最適化が深層学習の訓練ループと同じ構造かどうかを、実際に検証していきます。
hostenThe author created a minimal experiment: classify Japanese text as formal, casual, or neutral.
guestja著者は最小構成の実験を設計しました。日本語文を敬体・常体・混在の3つに分類するタスクです。
hostenWithout evaluation feedback, hand-written skills had zero impact; with it, one optimization loop achieved 2/3 to 3/3.
guestja評価なしのスキルは改善しませんでしたが、評価あり+LLM提案のループで、1周で2/3から3/3に改善されました。
hostenThe optimized SKILL.md contained a rule—'mixed polite and casual means neutral'—that humans never explicitly wrote.
guestja最適化後のスキルには「敬体と常体の混在はNEUTRAL」というルールが含まれていて、人間が書いたものにはありませんでした。
hostenThis proves the core insight: evaluation signals guide LLM agents to write specific, concrete skills from vague knowledge.
guestjaこれは、評価信号があってこそ、LLMエージェントが曖昧な知識から具体的なスキルを引き出せることを証明しました。