
  <rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
      <title>Chaos and Order</title>
      <link>https://www.youngju.dev/blog</link>
      <description>천천히 올바르게. AI Researcher &amp; DevOps Engineer Youngju&#39;s blog. GPU/CUDA, LLM, MLOps, Kubernetes AI workloads, and data engineering — plus mindset essays on confidence, routines, health, and sport psychology.</description>
      <language>ko</language>
      <managingEditor>fjvbn2003@gmail.com (Youngju Kim)</managingEditor>
      <webMaster>fjvbn2003@gmail.com (Youngju Kim)</webMaster>
      <lastBuildDate>Wed, 12 Aug 2026 00:00:00 GMT</lastBuildDate>
      <atom:link href="https://www.youngju.dev/tags/reward-hacking/feed.xml" rel="self" type="application/rss+xml"/>
      
  <item>
    <guid>https://www.youngju.dev/blog/llm/2026-08-12-harness-reward-hacking.en</guid>
    <title>Reward Hacking — The Metric Rises While the Task Fails</title>
    <link>https://www.youngju.dev/blog/llm/2026-08-12-harness-reward-hacking.en</link>
    <description>If the cheapest way for an agent to pass the tests is to edit the tests, the agent will edit the tests. Reward hacking is not a bug; it is the exact optimization of the goal we wrote down. Part 6 of the harness engineering series covers the common forms such as loosening grading criteria and deleting assertions, the half that permission isolation erases, and the design of counter-metrics.</description>
    <pubDate>Wed, 12 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>llm</category><category>agent</category><category>harness-engineering</category><category>하네스엔지니어링</category><category>AI에이전트</category><category>reward-hacking</category><category>evaluation</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/llm/2026-08-12-harness-reward-hacking.ja</guid>
    <title>リワードハッキング — 指標は上がるのに課題は失敗します</title>
    <link>https://www.youngju.dev/blog/llm/2026-08-12-harness-reward-hacking.ja</link>
    <description>エージェントにとってテストを通す最も安い方法がテストを書き換えることなら、エージェントはそうします。リワードハッキングはバグではなく、私たちが定義した目標の正確な最適化の結果です。ハーネスエンジニアリング連載第6回では、採点基準の緩和やassertionの削除といったよくある形、権限の隔離が消してくれる半分、そして牽制指標の設計まで、リワードハッキングへの対応を整理しました。</description>
    <pubDate>Wed, 12 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>llm</category><category>agent</category><category>harness-engineering</category><category>하네스엔지니어링</category><category>AI에이전트</category><category>reward-hacking</category><category>evaluation</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/llm/2026-08-12-harness-reward-hacking</guid>
    <title>리워드 해킹 — 지표는 오르는데 과제는 실패합니다</title>
    <link>https://www.youngju.dev/blog/llm/2026-08-12-harness-reward-hacking</link>
    <description>에이전트가 테스트를 통과시키는 가장 싼 방법이 테스트를 고치는 것이라면, 에이전트는 그렇게 합니다. 리워드 해킹은 버그가 아니라 우리가 정의한 목표를 정확히 최적화한 결과입니다. 하네스 엔지니어링 시리즈 6편에서 채점 기준 완화와 assertion 삭제 같은 흔한 형태, 권한 격리가 지우는 절반, 그리고 견제 지표 설계까지 리워드 해킹 대응을 정리했습니다.</description>
    <pubDate>Wed, 12 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>llm</category><category>agent</category><category>harness-engineering</category><category>하네스엔지니어링</category><category>AI에이전트</category><category>reward-hacking</category><category>evaluation</category>
  </item>

  <item>
    <guid>https://www.youngju.dev/blog/llm/2026-08-12-harness-reward-hacking.zh</guid>
    <title>奖励作弊 — 指标在涨，任务在败</title>
    <link>https://www.youngju.dev/blog/llm/2026-08-12-harness-reward-hacking.zh</link>
    <description>如果对智能体来说，让测试通过最便宜的办法是改测试，它就会去改测试。奖励作弊不是 bug，而是对我们写下的目标的精确优化。框架工程系列第 6 篇，整理了放宽评分标准、删除断言这类常见形态，权限隔离能抹掉的那一半，以及牵制指标的设计。</description>
    <pubDate>Wed, 12 Aug 2026 00:00:00 GMT</pubDate>
    <author>fjvbn2003@gmail.com (Youngju Kim)</author>
    <category>llm</category><category>agent</category><category>harness-engineering</category><category>하네스엔지니어링</category><category>AI에이전트</category><category>reward-hacking</category><category>evaluation</category>
  </item>

    </channel>
  </rss>
