<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Sumitsuke Lab</title>
    <link>https://sumitsuke.jp/lab/</link>
    <atom:link href="https://sumitsuke.jp/rss.xml" rel="self" type="application/rss+xml" />
    <description>実際に作って、測って、確かめた記録。設計・検証・AI 活用について、結果が出なかった試みも含めて数字で残しています。</description>
    <language>ja</language>
    <item>
      <title>LLM に「もう一度見直して」は効くのか。正解つき 160 件で測ったら、初回が 159/160 で天井だった</title>
      <link>https://sumitsuke.jp/lab/llm-self-review-ceiling/</link>
      <guid isPermaLink="true">https://sumitsuke.jp/lab/llm-self-review-ceiling/</guid>
      <pubDate>Fri, 10 Jul 2026 15:00:00 GMT</pubDate>
      <description>同一人物判定 160 件（正解ラベルつき）で、初回判定・独立再実行・二段階レビューを比較。初回がほぼ満点で修正能力は測れず、再監査は 157/160 件で初回のまま。動かした 3 件はすべて改悪。評価セットの設計則 4 つ。</description>
    </item>
    <item>
      <title>「エッジで速い」はずの Cloudflare D1 が、日本から測ると東京の Turso に負けた。無料枠サーバレス DB 3 種の cold / warm 実測</title>
      <link>https://sumitsuke.jp/lab/serverless-db-cold-warm/</link>
      <guid isPermaLink="true">https://sumitsuke.jp/lab/serverless-db-cold-warm/</guid>
      <pubDate>Wed, 01 Jul 2026 15:00:00 GMT</pubDate>
      <description>D1 / Turso / Neon を日本（西日本）から叩き、cold・warm・接続・wake に分解して測った。warm 中央値は Turso 22ms / D1 60ms / Neon 87ms。Neon は 5 分で止まり、起き直しに約 1.2 秒。測り間違えた 5 件も開示。</description>
    </item>
    <item>
      <title>同じコードをローカル LLM に 51 回監査させたら、多数決は「正しさ」より「しつこさ」を選んでいた</title>
      <link>https://sumitsuke.jp/lab/llm-audit-51-runs/</link>
      <guid isPermaLink="true">https://sumitsuke.jp/lab/llm-audit-51-runs/</guid>
      <pubDate>Wed, 01 Jul 2026 15:00:00 GMT</pubDate>
      <description>欠陥を仕込んだ小コードを Qwen2.5-Coder 1.5B / 7B に 51 回レビューさせ、指摘がどれだけ一致するかを測った。温度 0 なら完全一致、温度 0.7 で崩れ、多数決は本物のバグを落とす。測定器自身のバグも含めた落とし穴 5 件。</description>
    </item>
    <item>
      <title>生成 AI のコードは「失敗を握り潰す」と思って 120 本測ったら、握り潰しは構文では判定できなかった</title>
      <link>https://sumitsuke.jp/lab/ai-code-silent-fallback/</link>
      <guid isPermaLink="true">https://sumitsuke.jp/lab/ai-code-silent-fallback/</guid>
      <pubDate>Tue, 30 Jun 2026 15:00:00 GMT</pubDate>
      <description>ローカル LLM に書かせた Python / TypeScript 120 本を静的解析で当てた実測。握り潰し候補 4 本は人手裁定で真陽性 0。同じ return None が正当にも欠陥にもなり、最後は人が意図を読むしかない。</description>
    </item>
  </channel>
</rss>
