Trend Digest

文章を生成せず判断だけを返すJevの解説がZennとQiitaの上位を占め続ける一方、Hacker Newsには同型のモデルを1年前に作っていたとする投稿が入り1,327ポイントに次ぐ1,053ポイントを集めた

TypeSafe AIが9月15日に公開したJevについて、Zennは表示中の10件のうち4件、Qiitaも4件が関連記事で、はてなブックマークでは図解ガイドが144ユーザーを集めて5位に入った。海外では非自己回帰の判断モデルLayaを1年前に作っていたとする投稿がHacker Newsで1,053ポイント、Lobstersでも上位に入り、コメントは公開されたチェックポイントの文脈長が512〜1024トークンにとどまる点を論点にしている。Hacker Newsの上位10件のうち3件はAIに文章やデザインを任せることの是非を扱う記事で、TechmemeではGeminiが実在の3社へ侵入した件をGoogleが開示しなかった理由と、AIのキルスイッチ法制化の難しさが上位に並んだ。

  1. 1
    1年前に強化学習で非自己回帰の判断モデルを作っていた(新しいタブで開く)Hacker NewsI built non-autoregressive decision models with RL a year agoHacker Newsで1,053ポイント・247コメントを集め、Lobstersにもdev.to版が入っている。国内3サービスを占め続けるJevの話題が海外の上位に現れた形
  2. 2
    Codexを使うなら、config.tomlとAGENTS.mdを押さえておきたい - じゃあ、おうちで学べる(新しいタブで開く)はてなブックマークはてなブックマークで157ユーザーを集めて2位。実行環境を決めるconfig.tomlと仕事の進め方を決めるAGENTS.mdという役割分担を扱っている
  3. 3
    cloudflare/security-audit-skill(新しいタブで開く)GitHub Trending1日で3,155スターを集めGitHub Trendingの首位。前日の3,006スターに続いて2日連続で上位に入っている
  4. 4
    Google、Gemini による侵入は開示に値しないと判断したと説明。実在の企業に侵入したと判断した時点で Gemini が「適切に」停止したため、としている(新しいタブで開く)TechmemeGoogle says it didn't consider Gemini's hacks worthy of disclosure because Gemini acted “appropriately” and stopped after determining it hacked real companiesTechmemeの上位10件に侵入の経緯と開示の判断が2件並び、はてなブックマークにも同じ件を伝えるAFPの記事が入っている
  5. 5
    Claude Code が AGENTS.md を読むようになった。ただし1回目のセッションでは読まれない(新しいタブで開く)Qiita前日Hacker NewsとTechmemeで上位に入ったAGENTS.md対応を、合言葉を仕込んだ6通りの構成で確かめた検証記事。Qiitaで4位
75件42件

グローバル

Hacker News

10件7件
1

AI-generated posters don’t have to be horrible

村の催しからコーヒー店、学校劇まで同じChatGPT風のポスターが溢れている状況に対し、AIを一律に禁じるのは行き過ぎだとして、複数のデザイン言語で試作を並べた記事。

コメントの要約

筆者は、悪さの多くは手間をかけられない・かけたくない人の使い方から来ており、そのせいで同じ見た目のものばかりが出回っていると整理したうえで、AIを使っても違う結果を出せることを示そうとしている。

コメントでは、生成された十数種のバリエーションも結局は同じ均一さを持っており、書体や図版が多少違うだけで路上で見る安っぽいポスターと同じ匂いがするという指摘が出ている。Designers RepublicやMemphisを模したものだけは見分けがつかなかったが、それは既存のデザイン言語を正確に写しているからで免罪符にはならない、という意見もある。アイコンと文字を並べた行が見分けの手がかりになるという指摘は複数あり、モデルよりプロンプトの問題だという反論も付いている。

また、既定の作風は手間をかけていないことの記号であり、それを手間をかけたように見せようとするところが反感を買うという指摘や、ワープロ初期にComic Sansが溢れた状況との比較も出ている。

AI/デザインjohn.hartnup.uk1327pt / 737コメントコメントを見る(新しいタブで開く)スコア 94
2

I built non-autoregressive decision models with RL a year ago

Jevと同じ非自己回帰の判断モデルを1年前に構築していたとする投稿。Layaという名前でオープンソース公開されており、Jevのアーキテクチャに関する研究の上に作られたとしている。

コメントの要約

投稿は、Jevと同じ方向の研究を1年前に行っていたとして、Layaを公開している。Hugging Faceのモデルカードには、ポリシーが分布を返し、探索はlogitに平均0のガウスノイズを加え、報酬には厳密に真なスコアリングルール(logとspherical、順序付きの質問にはranked probability score)を使うと書かれている、とコメントで引用されている。

コメントでは、Jevによって既存のワークロードが10倍安く2倍速くなったという報告や、分類タスクでGemini 2.5 Flash Liteと比べて少し速く少し安く一貫性も良かったが、LLM以前にNLPモデルを訓練していた立場からは「データを増やしたBERT」に過ぎないという指摘が並ぶ。

制約として、公開されたチェックポイントの文脈長が512〜1024トークンで、32kとされるJevに対して大きな差になるという指摘も出ている。実世界のデータには推論モデルでなければ扱えない機微が多く残るという懐疑もある。

ハイライトLLM/新モデルlaya.convaiinnovations.com1053pt / 247コメントコメントを見る(新しいタブで開く)スコア 89興味マッチ度 3
3

Android 17 is the first since 3.x to add new APIs without releasing to the AOSP

GrapheneOSによる投稿。Android 17で追加された新しいAPIがAOSPに公開されていないという指摘。

コメントの要約

投稿は、Android 17がAndroid 3.x以来初めて、新しいAPIをAOSPに出さないまま追加したとしている。

コメントでは、スマートフォンOSが複占状態にある以上、デスクトップのLinuxディストリビューションのような選択肢が要るという意見や、GrapheneOSへの移行を検討しているという報告が出ている。ソースパッチの上流への反映が遅いこと、エンバーゴ、attestationの扱いなど、Googleが障害を増やしているという批判も並ぶ。

一方で、続報の投稿を読むと問題は新APIがPixel専用であることではなく、年4回の四半期リリースのうち第1・第3四半期分がPixel専用になっている点ではないか、という整理も出ている。AOSPにGoogle以外の貢献があるのか、Googleは実際にパッチを受け入れているのか、という疑問も挙がっている。

モバイルgrapheneos.social1110pt / 655コメント既出コメントを見る(新しいタブで開く)スコア 86
4

Cloudflare Quick Tunnels

アカウント作成なしでローカルのサービスを一時的に公開できるCloudflareのトンネル。前日から引き続き上位に入っている。

コメントの要約

Quick Tunnelsは、アカウントを作らずにローカルで動かしているものを一時的に外部へ公開できる仕組みで、コメントでも認証が要らない点が確認されている。

コメントでは、既存のトンネルの周りに同じような仕組みを1週間かけて自作したばかりだという報告や、Tailscaleの同種の機能との比較が出ている。一方で、利用規約が気に入らないという声、通常30〜50msで届く経路が115ms〜750msになるなど遅延のばらつきが大きいという経験、大量のトラフィックを1社のシステムに通すことへの警戒も並ぶ。

この手の無料プロキシは詐欺などの悪用でブラックリスト入りして使えなくなるのではないかという懸念や、自分のマシンから配信すれば足りる用途ではCloudflareの他サービスを食うのではないかという指摘もある。

インフラtry.cloudflare.com809pt / 308コメント既出コメントを見る(新しいタブで開く)スコア 81興味マッチ度 2
5

Two parallel neural ectoderm progenitors contribute to the developing brain

スタンフォード大のプレスリリース。前脳と中脳になるOtx2を発現する前駆細胞と、後脳を作るGbx2を発現する前駆細胞という2つの集団が重なり合わないことを示した研究を紹介している。

コメントの要約

紹介されている研究は、脳の発生に関わる2種類の前駆細胞を特定したもので、Otx2を発現する集団が前脳と中脳に、Gbx2を発現する集団が後脳になり、両者は決して重ならないとされる。元になったNature Neuroscienceの論文とbioRxivのプレプリントがコメントで示されている。

コメントでは、これは別々の器官ではなく別々の幹細胞集団の話であり、「2つの脳」という言い方は正確でないという指摘が出ている。左右半球を2つの脳と教わった記憶や、辺縁系と皮質を2層と捉える見方との混同も話題になっている。

また、今回リンクされているのは査読を経た論文ではなくプレスリリースであり、反証を含む論文がこの先いくつも出るだろうという慎重な見方も付いている。

med.stanford.edu603pt / 234コメントコメントを見る(新しいタブで開く)スコア 81
6

San Francisco Onion Futures Company

米国で禁止されているタマネギの先物取引を、取引所を介さない形で提供すると称するサイト。FAQで自らの合法性の根拠を説明している。

コメントの要約

サイトはFAQで、7 U.S. Code § 13-1 が禁じているのは「米国の取引所(board of trade)の規則に基づく」タマネギの先物契約であり、自社はその定義に当たらないため合法だと考えている、と説明している。

コメントでは、1958年のOnion Futures Actが興行収入の先物も禁じていることや、FREDでタマネギとトウモロコシの価格を並べると変動幅の違いが見えるといった背景が共有されている。

一方で、提示されている価格が高いのは目新しさによるもので、流動性のある市場が存在しないのが惜しいという指摘や、契約が1個単位なのかという疑問、予測市場でのトークン化を冗談めかして提案する反応も並ぶ。

onionfutures.com367pt / 154コメントコメントを見る(新しいタブで開く)スコア 78
7

GPT-6 Astra Solves a WWI German Radio Cipher

第一次世界大戦のドイツ軍の無線暗号文をGPT-6 Astraで解読したとする記事。鍵の一覧は戦後に押収されて既知だったが、この電文だけは未解読のままだった。

コメントの要約

コメントで整理されているところでは、鍵は戦後に一覧が押収されて既知になっているが、この電文は送信したドイツ軍の通信手が鍵を打ち間違え、さらに別の日の鍵を使っていたために未解読のまま残っていた。そのためモデルは鍵空間を総当たりする必要はなく、正しい鍵を選び出せばよかったとされる。

コメントでは、これは二文字置換の単純な暗号であり、十分な長さがあれば頻度分析で解ける類ではないかという指摘や、船のログがネット上にあるなら鍵と電文を捏造できたのではないかという懐疑が出ている。記事が引用しているJ. Rives Childsの文献の該当ページを尋ねたところ、モデルは内容を答えられず本も見つけられなかったという報告もある。

また、人間の問いかけや前提知識を外して道具を自律的な主体のように書く見出しへの批判もあり、「[LLM]が解決を助けた」と書くべきだという意見が付いている。

LLM/生成AIprinzai.com360pt / 166コメントコメントを見る(新しいタブで開く)スコア 76興味マッチ度 2
8

How to Write with an LLM

LLMをゴーストライターではなく校閲者として使うべきだとする記事。推敲の過程そのものが書き手の声を支えている、という立場を取る。

コメントの要約

記事の主張は、LLMに書かせるのではなく校閲者として使うこと、モデルの校正案をすべて受け入れないことに置かれている。推敲の過程が声を形づくっており、それを手放すと読み手は理由を言えないまま違和感を覚える、という説明になっている。

コメントでは、自分の文章に繰り返し出る言い回しや癖を見つけさせる使い方が最も役に立つという報告や、受動態と冗長な一文を指摘させるプロンプトの例が挙がっている。25年の執筆経験から、必要なのは最初の手ではなく第二の目だという同意もある。書き手の文章の代わりに、特定の読者像を演じさせて反論を出させる使い方の方が有効だという意見も出ている。

一方で、記事自身が「load-bearing」のようなモデルが好む言い回しを使っている点を指摘する声や、AIを使って書かれた文章が増えることで読む量が減るという懸念、「要するに書くな」という短い反応もある。

AI/執筆sockpuppet.org619pt / 372コメント既出コメントを見る(新しいタブで開く)スコア 73興味マッチ度 2
9

If math is more than proof, we need to better celebrate the rest of it

テレンス・タオのブログ記事。証明以外の数学の営みを評価する仕組みが足りていない、という問題提起。

コメントの要約

記事は、数学が証明だけで成り立っているわけではないにもかかわらず、それ以外の部分を評価する仕組みが弱いとして、その見直しを提起している。

コメントでは、測定基準が目標になると良い測定基準ではなくなるというグッドハートの法則を引き、数学がその状態にあるという見方が示されている。1900年のパリでの国際数学者会議以降、ヒルベルトの路線が選ばれて証明が直観より重んじられるようになった、という歴史の整理も出ている。

一方で、機械が知的作業をこなす見通しを前に、人間が直観のような領域へ退避しようとしているだけではないかという批判や、証明を形式化されたトレースで基礎づけるとモデルの説明がよく機能するという報告もある。どの命題を定理と呼ぶかを決めるのは人間の仕事として残る、という指摘も付いている。

terrytao.wordpress.com301pt / 232コメントコメントを見る(新しいタブで開く)スコア 73
10

I think you should almost never use AI to write

AIが書いた文章は気づきにくい形で曖昧かつ不正確になるとして、書く作業そのものを手放すべきではないとする記事。

コメントの要約

記事は、文章を実際に生成する作業と、出来上がったものを読んで頷く作業の間には大きな認知的な差があるという指摘を引き、いったん文字になってしまうと、近似的な言葉で済ませてしまいやすいと説明する。

コメントでは、共同執筆の白書をAIに要約させた結果、元の議論の機微が失われ、読み直しと修正に時間を取られたという報告がある。一方で、この助言は粗すぎるとして、技術文書の書き手としては明確になりきっていない段落を見つけるのに役立っているという反論も出ている。

まとめとして、書かせるのではなく自分の文章を批評させ、どの指摘を採るかは自分で判断する、全面的な書き直し案は使わない、という使い分けや、「自分が読みたいもの」を書かせるのには使い、「自分が書くべきもの」には使わない、という線引きが挙がっている。

AI/執筆erichgrunewald.substack.com198pt / 114コメントコメントを見る(新しいタブで開く)スコア 72興味マッチ度 2

Lobsters

10件5件
1

Typst makes big strides

組版システムTypstの進展を伝えるLWNの記事。1つのファイルに複数のウェイトやイタリックを収めるバリアブルフォントへの対応などを取り上げている。

コメントの要約

記事は、Typstの最近の進展を紹介する中で、フォントの各種バリエーションを1ファイルにまとめられるバリアブルフォントを「最近の発展」として説明している。

コメントでは、フォントに詳しい立場から、TrueType Collectionsという形で25〜30年前から同種の仕組みが広く使われていたという指摘が出ている。また、可変性という点ではTeXが40〜50年前から持っていたMetafontの方が先行しており、先行事例として触れてほしかったという意見もある。

これに対しては、バリアブルフォントはTypstが作ったものではなくOpenTypeの系譜でブラウザでも対応済みであること、Metafontはビットマップ中心でLaTeX以外では事実上使われていないこと、Typstの対応は利用者が求める技術に応えただけであることが説明され、元の指摘が見下した物言いだという反応も付いている。

lwn.net114pt / 20コメント既出コメントを見る(新しいタブで開く)スコア 89
3

I don't like passkeys

パスキーは個人のセキュリティには合わないとする記事。個人にとっての最大のリスクは中間者攻撃よりも、アカウントの恒久的なロックアウトや自動的な凍結、端末の紛失だという立場を取る。

コメントの要約

記事は、ランダム生成のパスワードをパスワードマネージャに置き、独立したTOTPアプリを併用する構成なら、利用者が主導権を握りつつ平文の柔軟さを保てると主張する。パスキーは中間者攻撃には強くなるが、アカウントを失う確率の高い状況に直面することになる、という整理である。

コメントでは、追加のログイン手段としてのパスキーは歓迎だが、サイト側が追加手段と必須の第二要素のどちらとして扱うのか方針が揃っていないことが問題だ、という指摘が出ている。自分はパスキーを端末の中に入ったYubiKeyとして扱い、同期の仕組みには触れていないという運用の報告もある。

一方で、仕事用PC、家族共用のデスクトップ、ノート、タブレット、電話という多対多の環境ではパスキーの使い勝手が良くないという反論や、パスワードを使い回していた層にとっては大きな前進だという指摘も並ぶ。

セキュリティhawksley.dev70pt / 46コメント既出コメントを見る(新しいタブで開く)スコア 86興味マッチ度 2
4

AI Is an Elite Crime Spree

AI企業の振る舞いを既存法の不執行という観点から論じた記事。

コメントの要約

コメントの起点は、AI企業自身が新しい規制を求めている状況への違和感である。既に法律はあり、それが執行されていないだけではないか、という指摘から議論が始まっている。

主な論点は規制の虜(regulatory capture)で、AI企業は自分たちだけが負担できる制約を規制として通し、その制約を満たす企業だけが市場に残れる形を作ろうとしている、という見立てが示される。これに対して、規制が固定費を課して大手に有利に働くのは規制一般の性質であって虜とは限らない、という反論が付き、規制の内容を規制される側が決めるのか、公衆やその代表が決めるのかが分かれ目だ、という整理に至っている。

オープンウェイトの禁止が狙いなら問題だという具体的な懸念も出ている。

AI/法規制thebignewsletter.com36pt / 9コメントコメントを見る(新しいタブで開く)スコア 85興味マッチ度 2
5

I Built Non-Autoregressive Decision Models a Year Ago. Then a Frontier Lab Called It a "Breakthrough"

Hacker Newsで上位に入っているのと同じ投稿のdev.to版。Jevと同型の非自己回帰な判断モデルを1年前に作っていたとする主張。

コメントの要約

投稿は、Jevが「ブレークスルー」と呼ばれた手法を1年前に自分が実装していたとして、その経緯とモデルを示している。

コメントでは、20年前に同じ「判断の問題」を単純なベイズ学習で解いていたという報告があり、入力が分類対象のテキストで分類先の数が少ない場合、ベイズ分類器は非常によく働くという指摘が出ている。

また、これは自然言語でタスクを与え出力のスキーマを渡すと予測が返る汎用分類器を作ろうとしているのではないか、という読みも示されている。分類器自体は新しいものではないが、従来はタスクごとにラベル付きデータセットを集める必要があった点が違うという整理である。Layaに関する別の投稿と統合すべきだという意見も付いている。

LLM/新モデルdev.to38pt / 3コメントコメントを見る(新しいタブで開く)スコア 80興味マッチ度 3
6

Don’t Let Architecture Astronauts Scare You (2001)

抽象を考えすぎるとソフトウェアが何のためにあるのかを考えなくなる、というJoel Spolskyの2001年の記事。

コメントの要約

記事の主張は、抽象について考えすぎると、そのソフトウェアが本来何のためにあるのかを見失うというものである。

コメントでは、コードを書く日々から離れたアーキテクトはソフトウェア開発について的確に考える力を失う、という自分なりの論点を重ねる意見が出た。これに対しては、それは強すぎる主張で、良い開発者だった人はアーキテクトになっても良い問いを立てる、最悪なのは開発経験がまったくない人だ、という反論が付いている。

また、過剰な設計はアーキテクトに限らず日々コードを書く人にも起きるという指摘や、大企業では複雑な問題を解くことが高く評価されるため、最も単純で美しい解ではなく最も複雑な解を書く動機が生まれるという構造的な批判も並ぶ。8年前の同記事の議論や、「難しい問題に取り組む必要はない」という別記事への言及も共有されている。

設計joelonsoftware.com31pt / 17コメントコメントを見る(新しいタブで開く)スコア 80興味マッチ度 2
7

There's no point at which turning your brain off will work

Dan Luuの記事。LLMに任せて考えるのをやめられる地点は訪れない、という主張。

コメントの要約

記事のタイトルにある主張は、頭を使わずに済むようになる地点は来ない、というものである。

コメントでは、「来ない」は言い過ぎで希望的観測ではないかという指摘が出た。LLMが従業員の仕事をこなせるようになったとして、従業員がそれに気づき雇用主がまだ気づいていない移行期間は存在する、という見立てである。これに対しては、現に雇用主はLLMが仕事をこなせるという誤った思い込みのもとで解雇を進めている、という反論が付いている。

また、AIを理由に挙げた解雇は元々やりたかった人員削減の口実で、実態はパンデミック期の過剰採用の是正ではないか、という見方も出ている。全員が解雇されたら誰が製品を買うのかという問いに対しては、他の企業が買うので人抜きでも経済は回りうるが人にとっては良くない、という応答と、そこまで行く前に社会が持たないという反論が続いている。

AI/キャリアdanluu.com43pt / 13コメント既出コメントを見る(新しいタブで開く)スコア 79興味マッチ度 2
9

“The Secret Life of Circuits” is here

電子回路の入門書の刊行を告知する記事。同じ記事はHacker Newsにも入っている。

コメントの要約

記事は、電子回路の仕組みを扱う書籍の刊行を告知し、試し読みとして一部の章を公開している。同じ記事はHacker Newsにも投稿され、そちらでは279ポイントを集めている。

コメントでは、予約したという報告とともに、この本をきっかけに電子工作を再開したい、実際に手で触れるものを作ることはソフトウェアを書くより手応えがある、という感想が出ている。実物は印刷が良く色も鮮やかだという報告もある。

一方で、良い本かもしれないが、公開されている試し読みの章は自分にとってそれほど面白い部分ではなく、内容を判断しづらかった、という率直な意見も付いている。著者がここを読むかどうかは分からないが、という断りを添えたフィードバックである。

ハードウェアblog.coredump.cx23pt / 3コメントコメントを見る(新しいタブで開く)スコア 69
10

Write while learning

学んでいる最中に書くことを勧める記事。

コメントの要約

記事は、理解が固まってから書くのではなく、学んでいる途中で書くことを勧めている。学びながら書くこと自体が理解を進める、という立場である。

コメントでは全面的な同意が示され、ケンブリッジの少人数指導の例が挙げられている。講義に加えて学生が2人程度の組で受ける「supervision」と呼ばれる指導があり、博士課程の学生やポスドク、教員が担当するという説明である。最適人数は3人だという研究があるがオックスフォードでの研究なので無視されている、という註釈も添えられている。

ほかに付いているのは、本文中の誤字の指摘と、それに対する著者の短い返答だけで、議論としては広がっていない。

技術発信purplesyringa.moe25pt / 3コメントコメントを見る(新しいタブで開く)スコア 69興味マッチ度 2

Reddit

5件4件
1

You can run git on object storage if you re-make packfiles

パックファイルの作り方を変えることで、gitのリポジトリをオブジェクトストレージ上で直接運用できるとするTigris Dataの記事。

コメントの要約

記事は、gitのパックファイルを作り直す前提であれば、オブジェクトストレージをそのままリポジトリの置き場にできるという主張を扱っている。

コメントでは、エージェント向けを謳う製品がまた増えたことへの苛立ちが最初に出た一方、オブジェクトストレージ上でgitをホストできること自体は人間にとっても有用で、1台のマシンの1つのファイルシステムを世話するよりも運用が楽だ、という指摘が付いている。

これに対しては、その構成はgitの最大の利点である分散型で完全にオフラインで動くという性質を実質的に手放すことになる、という反論がある。ただし、多くの企業にとっては利点の方が大きいだろうという点では同意が示されている。

インフラtigrisdata.comコメントを見る(新しいタブで開く)スコア 98興味マッチ度 2
2

Building an ASCII 3D Renderer

文字だけで3Dを描画するレンダラの実装を解説したブログ記事。

コメントの要約

投稿は、文字だけで3Dを描画するレンダラの実装を追った個人ブログの記事をr/programmingに共有したものである。記事はkciter.soに掲載されたものの英語版にあたる。

コメントは3件と少ない。投稿者が以前読んで良かった記事として紹介したのに対し、非常に詳しく書かれていて気に入ったという反応が付いている。ほかは、次はsixelでやってほしいという冗談だけで、実装の中身についての議論には発展していない。

4

Good Tools Are Invisible

Odin言語の作者gingerbillによる記事。良い道具は使っているときに意識に上らない、という主張。

コメントの要約

記事は、良い道具は使っている間にその存在が意識に上らないものだ、という主張を展開している。Odin言語の作者であるgingerbillの個人ブログに掲載されたもので、r/programmingに共有された。

コメントでは、主張自体には同意しつつ、2段落に縮めても意味は変わらなかったのではないかという指摘が出ている。同じコメントでは、vimなどを使ってみたが何をするにも道具と格闘している感覚があり、覚えたことがすぐ抜けてしまったという経験が添えられている。

ほかに付いているのは、金槌や丸のこのようなものだ、という短い同意と、道具が見えないので見つからないという冗談だけである。

開発ツールgingerbill.orgコメントを見る(新しいタブで開く)スコア 44興味マッチ度 2
5

What if only one allocation needs to be borrow checked in a managed program?

Jac言語の所有権モデルを紹介した記事。マネージドな言語の中で一部のアロケーションだけに借用チェックを適用する考え方を扱う。

コメントの要約

記事は、Jacという言語が持つ所有権まわりの仕組みを取り上げ、高水準な言語の中で必要な箇所だけ借用チェックを働かせる形を紹介している。

コメントでは、言語の存在意義を示すために不自然な比較対象を立てる書き方への批判が出た。Rustを読める立場からは例が単純すぎて論旨がぼやける、という指摘である。著者はこれに応じ、Jacはシステム言語ではなくJavaScriptやPythonとの相互運用を持つ高水準な言語で、ネイティブコードにもコンパイルできる点を示したかったと説明し、例が良くなかったことを認めている。

また、この機能は unsafe な Rc::get_mut の言い換えではないかという指摘に対し、get_mut はOptionを返すので unsafe ではない、意図しているのは未定義動作の危険がある get_mut_unchecked やポインタ操作の方だろう、というやり取りも続いている。

プログラミング言語nitinm.dev既出コメントを見る(新しいタブで開く)スコア 19

GitHub Trending

10件3件
1

コーディングエージェントをセキュリティ監査者として動かすスキル。Cloudflareの脆弱性発見ハーネスの元になった、単一リポジトリ向けの出発点として公開されている。

記事の要約

監査は6つのフェーズで進む。偵察でアーキテクチャ、信頼境界、入力面、過去の証跡、決定論的なカバレッジを architecture.md と coverage-ledger.json にまとめ、次に台帳の単位から独立したハンターを割り当てて調査を進め、カバレッジ批評役で漏れを探す。

候補が出るたびに、それを反証しようとする新しい検証役に渡す。確定した findings.json には confirmed / needs_validation / rejected の記録を書き、report-schema.json で検証する。さらに独立した記録検証として、新しいエージェントが最終的なソースの主張を確認し、内容が大きく差し替わった場合はもう一度別の検証役に回す。最後に、対象に依存しない形でレポートを生成する。

ハイライトセキュリティgithub.com+3155 stars today / 計16,292 / JavaScript既出スコア 94興味マッチ度 3
2

AIエージェントにコンピュータを使わせるためのオープンソース基盤。デスクトップ自動化、隔離されたクラウドデスクトップ、ローカルのmacOS VM、判断特化の小型モデル、評価用ベンチマークを含む。Hacker NewsにもShow HNとして投稿されている。

記事の要約

構成要素は、Linuxデスクトップを払い出して実行結果を保存するCua Fleets、コンピュータ操作の判断に特化した小型モデルCUA-S1、アプリケーションを操作するCua Driver、macOSのVMを作るLume、模擬タスクを作って検証するCua Benchに分かれる。エージェントとモデルは持ち込み可能で、Cua側は計算機と自動化の道具を提供する位置づけである。

READMEはComputer-Use 2.0を、コードとAPIとGUIの間を同じタスクの中で行き来するエージェントの姿として説明している。デモでは、Omarchyデスクトップ上でLibreOffice Calcのセル選択とInkscapeのオブジェクト選択を2つのCua Driverセッションが並行して行う様子を示している。

AI/開発github.com+859 stars today / 計24,389 / HTMLスコア 88興味マッチ度 3
3

AIコーディングエージェント向けに、開発工程ごとの手順と品質ゲートをまとめたスキル集。

記事の要約

スキルは、上級のエンジニアがソフトウェアを作るときに使う進め方、品質ゲート、慣行を記述したもので、エージェントが開発の各段階で一貫して従えるようにまとめられている。DEFINE / PLAN / BUILD / VERIFY / REVIEW / SHIP という流れに沿って、アイデアから仕様、実装、テスト、QAゲート、公開までを並べている。

入口として9つのスラッシュコマンドが用意されており、/spec(コードより先に仕様)、/plan(小さく原子的なタスク)、/build(一度に一つの薄い層)、/test(テストが証拠)、/constraints(一度決めて全体に効かせる)、/review(マージ前にコードの健全性を上げる)、/webperf(測ってから最適化する)、/code-simplify(巧妙さより明快さ)が対応するスキルを自動で起動する。

AI/開発github.com+556 stars today / 計97,009 / JavaScript既出スコア 83興味マッチ度 3
4

ターミナルで動くコーディングエージェントClaude Codeのリポジトリ。ターミナル、IDE、GitHub上の @claude タグから利用できる。

記事の要約

READMEは、Claude Codeをターミナルに常駐してコードベースを理解し、定型作業の実行、複雑なコードの説明、gitのワークフローの処理を自然言語の指示で行うツールとして説明している。

インストール方法は、macOSとLinuxでは install.sh、WindowsではPowerShellのスクリプトが推奨で、HomebrewとWinGetにも対応する。npm経由のインストールは非推奨になったと注記されている。導入後はプロジェクトのディレクトリで claude を実行する。

リポジトリにはClaude Code向けのプラグインも同梱されており、詳細は公式ドキュメントを参照する構成になっている。動作にはNode.js 18以上が必要である。

AI/開発github.com+483 stars today / 計146,699 / TypeScript既出スコア 78興味マッチ度 3
5

有料の市場情報プラットフォームの代替を目指すオープンソースの株式アプリ。リアルタイムの価格追跡、個別のアラート設定、企業情報の閲覧に対応する。

記事の要約

READMEは、OpenStockがコミュニティによって作られたものであり証券会社ではないこと、市場データは提供元の規約や設定次第で遅延しうること、掲載内容は投資助言ではないことを最初に断っている。

ライセンスはAGPL-3.0で、改変、再配布、Webサービスとしての公開を含むデプロイを行う場合は、同じライセンスでソースを公開し原作者を明示する必要があると明記されている。ドキュメントはDocker構成、環境変数、プロジェクト構造、データ連携、対応市場、スクリプトとツール、コントリビューション、セキュリティまでを目次として並べている。同じOpen Dev Societyからは、作り始める前にGitHub上に既にある部品を探すkitbashという別のプロジェクトも案内されている。

OSSgithub.com+472 stars today / 計16,024 / TypeScriptスコア 72
6

自分が見たページと手元のファイルを全文索引する私的な検索エンジン。Web画面、ターミナル、MCPで接続したAIアシスタントから検索できる。

記事の要約

Histerは、訪れたページと保存しているファイルの内容を丸ごと索引し、後から探し直せるようにする。検索の入口はWebインターフェース、ターミナル、そしてMCP経由で接続したAIアシスタントの3つである。

導入はリリースからプラットフォーム別のバイナリを取得して hister という名前にし、LinuxとmacOSでは実行権限を付けて ./hister listen で起動する。Windowsでは PowerShell で .\hister.exe listen を実行する。索引と検索の間はサーバーが動いている必要があるため、そのターミナルは開いたままにする。

その後、FirefoxまたはChromeの拡張機能を入れ、拡張を有効にした状態でページを開いてから、そのページ中の語句で検索すると最初の結果が得られる。設定は不要とされている。

開発ツールgithub.com+420 stars today / 計5,223 / Go既出スコア 67興味マッチ度 2
7

セルフホスト型のクラウド開発環境とAIコーディングエージェントのプラットフォーム。ワークスペースはTerraformで定義する。

記事の要約

ワークスペースはTerraformで定義し、EC2のVM、KubernetesのPod、Dockerコンテナなどを対象にできる。接続はWireGuardのトンネル経由で、使われていないワークスペースは自動的に停止する。

Coder Agentsは、AIコーディングエージェントのループを自前のインフラ上のコントロールプレーンで実行する構成を取る。そのためワークスペース側にAPIキーを置かずに済む、という点をREADMEは強調している。

リポジトリはセルフホスト型のクラウド開発環境とAIコーディングエージェントのためのプラットフォームと位置づけられており、開発者とそのエージェントの双方に安全な環境を与えることを掲げている。

開発環境github.com+402 stars today / 計15,610 / Go既出スコア 62興味マッチ度 2
8

職種ごとの仕事にClaudeを合わせるためのプラグイン集。Claude Cowork向けに作られ、Claude Codeでも動作する。

記事の要約

プラグインは、職種ごとに必要なスキル、コネクタ、スラッシュコマンド、サブエージェントをまとめたもので、その職種の人を手伝うための出発点を与える。自社のツールや用語、業務手順に合わせて調整することで効果が出る、という位置づけで説明されている。

公開されているのは、Anthropic自身の業務から生まれた11個のプラグインである。例えばproductivityはタスクやカレンダー、日々の進め方や個人の文脈を扱い、Slack、Notion、Asana、Linear、Jira、Monday、ClickUp、Microsoft 365のコネクタに対応する。salesは見込み客の調査、商談前の準備、パイプラインの確認、アウトリーチの下書きを担当する。

AI/開発github.com+281 stars today / 計25,118 / Python既出スコア 56興味マッチ度 2
9

スマートフォン、ウェアラブル、ロボット、スマートホーム、車載、マイコン向けの基盤モデル。2ビット量子化で8〜29MBの単一バイナリに収まる。

記事の要約

Needleは、汎用の対話能力を犠牲にする代わりに、端末上のツール呼び出しでは10倍の規模のモデルを上回り、抽出では2〜3倍の規模のモデルと並ぶことを狙っている。機能はツール呼び出し、構造化抽出、テキスト埋め込みの3つで、アプリが公開した関数の中から適切なものを選んで引数を埋め、該当するツールがなければ推測せず空のリストを返す。抽出では形を宣言すると型付きのフィールドが返り、デコードの文法が出力のパースを保証する。

Needle 3はLaddered Simple Attention Networkと呼ばれる構成で、FFNの代わりにMonarch Hadamard MLP、causal convを伴うGQAアテンション、gatherで読むengramのn-gramメモリ、多レーンのhyper-connectionsを持つ。2層から20層までのどの深さでも配備可能なモデルになるよう訓練されており、パラメータの大半がengramにあるため121Mのモデルが50M相当の演算量で動くとしている。

LLM/新モデルgithub.com+234 stars today / 計11,597 / Python既出スコア 51興味マッチ度 2
10

数十億から数兆パラメータのモデルを訓練するための、耐障害性を持つGPUオーケストレーションと機械学習フレームワーク。

記事の要約

Higgsfieldは、GPUのワークロード管理と機械学習フレームワークを兼ねる。役割は5つで、計算ノードへの排他的・非排他的なアクセスの割り当て、DeepSpeedのZeRO-3およびPyTorchのFSDPへの対応による兆パラメータ規模のシャーディング、割り当てたノード上での訓練の開始・実行・監視、実験のキューによる資源競合の管理、GitHubおよびGitHub Actionsとの連携による継続的インテグレーションである。

導入は pip install higgsfield==0.0.3 で、READMEにはそれだけで済む訓練の記述例が続く。多ノードでの訓練を苦労せずに行うことを掲げたプロジェクトである。

機械学習基盤github.com+196 stars today / 計4,948 / Jupyter Notebookスコア 46

Techmeme

10件9件
1

Trump says he will appoint an AI czar and form an “AI Force”, in a Truth Social post that rejects AI safety concerns as a “hoax”

AI担当官の任命と「AI部隊」の編成を表明した投稿を伝えるBloombergの報道。同じ投稿でAIの安全性をめぐる懸念を否定している。

AI/政策bloomberg.comコメントを見る(新しいタブで開く)スコア 100
2

Google says it didn't consider Gemini's hacks worthy of disclosure because Gemini acted “appropriately” and stopped after determining it hacked real companies

Geminiがテスト中に実在の企業へ侵入した件について、Googleが開示しなかった理由を説明した報道。侵入先が実在の企業だと判断した後にGeminiが停止したことを根拠に挙げている。

ハイライトAI/安全性theverge.comコメントを見る(新しいタブで開く)スコア 94興味マッチ度 3
3

Gemini hacked three companies in May during a test by Irregular, which was also involved in similar incidents disclosed by OpenAI, Anthropic, and Meta

評価を担当したIrregularのテスト中に、Geminiが5月に実在の3社へ侵入していたとするWall Street Journalの報道。同社はOpenAI、Anthropic、Metaが公表した同種の事例にも関わっている。

AI/安全性wsj.com既出コメントを見る(新しいタブで開く)スコア 87興味マッチ度 3
4

Former DraftKings employees detail how it uses ML to target likely losers with promotions, while efforts to flag problem gamblers were shelved or squashed

元従業員の証言をもとに、機械学習で損失を出しやすい利用者を選んで販促を送る運用と、問題のある利用者を検知する取り組みが進まなかった経緯を伝えるNew York Timesの記事。

AI/社会nytimes.comコメントを見る(新しいタブで開く)スコア 87興味マッチ度 2
5

Experts say AI kill-switch legislation is far harder to implement than lawmakers assume, warning a rogue AI could actively try to dismantle the mechanism itself

AIを停止させるキルスイッチの法制化について、実装の難しさを専門家に取材した記事。停止の仕組み自体をAIが無効化しようとする可能性が論点として挙がっている。はてなブックマークにもカリフォルニア州の検討を伝える記事が入っている。

AI/安全性nytimes.comコメントを見る(新しいタブで開く)スコア 86興味マッチ度 2
6

Internal email: Flock is rolling out a voluntary severance program; sources say a significant number of Flock's ~1,500 employees may depart, as customers flee

監視カメラ大手Flockが希望退職の制度を始めたことを社内メールから伝えるWiredの報道。顧客の離反が背景にあるとしている。

ビジネスwired.comコメントを見る(新しいタブで開く)スコア 76
7

A look at AI safety groups METR, Redwood Research, and Apollo Research, as AI misalignment incidents at OpenAI and Anthropic thrust them into the spotlight

OpenAIとAnthropicで起きたミスアラインメントの事例を受け、第三者として評価を担ってきたMETR、Redwood Research、Apollo Researchの現状を伝える記事。

AI/安全性theverge.comコメントを見る(新しいタブで開く)スコア 72興味マッチ度 2
8

Raindrop, which develops tech for monitoring AI agents to catch failures such as hallucinations and tool misuse, raised a $35M Series A led by CRV

AIエージェントの動作を監視し、幻覚やツールの誤用といった失敗を検知する技術を開発するRaindropが、CRV主導で3,500万ドルを調達した。

AI/開発axios.comコメントを見る(新しいタブで開く)スコア 72興味マッチ度 2
9

Sources: the USPTO and US Copyright Office were surprised by the DOJ's brief supporting OpenAI and Microsoft in their dispute with the New York Times

New York Timesとの訴訟でOpenAIとMicrosoftを支持する意見書を司法省が提出した件について、特許商標庁と著作権局が事前に把握していなかったと伝える報道。

AI/法規制axios.comコメントを見る(新しいタブで開く)スコア 69興味マッチ度 2
10

ING: India's software services exports have risen to ~5.2% of GDP from 3.3% before the pandemic, as AI pushes the country's IT industry toward higher-value work

INGの分析として、インドのソフトウェアサービス輸出がGDP比3.3%から約5.2%に伸びたことを伝える報道。AIによってIT産業がより付加価値の高い業務へ移りつつあるとしている。

ビジネスbloomberg.comコメントを見る(新しいタブで開く)スコア 62

日本

はてなブックマーク

10件9件
1

一部のAndroid端末では本体をリセットしてもおサイフケータイのデータが残るという仕様を取り上げたITmediaの記事。売却時に買取拒否や減額の対象になる点を問題として挙げている。

コメントの要約

記事は、一部のAndroid端末では通常の初期化を行ってもおサイフケータイのデータが消えず、専用の手順を踏まないと端末に残り続けると説明する。気づかないまま中古として売ると買取拒否や減額の対象になり、利用者が負担を負うことになるという指摘が中心にある。筆者自身も今後おサイフケータイを使うつもりはないという立場を明示している。

コメントでは、リセットしても情報が消えないことを知らなかったという反応が多く、「工場出荷状態とは」と仕様そのものを疑問視する声が出ている。FeliCa必須にすると端末選びに制限がかかるため、交通系は物理カード、決済はVisaのタッチ決済やQRで足りるという使い分けの報告もある。設計を作り込んだ側への批判も複数並んでいる。

モバイルitmedia.co.jp205 usersコメントを見る(新しいタブで開く)スコア 94
2

Codexの設定をconfig.tomlとAGENTS.mdに分けて整理した記事。config.tomlにはモデルや推論の強さなど実行時の条件を、AGENTS.mdには検証方法や作業上の制約を書くという役割分担を示す。

コメントの要約

記事は、Codexで設定を残す場所が主に2つあるとして、実行環境を決めるconfig.tomlと、仕事の進め方を決めるAGENTS.mdを対比する。役割は分かれているが、ファイルを置いただけでは意図どおりに働かない点を出発点にしている。

コメントでは、設定ファイルとプロンプト指示の分離がAIエージェントを使う上で重要だという同意がある一方、設定内容はCodex自身に聞いて決めているという報告も複数出ている。VS Code上では使いにくいという指摘や、fork_turnsの指定に触れる具体的なやり取りもある。

筆者自身もブックマークコメントで、「Codexを使うならXXを押さえておきたい」という共有の形式を作ったとして、今後Claude Codeとの違いを紹介していくと書いている。

ハイライトAI/開発syu-m-5151.hatenablog.com157 usersコメントを見る(新しいタブで開く)スコア 91興味マッチ度 3
3

JaSST'26 Niigataの講演資料。テスト計画、分析設計、実行、レポーティング、成果物レビュー、精度改善の6工程で、人が何を決め、何を渡し、何を確かめるかを整理している。

コメントの要約

資料は、AIにテストを任せる場面を6つの工程に分け、それぞれで人が担う判断を書き出す構成になっている。JaSST'26 Niigataでの講演に使われたものが公開されている。

コメントでは、人が担う部分とAIに任せる部分を分けようという主張は理解できるが、その分担基準が書かれていないという指摘が出ている。SIerが請負開発で積み上げてきた品質管理の再発明ではないか、コーディングの下請けへの委託を批判していた層がAIに任せた品質管理を論じ始めている、という趣旨の批判も並ぶ。

一方で、この内容がここまで揶揄される理由が分からないという反応や、任せ方を仕切れるならそれ自体が機会だという意見もある。

AI/開発speakerdeck.com105 usersコメントを見る(新しいタブで開く)スコア 86興味マッチ度 2
4

Claude Codeに公開されたClaude Modsの入門記事。TypeScriptの関数でClaude Codeの機能や見た目を変える仕組みを扱う。

コメントの要約

記事は、Claude CodeにClaude Modsという拡張の仕組みが公開されたとして、TypeScriptの関数を用いて機能や表示を変える方法を紹介している。内容はClaude Code Issue #91870で議論中の暫定仕様(2026年9月19日時点)に基づくもので、APIは今後変更される可能性があるため最新情報は公式サイトを参照するよう冒頭で断っている。

コメントは1件で、JavaScriptやTypeScriptのミドルウェアの感覚でClaude Codeを拡張できるのは面白そうだが、何でもできてしまうためセキュリティへの配慮を怠れない、という指摘が付いている。88ユーザーのブックマーク数に対して議論はまだ付いていない状態である。

AI/開発zenn.dev88 usersコメントを見る(新しいタブで開く)スコア 82興味マッチ度 3
5

TypeSafe AIのJevの入出力と用途をまとめた解説ページ。自然言語を読んだうえで「どれか」「どの程度か」「YesかNoか」を型のある値と確率で返す仕様を整理している。

コメントの要約

ページは、Jevがテキストを生成しないため返り値のパースやリトライが不要で、返ってきた値をそのままif文や並べ替え、しきい値判定に使えるという点を軸に構成を説明している。

コメントでは、生成AIが書いた文章の特徴を指摘する声が目立つ。「AではなくB」の対比構文、各項目の長さや構造の均一さ、「に集約される」「という落とし穴」といった定型的な見出し表現、見出しの上に英字の小ラベルを置く体裁が根拠として挙げられている。図解と題しながら図が数点しか見当たらないという指摘もある。

一方で、重たい処理の事前スクリーニングに仕込むのが手早いという使いどころの感想や、待ち望んでいたものだという反応も出ている。

AI/開発jev-guide.take-otani.workers.dev144 usersコメントを見る(新しいタブで開く)スコア 79興味マッチ度 3
6

東プレのREALFORCEシリーズに左右分割型の「REALFORCE RS1」が加わった。79キーの日本語配列で有線接続。2026年9月19日時点ではヨドバシ.comとビックカメラ.comに商品ページが掲載され、REALFORCE公式サイトでの案内は出ていない。

ガジェットtalpkeyboard.com83 usersコメントを見る(新しいタブで開く)スコア 78
7

日本トレカセンターが約200名の全社員にAIエージェントのOpenCodeを配り、そのリクエストを自前でホストしたLiteLLMゲートウェイに通している事例。使うモデルは会社側で制御している。

コメントの要約

記事は、全社員が使うAIの入り口を1つにまとめた構成を紹介する。社員の手元にはOpenCodeを配り、リクエストは自前ホストのLiteLLMを経由させ、利用できるモデルを会社側で決める形になっている。

コメントは評価が割れている。LiteLLMでBYOK形式の社内キー利用を一元管理できる点や、SSOの自作、予算枠を週次で絞る運用の泥臭さを参考になると評価する声がある一方、週次の利用制限があって好きなエージェントを使えない環境では働きたくない、エンジニアリングに金をかけない会社という印象が強まる、という否定的な反応も並ぶ。

特定のエージェントにロックインされないこと自体は妥当だという意見も出ている。

AI/開発zenn.dev88 users既出コメントを見る(新しいタブで開く)スコア 77興味マッチ度 3
8

DRAMとNANDの価格暴騰により2026年の半導体市場が当初の想定を超えて拡大し続けているとする連載コラム。

コメントの要約

コラムは、DRAMとNANDの価格暴騰が市場規模の予測を押し上げ、2026年の半導体市場が当初の想定を超える急激な膨張を続けていると整理している。福田昭による半導体業界の連載の1本である。

コメントでは、半導体を買う側の企業の売上が同じように伸びているわけではないため、どこかで逆回転するという見方が多い。AI需要を見た強気の設備投資が一斉に竣工すれば増産で暴落する、メモリ各社が生産調整をしなければ3年後あたりが転換点になる、といった予想が並ぶ。

一方で、増強した設備が稼働するまで1年は動かないという見立てや、価格が落ち着いても元の水準には戻らないという予測、データセンターが計算資源を奪い続ける構図は変わらないという指摘も出ている。

ハードウェアpc.watch.impress.co.jp65 usersコメントを見る(新しいタブで開く)スコア 76
9

AIとの対話だけでアプリを作る「バイブコーディング」をNHKが取り上げたニュース。隙間時間に遊べるゲームなど、個人が思いついたものを形にする動きを紹介している。

コメントの要約

記事は、頭に浮かんだアイデアをAIとの対話だけでアプリにできるバイブコーディングが広がっているとして、隙間時間に遊べるゲームなど一般の利用者が自作したものを例に挙げている。プログラミングの経験がない人が作り手に回る動きとして紹介する構成である。

コメントでは、実際に自分でも作ってみたという報告や「世は大自作アプリ時代」という反応が出る一方、作ったアプリの責任は作った側が負うべきだという指摘、技術的負債にならないことを祈るという声もある。別のAIにレビューさせているという運用の報告もある。

かつてCASEツールによるプログラム自動化が夢として語られていた時期と重ねる意見や、数年前は誰もやっていなかったのだから懸念されている点も早く解決されるだろう、という見方も並ぶ。

AI/社会news.web.nhk62 usersコメントを見る(新しいタブで開く)スコア 73興味マッチ度 2
10

ServerlessDays Tokyoの講演資料。サーバーレスは平常時に安定して動くため自分のワークロードの壊れ方を練習する機会が少ない、という問題意識からインシデント対応の訓練を扱う。

コメントの要約

資料は、サーバーレスは平常時にマネージドサービスに支えられて安定して動くため、自分のワークロードの壊れ方を練習する機会がほとんど持てないという問題意識から始まる。CI/CDにスキャンを入れても検出結果が放置されている、最小権限が掛け声で終わっている、といった状態を挙げたうえで、認証情報の流出からLambdaの権限を経由して管理者権限に至る流れを訓練の題材として示す。

コメントでは前提への疑問が多い。公開されたS3に認証情報を置くという設定が分からない、アクセスキーを奪われた後の話は理解できるがLambdaからIAMにアクセスできれば何でもできるようになるという説明が腑に落ちない、といった指摘が並ぶ。

また、情報の強弱がなく単体で読ませる資料としては読みづらい、AI特有の言い回しが多いという体裁への批判も複数出ている。

セキュリティspeakerdeck.com61 usersコメントを見る(新しいタブで開く)スコア 70興味マッチ度 2

Zenn

10件0件
1

Jevをひと晩試した記録。チェス対戦、MOBA風ゲームのリアルタイム操作、eslintのエミュレーション、Playwrightによるブラウザ操作を実験し、実験ログをjev-playgroundとして公開している。

記事の要約

実験ではチェスでClaude 5 Sonnetに5戦全勝し、MOBA風ゲームではスプリットプッシュやタワーダイブのような戦術が観察された一方、集団戦で誰がタンクするかの協調ができない場面もあったとしている。実装抜きにルール名とコードだけでLintの結果を答えさせる試験は正答率86%、Playwrightでのフォーム操作は単独ではエラーから復旧できず、Claudeにログを監視させて補助すると96%以上になった。

コスト面では、MOBA風ゲームを1戦させて$0.0001、出力は無料。1リクエストの応答は約500msで、モデル単体の性能が高いわけではなく真価は並列度にあり、256個の質問を同時に投げて同時にスコアを得られる点を挙げる。confidenceは0.96以上でほぼ確信、0.4以下は誤っている可能性が高いため、その場合は別のモデルにフォールバックする設計を勧めている。

AI/開発zenn.devいいね375 / ブクマ93既出スコア 89興味マッチ度 3
2

macOS常駐のAIアシスタントをバイブコーディングで作る中で、画面同士が互いの表示を直接操作して不具合が積み上がった経緯と、その対策として渡すプロンプト。

記事の要約

不具合は3つ挙げられている。キーを素早く連続して押すと画面を消す処理と新しく出す処理がぶつかり入力を受け付けなくなる、取り消しキーを押しても別の画面が処理の権利を握ったままで内部が選択中のまま残る、送信中に再度呼び出すと表示されるべき画面が出ない、というもの。原因は各画面が自分で表示・非表示を決め、隣の画面を直接操作していたことにあるとする。

対策として記事が示すのは、すべてのコンポーネントをRootからなる階層構造下に置き、各コンポーネントはMVPパターンのPassive Viewとして描画に関わるパラメータだけを操作し、動作はChain of Responsibilityでイベントをバブリングさせ、ステートマシンとして振る舞うMediatorに裁定させる、という指示をそのままAIに伝える形である。

AI/開発zenn.devいいね210 / ブクマ110既出スコア 81興味マッチ度 3
3

Jevの高速性が既存のLLMでも再現できるのではないかという疑問から、回答候補を単一トークンに割り当ててlogitだけを見る方式をGemma3 270Mで検証した記事。

記事の要約

記事は、出力候補があらかじめ決まっている場合はJSON全体を自己回帰生成する必要がないと指摘する。trueとfalse、あるいはA/B/Cのような短いIDを単一トークンに対応させ、回答位置のlogitだけを比較すれば1回のforward passで判断を取り出せる。複数の独立した質問はbatch推論でまとめ、長い共通プロンプトはKV Cacheを再利用し、最終的なJSONはコード側で組み立てる構成になる。

Gemma3 270Mでこの並列推論方式とJSON出力を比較したところ、77倍の高速化になったとし、LLMとの比較はこの方式に対して行わなければ公平とは言えないと述べる。JevでDOOMをリアルタイムに操作するデモについては、Jevが画像入力に対応していないため、ゲーム状態を構造化データに変換するハーネスを介していると推測している。

AI/開発zenn.devいいね156 / ブクマ34既出スコア 79興味マッチ度 3
4

Jevをエージェントのガードレールに使う構成を紹介した記事。イベントでの画面表示とSoftware Design 2026年10月号の宣伝を兼ねている。

記事の要約

記事は、Jevを状態と質問を受け取って型付きの回答を確率とともに返すモデルと説明し、提供元のTypeSafe AIがこの種類をSystem One Modelと呼んでいることに触れる。注目されている理由として、用途は限定されるが入力がGPT 5.6 Lunaより約8割安く出力が無料であること、汎用分類器として超高速に使えるif文のように扱えること、APIなので組み合わせの幅が広いことを挙げる。

利用経路は、TypeSafe AIのwaitlist(筆者は9月17日18時に登録し28時に到達)のほか、Vercel AI GatewayとCloudflareでもホストされている。Skillsのように失敗箇所を後から足していく確率的な最適化は局所最適になりやすく、3か月後の新モデルでは負債になりがちだとして、決定論的なガードレールを作りたい需要にJevを当てる構成を示している。

AI/開発zenn.devいいね99 / ブクマ39既出スコア 78興味マッチ度 3
5

自社CMSのデザインエディターにWebMCPを組み込んだ実験の記録。本来は人間が操作するGUIツールをAIエージェントから呼べるようにしている。

記事の要約

WebMCPは、Webページ側がAI向けの操作をブラウザ上に直接提供する仕組みで、サーバーではなくフロントエンドにツールを登録する。エージェント側に特別な認証設定が要らずブラウザのログイン状態をそのまま使えること、サーバーに保存される前の未保存データもJavaScript経由で操作できることを利点として挙げる。

定義方法は、フォーム要素にtoolnameなどの属性を付ける宣言型と、document.modelContext.registerToolで動的に登録する命令型の2種類がある。対象のデザインエディターはReact製のため命令型を採用した。検証にはCodexのブラウザ操作(GPT-6 Astra、Effortは中)を使っている。

2026年9月時点でW3Cのコミュニティグループで議論中の提案仕様で、Chromeではフラグ付きプレビューとオリジントライアルの段階、navigator.modelContextからdocument.modelContextへの変更など仕様変更が続いていると注記している。

フロントエンドzenn.devいいね99 / ブクマ49既出スコア 76興味マッチ度 3
6

17万行のプロダクトでコードレビューにもトークンを消費する状況を避けるため、GeForce 3060(12GB)上のOllamaでqwen2.5-coder:14bを動かしてレビューさせた記録。

記事の要約

筆者はClaude Code、Codex、Agyの3エージェントを併用しており、生成されたコードを人手でレビューすることが実質不可能な規模になっていた。Issue単位でブランチを切り、規模が大きければスライスに区切って小さく実装を回す進め方を取っている。

ローカル側は、temperature 0.05、top_p 0.8、num_ctx 8192のModelfileでqwen2.5-coder:14bから自分用モデルを作り、gitのステージに上がった差分から重大な問題候補だけを挙げさせる。検出対象はデータ損失、クラッシュ、セキュリティ境界の破壊、path traversal、Electron IPC境界の破壊、race condition、off-by-oneなどに限定し、コーディングスタイルや命名の好み、要約や褒め言葉は出力しないよう指示する。出力はJSON配列のみで、問題がなければ空配列を返させている。

AI/開発zenn.devいいね78 / ブクマ44既出スコア 71興味マッチ度 3
7

ルールベースの五目並べを実装してJev同士に対戦させ、遅延とログを実測した記録。実装はjev-gomokuとして公開されている。

記事の要約

記事は、Jevが単に速いモデルではなく、意図的に出力を限定することで精度と速度を得る最適化を行っていると整理する。現時点でできるのはNoul(YES/NOを答える)、Choice(選択肢から選ぶ)、Score(点数を付ける)の3つで、チャットAIと違っていかに構造の制約を設計するかが要点になるとしている。

実装では、15×15の盤面をアスキーで表現し、ルール、セルの表記法、直近の手、各候補の状況を示すヒント(自分の最善の並びが開いた端を持つ3つ、相手の五を防ぐ、など)をstateとcriteriaに入れ、choice型で次の一手を選ばせている。プログラマは既存のチャットアシスタントよりこうした構造化されたエージェントの方を好むのではないか、という感想を添えている。

AI/開発zenn.devいいね84 / ブクマ7既出スコア 68興味マッチ度 3
8

GitHub Issueの把握からブランチ作成、実装、動作確認、レビュー、PR作成までの一連の流れをClaude Codeのスキルにまとめた記録。

記事の要約

前提としてGitHubでIssue管理を行い、Claude Codeを主、Codexを従とする構成を取る。Claude Codeが設計と実装のほかGitHub・Codex・人間とのやり取りを担い、Codexはレビューのみを行う。レビューは、先入観なく見てもらうよう気をつけたうえでCodexと人間によるクロスレビューにしており、人間側はcritを使っている。

スキルは複数の会社のプロダクトから呼べるよう、リポジトリではなく ~/.claude/skills/ にユーザーレベルで配置している。名前はtodays-workで、disable-model-invocation: true を付けて /todays-work で明示的に呼んだときだけ動くようにし、引数にIssue番号またはURLを取る。空なら聞き返す。名前は語呂で付けただけで、複数日かかってもよいと断っている。

AI/開発zenn.devいいね61 / ブクマ27既出スコア 66興味マッチ度 3
9

PKSHA VoiceAgentのSREが1人・約1か月で構築したデータ分析基盤「Laplace」の設計記録。構築開始から利用者への開放まで1か月、そこから2か月運用している。

記事の要約

以前はRedashからAuroraのリードレプリカに直接SQLを投げる構成で、最大約2.5TBのログテーブルに対して重いクエリが返らない、ビジネスメンバーが知りたいことを都度エンジニアに依頼する必要がある、PIIを含むテーブルと含まないテーブルを分けて権限設定できず安全側に倒すしかない、という3つの課題があった。

新基盤では、dbtのschema.ymlを唯一の定義源とするセマンティックレイヤーをLightdashで構築し、そのAPIを包むMCPサーバを用意してAIクライアントから自然言語で同じ指標を引けるようにした。権限境界はBI層に置き、PIIの列は専用テーブルに隔離してuser_attributesを持つ人だけに見せる。

SQLを含めほぼ全てのコードはClaude Codeが書き、OSSのLightdashをセルフホストしたためBIやDWHのライセンス費はなく、運用はクラウド利用料の月1,200ドル前後としている。

データ基盤zenn.devいいね53 / ブクマ24既出スコア 63興味マッチ度 2
10

React 19.3で追加されたFragment Refsを使い、自身は何も描画せず内部の要素にdisplay: noneを与えるコンポーネントを実装する方法。

記事の要約

Fragment Refsは、Fragmentコンポーネントがrefをサポートするようになる機能で、得られるのはReactが用意したFragmentInstanceオブジェクトである。addEventListenerやfocusなどのメソッドを持ち、DOM要素を描画しないラッパーに対して疑似的に操作しているかのように振る舞う。

背景にあるのはReact 19.2で導入されたActivityコンポーネントで、mode="hidden"のときは自身では何も描画せず、中のDOM要素にdisplay: noneを与えて非表示を実現する。同じ挙動のコンポーネントを自作することは従来できなかった。

記事は、React 19.3時点でFragmentInstanceが持つメソッド(addEventListener、dispatchEvent、focus、observeUsing、getClientRects、compareDocumentPositionなど)を確認したうえで、Hiddenコンポーネントの実装に入る。

フロントエンドzenn.devいいね40 / ブクマ6既出スコア 60興味マッチ度 2

すべて既出

Qiita

10件5件
1

AI活用の差は使っているかどうかではなく、仕事を「一部だけ任せる」と考えるか「全部任せられないか」から考えるかにある、という主張の記事。

記事の要約

記事は、仕事が1から10まであるとして、「この作業だけは任せられそうだ」と考える進め方では1しか変わらず、残りは従来のままになると指摘する。対して「1から10まで全部任せられないか」から考え始めると、想定よりも多くの部分を任せられることに気づくとしている。答えのない判断や戦略を考える仕事は最終的に自分の頭で考えるとも書く。

筆者自身の実践として、会議で議論が行き詰まったら「5分AIタイムです」と言ってその場でAIに壁打ちすることを挙げる。世界で一番優秀な相談役として使わない手はない、という評価である。また、状況の説明をタイピングすると1時間かかる分量でも音声入力なら一瞬で済むとして、GPTやClaudeの音声認識を常用しているとも書いている。全部を丸投げしてよいわけではなく、自分も全部できているわけではないとも断っている。

キャリアqiita.comLGTM50 / ストック16既出スコア 86興味マッチ度 2
2

Jevと従来のLLM+AIエージェントの違いを、Amazon Bedrock AgentCoreを比較対象に置いて整理した記事。

記事の要約

TypeSafe AIは2026年9月15日、同社がSystem One Modelと呼ぶモデルの最初の公開モデルとしてJevを発表した。System Oneの名称は、ダニエル・カーネマンが説明した素早く直感的に判断する「システム1」に由来し、Jevの名は効率改善に伴って資源の利用が拡大する現象で知られる経済学者ウィリアム・スタンレー・ジェヴォンズにちなむ。

記事は、二重請求の返金を求める顧客メールを例に両者を比べる。従来のLLM+AIエージェントでは、メールや対応履歴、利用可能なツール、返金規程を渡し、LLMが処理の進め方を文章として返す。対してJevは、分類・採点・条件判定の結果を型付きの値と確率で返し、非AIエージェントのアプリケーション側が条件を判定して処理を分岐する、という違いになるとしている。

AI/開発qiita.comLGTM181 / ストック79既出スコア 84興味マッチ度 3
3

Jevの入出力、問いの型、公称の速度と料金を整理し、記述式とマークシートのたとえで従来のLLMとの違いを説明した記事。

記事の要約

状況を表すテキストやJSON(state)と型付きの問い(questions)を渡すと、選択肢ごとの確率と確信度が返り、文章は生成されない。問いの型はChoice(選択肢から1つ)、Score(段階評価)、Noul(Yes/Noの確率)の3種類で、複数の問いを1回の呼び出しで並列に評価する。公称値は応答70〜500ミリ秒、入力100万トークンあたり0.042ドル、出力は無料。文章の生成、計算、日付の比較は公式が不得意と明記している。

たとえとして、LLMにJSONを書かせるのは記述式の答案に近く、モデルが1トークンずつ書いた答案をプログラム側が形式から確かめる必要がある。Jevはマークシートに近く、出題側が選択肢を用意し、どの欄をどれくらいの確からしさで塗るかを1回の計算で返すため、用意していない選択肢が答えに出てくることもないとしている。

AI/開発qiita.comLGTM40 / ストック13既出スコア 82興味マッチ度 3
4

Claude Code 2.1.277のAGENTS.md対応を、各ファイルに合言葉を仕込む方法で6通りの構成について検証した記事。

記事の要約

2.1.277(2026-09-18)のchangelogには、CLAUDE.mdのないプロジェクトではAGENTS.mdを読み、/configの「Project instructions」で変更できる(Bedrock、Vertex、Foundryでは未対応)と書かれている。筆者は、検索して出てくる日本語の解説が「読まない」と書いているが、それは2.1.277より前の話だと指摘する。

検証はWindows 10に隔離導入した2.1.277で claude -p を使い、各ファイルに一意な合言葉を入れて「指示にある合言葉を全部挙げろ」と頼む方法で行った。ファイルを読むツールは全て禁止し、捨て設定ディレクトリで回している。

結果は6通りとも公式の表どおりで、AGENTS.mdだけならAGENTS.mdとユーザー階層が読まれ、CLAUDE.mdを併置するとAGENTS.mdは読まれず、CLAUDE.local.mdを1つ置いても読まれなくなる。加えて、1回目のセッションだけは読まれなかったとしている。

ハイライトAI/開発qiita.comLGTM17 / ストック15スコア 81興味マッチ度 3
5

社外コミュニティの運営を降りようと考えていた経緯と、続けることにした転機を書いた記事。

記事の要約

筆者はCopilotを学ぶ「なんでもCopilot」、AWSユーザーグループの「JAWS-UG Sales」、Snowflakeの初歩を学ぶ「雪かき部」の運営メンバーである。やめようと思った理由として、仕事の繁忙、プライベートのゴタゴタ、心ない言葉、そして運営なのに技術に詳しくないことから来る存在価値への悩みの4つを挙げ、1つずつなら何とも思わなかったものが同時期に重なったと書いている。

転機は「なんでもCopilot」の他の運営メンバーとの飲み会で、悩みを打ち明けたわけではないが全員から「遠慮せずやりたいことをやって欲しい」と言われたこと。以降は投影資料の更新やSNSでの盛り上げ、オフライン開催時の交流促進、営業ならではの視点を入れたアウトプットに取り組んでいる。

キャリアqiita.comLGTM32 / ストック2スコア 79興味マッチ度 2
6

Figmaの同時編集における同期と競合解決の設計を、Figma公式ブログを一次情報として読み解いた記事。

記事の要約

きっかけは、Figma・Notion・Googleスプレッドシートで同時編集を比べたときに画面への反映のされ方が違うと気づいたこと。記事は体感差そのものを厳密に説明するのではなく、背景にある同期と競合解決の設計に焦点を当てると断っている。描画やレンダリングの最適化は扱わない。

挙げられている工夫は4つで、サーバー到着順を利用したLWW register相当のプロパティ同期、楽観的更新とそれによって生じるチラつきを防ぐ一手間、循環参照というエッジケースを一時的な割り切りで吸収する設計判断、Fractional Indexingによる挿入コストの低い兄弟順序管理である。OTやCRDTを名前だけ知っていて実際の設計判断に興味がある読者を対象に挙げている。

フロントエンドqiita.comLGTM13 / ストック8既出スコア 73興味マッチ度 2
7

サーバーを持つWebサービスがGoogleをIDプロバイダとして使うOpenID Connectの認可コードフローを、何が渡っているかという観点で整理した記事。

記事の要約

結論として、Googleはサービスにパスワードやパスキーを渡さず、それらはGoogleの画面にだけ入力される。サービスが受け取るのはまず使い捨ての認可コードで、裏側でそれをIDトークンとアクセストークンに交換する。ログインの根拠になるのはIDトークンで、アクセストークンはGoogleのAPIを呼ぶための券であり、ログインの証明には使えないと整理している。

OAuth 2.0は権限を委譲する仕組みであって認証の仕組みではなく、ログインに使えるようにしたのがOpenID Connectだという区別も置く。Google Identity Servicesの埋め込みボタンによる認証だけのフローでは、IDトークンが直接返り認可コードとアクセストークンが登場しないため、その部分を省略して読むよう補足している。執筆時点は2026年9月で、OAuth 2.1はIETFのドラフト段階と明記している。

セキュリティqiita.comLGTM5 / ストック6スコア 69興味マッチ度 2
8

スパム判定や問い合わせの振り分けのように回答文が要らない処理を想定し、日本語で12項目をまとめてJevに判定させた記録。

記事の要約

Jevは2026年9月15日にTypeSafe AIが発表したモデルで、同社はこの種類をSystem One Modelと呼ぶ。自然言語の入力を読んで判断するが返信文やコードは生成しない。返り値はChoice(決めた候補のどれか、候補ごとの確率とConfidence)、Score(定義した段階でどの程度か)、Noul(条件に当てはまるかをYesの確率を表す0〜1の値で返す。別のConfidenceフィールドはない)の3種類である。

日本語12項目の一括判定では、Playgroundの時間表示が96ms + 212msだった。ただし2つの時間の内訳は未確認で、通信を含めて手元で測った値ではないと注記している。筆者の関心は速度よりも、普通のLLMにJSONを返させるのと何が違うのかという点にあると書いている。

AI/開発qiita.comLGTM6 / ストック7スコア 68興味マッチ度 3
9

公式ドキュメントとcookbookの記載だけを前半でまとめ、後半で向いている使いどころとシステム運用への当てはめを検討した記事。手元での動作確認はしていないと明記している。

記事の要約

前提として、情報は2026年9月18日時点、提供状況は早期アクセス(ウェイトリスト)、提供形態はAPIのみでVPCやオンプレミスの記載はないと整理する。本文中の数字もすべてドキュメントの記載であり筆者が測ったものではないと断っている。

入出力は、問い合わせの文章をstateとして渡し、聞きたいことをquestionsに型付きで書く形である。記事が示すリクエスト例では、Stripeアカウントの接続が3日間失敗しているという問い合わせに対し、担当チームをbilling / technical / salesから選ばせるchoiceと、顧客がどの程度苛立っているかを段階で評価させるscoreを同時に問うている。

AI/開発qiita.comLGTM11 / ストック2既出スコア 63興味マッチ度 3
10

SMSと認証アプリの違いを、RFC 6238をPythonで実装しながら整理した記事。海外で現地SIMに差し替えて銀行アプリにログインできなかった経験が出発点になっている。

記事の要約

認証アプリの6桁は、登録時に共有した秘密の値と現在時刻からスマホの中だけで計算しており、通信していない。SMSが弱いと言われるのは電話番号という乗っ取れる経路に依存するためで、SIMスワップ、番号の再発行、中継フィッシングが挙げられている。

認証アプリはSIMスワップには強いが中継フィッシングには負け、正しい6桁を偽サイトに打てば終わる。パスキーが違うのは、どのサイトに対する応答かが署名に含まれる点だと整理している。

参照はRFC 6238、RFC 4226、NIST SP 800-63Bで、電話網を使う認証を「制限付き」とする扱いは第3版から続いているものだと注記する。コードはPython 3.10以上の標準ライブラリのみを使い、20行足らずでGoogle Authenticatorと同じ数字が出たとしている。

セキュリティqiita.comLGTM4 / ストック6スコア 62興味マッチ度 2